Kimi K3 开源发布,2.8T MoE 登顶 Agent Arena

Kimi K3 开源发布,2.8T MoE 登顶 Agent Arena

1. Moonshot 发布 Kimi K3:2.8T MoE 开放权重,配套完整技术栈

7 月 27 日,Moonshot AI 正式发布 Kimi K3 的模型权重和技术报告——这是当日最重大的事件。Kimi K3 是一个 2.8T 参数的 MoE 模型,拥有 104B 激活参数896 个专家(每 token 激活 16 个)1M token 上下文窗口,并支持原生视觉理解。相较于前代 K2,K3 实现了 约 2.5 倍的单位算力智能效率提升

Releasing the model weights and technical report of Kimi K3. Kimi K3 is our most capable model: a 2.8T MoE model with native visual understanding and a 1M-token context window. New model architecture: 2.5x the intelligence per unit of compute, not just more params. Alongside Kimi K3, we're opening up more of the stack behind it — high-performance attention kernels, MoE communication library, and infrastructure for running agent environments at scale.
— @Kimi_Moonshot

发布 Kimi K3 模型权重和技术报告。Kimi K3 是我们最强的模型:2.8T MoE,原生视觉理解,1M token 上下文窗口。全新架构实现了 2.5 倍的单位算力智能提升,而不仅是更多参数。同时我们还开源了背后的高性能注意力内核、MoE 通信库和大规模 Agent 环境基础设施。

与众不同的是,这不仅是模型权重发布,更是一个完整的技术栈开源:Moonshot 同步开源了 FlashKDA(Kimi Delta Attention 内核)、MoonEP(MoE 专家并行通信库)和 AgentENV(分布式 Agent 环境基础设施)。技术报告声称训练效率较 K2 提升约 2.5 倍,采用 MXFP4 权重格式和 MXFP8 激活格式以确保极端规模下的数值稳定性,并从头联合训练了视觉编码器。

授权方面,K3 是"开放权重"而非 OSI 标准开源:年收入超 $20M 的大型托管商需单独协议,月活超 1 亿或月收入超 $20M 的产品须在 UI 中标注"Kimi K3"。发布当天即获 vLLM、Baseten、Modal、Fireworks、Together、Ollama Cloud、Cursor、Devin 等十余家平台支持。

2. NVIDIA 成立 Open Secure AI Alliance,Jensen Huang 亲自站台

NVIDIA 创始人 Jensen Huang 宣布成立 Open Secure AI Alliance,核心理念是:攻击者已拥有前沿 AI,防御者需要一个由最好的开源和闭源模型组成的生态系统。

Attackers have frontier AI. Defenders need a frontier AI ecosystem—the best open and closed models, force-multiplied by a global community. During the Hugging Face incident, closed AI blocked essential forensics. An open-weight frontier model helped contain the intrusion. That's why we created the Open Secure AI Alliance.
— @JensenHuang

攻击者已经拥有前沿 AI。防御者需要一个前沿 AI 生态系统——最好的开源和闭源模型,再乘以全球社区的力量。在 Hugging Face 安全事件中,闭源 AI 阻断了关键取证,而一个开放权重的前沿模型帮助遏制了入侵。这就是我们创立 Open Secure AI Alliance 的原因。

联盟初创成员包括 Hugging Face、LangChain、Nous Research、Microsoft、IBM、Cloudflare、Cisco、Red Hat、Salesforce 等。值得注意的是,OpenAI 内部决定不加入该联盟,据称引发了员工反弹。Huang 特别提及了 Hugging Face 安全事件:开放模型帮助了入侵遏制和取证,闭源模型则成了障碍——这成为联盟成立的直接动因。

3. SSI × NVIDIA 战略合作:Ilya Sutskever 宣布 10 倍扩算

Ilya Sutskever 的 Safe Superintelligence(SSI)宣布与 NVIDIA 建立长期战略合作伙伴关系,NVIDIA 将进行"重大投资",使 SSI 在未来 12 个月内算力扩大 10 倍

Time to scale that SSI:
— @ilyasut

是时候扩展 SSI 了。

SSI 官方声明称:"我们的研究已经达到值得规模化的阶段,有了这次合作我们将能够实现。"Ilya 随后发帖指向 Vera Rubin 架构——NVIDIA 的下一代 GPU。社区分析认为,SSI 此前已有充足算力,此次合作可能更多指向产品化服务(需要真实用户数据和反馈回路),而不仅是训练扩容。SSI 至今未披露任何模型架构、产品或发布计划,极度不透明。

4. Kimi K3 评测炸裂:Agent Arena 开源第一,Cognition 称为"接近前沿"

K3 的早期评测表现强劲。在 Agent Arena 上,Kimi K3 Max 在开源模型中排名第一,净提升 +9.75%,超越 GLM-5.2 Max(+7.12%),在 5 个信号维度上均排名第一。

Big update: Among open-weight models, Kimi K3 (Max) is #1 in the Agent Arena with +9.75% net-improvement, surpassing GLM-5.2 (Max) at +7.12%, and landed the #1 spot across 5 signals. Kimi K3 (Max) is also now #1 in open-weight in the Frontend Code (1682 pts) and Text (1485 pts) Arenas.
— @arena

重大更新:在开源模型中,Kimi K3 Max 以 +9.75% 净提升排名 Agent Arena 第一,超越 GLM-5.2 Max 的 +7.12%,并在 5 个信号维度上全部第一。K3 Max 在 Frontend Code Arena(1682 分)和 Text Arena(1485 分)中也排名开源第一。

Cognition 的评估更具体:在 FrontierCode 1.1 Extended(真实工程任务基准,评估合并性和代码质量)上,K3 取得 58.2% 分数和 63.6% pass rate

On FrontierCode 1.1 Extended, our benchmark for real-world engineering tasks that grades mergeability and quality, Kimi K3 scores 58.2% with a 63.6% pass rate. Within Devin, it excels on reproducing bugs and managing its environment effectively.
— @cognition

在 FrontierCode 1.1 Extended(我们的真实工程任务基准,评估合并性和代码质量)上,Kimi K3 取得 58.2% 分数和 63.6% 通过率。在 Devin 中,它在复现 bug 和管理环境方面表现尤为出色。

Cognition 称 K3 是他们测试过的第一个"接近前沿水平"的开源模型,超越 GPT-5.5,仅次于最前沿模型。

5. Anthropic 终于表态:支持芯片管制、反蒸馏,但"从未主张禁止开放权重"

在因未签署 NVIDIA 开放权重信函而遭持续批评后,Anthropic 发布了正式立场声明。

There's been a lot of speculation about where we stand on open-weights models. We've outlined our views in full here:
— @AnthropicAI

关于我们对开放权重模型的立场有很多猜测。我们已在此完整阐述我们的观点。

Anthropic 称其"从未主张禁止开放权重模型",但支持:对中国的芯片管制、反工业级蒸馏措施、以及针对所有足够强大模型(无论开闭源)的强制性安全测试。社区反应两极分化:有人认为是合理澄清,也有人认为 Anthropic 仍在试图减缓前沿扩散速度。与此同时,有报道称美国政府可能要求前沿系统在发布前提供最长 30 天的预先审查期(由 NSA 和 CAISI 等机构评估),前沿模型发布正从产品发布演变为治理接口。

6. Claude Opus 5 评测割裂:基准登顶 vs 实际体验不佳

Claude Opus 5 在 Arena 排行榜上表现亮眼——Frontend Code Arena 和 Text Arena(开启事实性模式)均排名第一,WeirdML 评测中 Opus 5 high/max 分别取得 91.6%/91.8%。但在实际使用中,多位开发者报告了严重问题:过度复杂化、代码频繁崩溃、停止行为异常。@abacaj、@davis7、@Teknium、@theo 等开发者均反映了类似困惑。这再次说明公开评测得分与特定生产环境中的实际产出能力正在背离。

在 MineBench.ai 的 Minecraft-like 3D 构建基准中,Opus 5 结构质量更高但效率远差于 Fable 5:平均推理时间 1930s vs 1084s(+78%),总成本 $89.97 vs $54.93(+64%),15 次构建中 12/37 次因无效 JSON 而失败,主要原因是内部 CoT 过长导致超出输出上限。

7. Claude 共享链接被搜索引擎索引,大量对话和 Artifact 暴露

社区发现通过 Google dork 查询(site:claude.ai/share)可以搜索到大量 Claude 公开分享的对话页面,而通过 site:claude.ai/public/artifacts 则能检索到包含演示文稿、日历、新闻稿等内容的公开 Artifact。技术上看,这并非安全漏洞——用户主动点击"分享"后页面确实变为公开访问,但搜索引擎的索引导致这些本应"仅对持有链接者可见"的内容被大范围暴露。Bing 索引的覆盖面似乎比 Google 更广。这一问题与 ChatGPT 共享链接此前被索引的事件如出一辙,核心教训是"分享链接即公开资源",除非设置 noindex 或认证保护。

8. OpenAI 和 Anthropic 被曝游说限制开源模型,硅谷开源之战升级

据《纽约时报》报道,OpenAI 和 Anthropic 一直在游说美国监管机构限制开源/开放权重 AI 模型——尤其是来自 Z.ai 和 Moonshot AI 等中国公司的接近前沿水平的模型,理由包括知识产权盗窃、蒸馏、安全和国家安全风险。而 NVIDIA、Microsoft、Meta、Google、IBM、Hugging Face 等组成的对立阵营则主张开放模型对竞争审计、芯片需求和安全防护至关重要。据报道,美国官员更倾向于针对特定中国公司/模型采取行动,而非全面禁止。

Hugging Face CEO Clem Delangue 公开要求 OpenAI 释放在 Hugging Face"首个自主 Agent 网络攻击"事件中的执行轨迹和日志,并请求 $1 亿算力支持以帮助社区构建网络防御系统,但社区普遍认为这一要求不现实。

9. AMD 发布 Instella-MoE:首个完全开源的 MoE 语言模型

AMD 发布了 Instella-MoE,其首个完全开源的 MoE 语言模型:16B 总参数 / 2.8B 激活参数,在 MI300X/MI325X 上训练。与常规模型发布不同,AMD 发布了从预训练到 RL 的全流程 Checkpoint,以及配置、数据配比和代码。16B/2.8B 的规格使模型能够在消费级和工作站级硬件上部署,与 Kimi K3 的 2.8T 形成鲜明对比——一个强调可复现的完整研究工件,一个代表前沿开源能力的上限。

10. Coding Harness 效率对比:Pi 最快,Claude Code 最慢但过度探索

一项以 DeepSeek V4 Flash(vLLM ~180 tok/s)为固定后端的 Coding Harness 对比测试显示,不同 Harness 的脚手架开销差异巨大:Pi 约 2.1 分钟OpenCode 约 3.1 分钟Claude Code 约 8.0 分钟(且方差最大)。生成的代码 diff 质量"基本相同",差异来自工具调用结构和系统提示的设计——Pi 采用"推理"策略,OpenCode 采用"委托"策略,而 Claude Code 则过度探索代码库。社区指出评测应加入代码质量和成本维度,且标准差计算方式存疑。该项测试表明,当前编码模型可能并不需要复杂的提示框架,简洁聚焦的 prompt 反而更有效。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!