Kimi K3 开源发布:2.8T MoE 全权重放出

Kimi K3 开源发布:2.8T MoE 全权重放出

1. Kimi K3 全权重开源:2.8T 参数 MoE 模型,仅激活 104B/token

月之暗面(Moonshot AI)正式开源 Kimi K3,放出完整模型权重、技术报告及三项配套基础设施(MoonEP、FlashKDA、AgentEnv)。K3 是一个 2.8T 总参数的混合专家(MoE)模型,每个 token 仅激活约 104B 参数,支持 100 万 token 上下文窗口。相比前代 K2,综合架构与数据优化带来的扩展效率提升约 2.5 倍。

K3 的核心架构创新分布在三个维度:序列长度——Kimi Delta Attention(KDA)将历史压缩为固定大小的循环状态,解决长上下文中 KV 缓存膨胀问题,配合 24 层 Gated MLA 保持全局交互能力;网络深度——Attention Residuals(AttnRes)将残差通路本身变为注意力机制,让每一层学习从早期层中检索最有用的特征;模型宽度——LatentMoE 从 896 个路由专家中为每个 token 选择 16 个,配合 Quantile Balancing 和 SiTU-GLU 确保稀疏系统训练稳定。

视觉方面,K3 搭载约 4.01 亿参数的 MoonViT-V2 编码器,最大图像 patch 限制从 16,384 提升至 65,536,实现原生多模态。

Kimi K3 Scales Across Length, Depth, and Width. @Kimi_Moonshot AI has released Kimi K3's full model weights, technical report, and three pieces of training infrastructure: MoonEP, FlashKDA, and AgentEnv. The release reveals how K3 scales a 2.8T-parameter MoE model to a 1M-token context window while activating only 104B parameters per token.
— @ZhihuFrontier

Kimi K3 在长度、深度和宽度三个维度上同时扩展。月之暗面发布了 K3 的完整模型权重、技术报告及三项训练基础设施。这一发布揭示了 K3 如何将一个 2.8T 参数的 MoE 模型扩展到 100 万 token 上下文窗口,而每次仅激活 104B 参数。

社区反应热烈,技术报告因其深度和密度获得高度评价。Baseten 指出 K3 是一个按功能分配容量的系统——循环记忆、周期性检索、稀疏专家和选择性残差访问协同工作。NVIDIA 已提供 Dynamo 部署支持,Red Hat AI 发布了面向 H100/H200 的 FP8-Block Hopper 调优 checkpoint,vLLM 提供 day-0 支持。Perplexity 率先为 Pro/Max 用户接入美国托管的 K3,Together 则宣布将与月之暗面联合举办技术深度研讨会。

2. Kimi K3 部署成本分析:开源≠易用

尽管 K3 以开放权重形式发布,但实际部署成本远超个人和小型团队承受范围。知乎用户"平凡"对公开部署信息进行了详细分析,结论是 K3 已不再是一个实际的"本地模型"。

最低公开验证配置为 8 × AMD MI355X GPU,每张提供 288GB HBM,共 2.304TB 显存,刚好容纳约 1.56TB 的模型文件及运行时状态。但需要注意的是,AMD 初期测试仅使用了 16K 上下文窗口,尚未公布生成吞吐、首 token 延迟和并发数据。能加载模型不等于能提供服务。

硬件成本方面:8 × MI355X 服务器约 25-35 万美元(约 170-240 万人民币)。如果选择 NVIDIA 方案,16 × H200 约 435-570 万人民币,16 × B200 约 540-680 万人民币。更关键的是,月之暗面的部署指南建议至少 64 个加速器置于同一高带宽通信域内,因为 K3 的 896 个路由专家分布在不同 GPU 上时,全对全通信成为瓶颈。64 × MI355X 预估硬件成本约 1360-1900 万人民币,年度电费接近 100 万人民币。

Kimi K3 Is Open, but Running It Is Anything but Cheap. The author estimates that an 8 × MI355X server would cost around $250,000-350,000, roughly RMB 1.7-2.4 million. For 64 MI355X GPUs: RMB 13.6-19 million in hardware. The model is open. The infrastructure required to use it is now the real barrier.
— @ZhihuFrontier

Kimi K3 是开放的,但运行它绝不便宜。作者估计 8 × MI355X 服务器成本约 25-35 万美元(170-240 万人民币)。64 张 MI355X 的硬件成本达 1360-1900 万人民币。模型是开放的,但使用它所需的基础设施才是真正的壁垒。

这一分析引发了关于"开源"定义在模型规模前沿正在发生变化的广泛讨论。对大多数用户而言,通过 API 调用 K3 显然比自建集群更经济。

3. Grok 4.6/4.7 路线图公布:1.5T 模型 8 月 7 日发布

Elon Musk 在回应 Vercel CEO Guillermo Rauch 关于 Grok 4.5 以性价比优势在安全基准测试中表现突出的话题时,透露了 Grok 的后续发布计划。Grok 4.6 预计于 8 月 7 日左右发布,为 1.5T 参数模型,SFT 和 RL 环节均获得显著提升。数周后将推出 Grok 4.7,参数规模达到 2.1T,在各方面均优于 4.6,但推理速度稍慢,token 效率则更优。

Interesting. Grok 4.6 releases around August 7. This will be the 1.5T model with significantly improved SFT & RL. Grok 4.7 will be the 2.1T model released a few weeks later. This will be better than 4.6 in every way, except slightly slower to serve, albeit with even better token efficiency.
— @elonmusk

有趣。Grok 4.6 将于 8 月 7 日左右发布,这是 1.5T 模型,SFT 和 RL 环节显著改进。Grok 4.7 是 2.1T 模型,几周后发布,各方面优于 4.6,仅推理速度稍慢,但 token 效率更佳。

这条推文获得了超过 340 万次浏览、1.5 万点赞和 1826 次转发,可见社区对 Grok 迭代速度的高度关注。从 4.5 到 4.6(1.5T)再到 4.7(2.1T),xAI 正在以月为周期推进模型规模扩展。

4. Hugging Face 遭首次自主 AI Agent 网络攻击

Hugging Face 发布了详细的法证报告,披露其遭受了被描述为"史上首次自主 Agent 网络攻击"的安全事件。CEO Clement Delangue 公布了完整技术时间线、交互式回放以及使用开源模型进行防御的细节。关键统计数据令人震惊:约 17,600 次操作、持续 4.5 天、获得 11 个节点的 root 权限两个集群的 cluster-admin 权限136 个密钥被访问、反复注册 VPN,以及通过 GitHub App token 和 Pull Request 尝试入侵 CI 系统。

The first autonomous agent cyberattack is an unprecedented event that deserves unprecedented transparency. Today we're sharing everything we can: a full technical timeline, an interactive replay, and how we used an open model to defend ourselves, so defenders everywhere can learn from it and prepare for what's next.
— @ClementDelangue

首次自主 Agent 网络攻击是一个前所未有的事件,值得前所未有的透明度。今天我们分享一切能分享的:完整技术时间线、交互式回放,以及我们如何使用开源模型进行防御,让全球防御者都能从中学习并为未来做好准备。

事件中的一个关键细节是:闭源工具在法证分析中无法可靠区分攻击者和防御者,而 Hugging Face 在自己的基础设施上使用了开源 GLM 5.2 模型完成了分析。Arav Srinivas(Perplexity CEO)和 Simon Willison 都对此发表了评论,强调这一事件证明了透明度和开放模型在安全事件响应中的不可替代价值。

5. 前沿 AI 实验室员工联名呼吁"为 AI 发展踩刹车"

OpenAI、Anthropic、Google DeepMind 等前沿 AI 实验室的员工正在传阅一封联名信,呼吁美国政府支持一项能够在必要时"刻意放缓"AI 发展速度的国际技术/治理机制。信件的核心论点是:递归或自动化的 AI 研究可能使技术进展速度超出任何单一实验室或国家能够单边管理的能力。OpenAI 正式背书了这一倡议,Anthropic 则表示其自身的 RSI(递归自我改进)研究指向同样的需求。

然而,反对声浪同样激烈。批评者认为前沿实验室实质上是要求建立一种治理结构,将监管负担转嫁给竞争对手和开源模型,从而巩固自身领先地位。经济学家 Adam Thierer 将其描述为"危险的全球守门人呼吁",认为这无法有效约束中国的 AI 发展。Sarah Hooker 此前关于开放权重的讨论也与此呼应——将开放发布限制在较弱系统上被许多人视为保护闭源巨头的策略。一些签名者也公开表达了保留意见,认为基于 RSI 的政策需要更好的量化和更高的内部透明度。

6. World Labs/SceniX 发布机器人训练世界平台

Fei-Fei Li 宣布了 World Labs/SceniX 的早期成果:构建与现实对齐的虚拟环境用于机器人训练和评估。其核心理念不是单纯的"更好的仿真",而是建立一个 real-to-sim-to-real 循环,利用世界模型弥合机器人领域的数据瓶颈。

When SceniX joined World Labs, we said spatial intelligence was never only about perceiving and generating virtual and physical worlds, but also interacting with them. Today, we're sharing early results from that vision: building worlds that train robots.
— @drfeifei

当 SceniX 加入 World Labs 时,我们说过空间智能从来不仅仅关乎感知和生成虚拟与物理世界,还关乎与它们交互。今天,我们分享这一愿景的早期成果:构建训练机器人的世界。

a16z 的战略分析明确指出:与语言不同,机器人缺乏丰富的网络规模数据,因此扩展定律要求合成世界能够替代昂贵且不安全的真实世界数据采集。Yunzhu Li 将其描述为"在与现实对齐的世界中进行可扩展训练和评估的平台"。

7. LLM"大脑"+ 机器人"身体"方案取得突破性进展

两项相关工作展示了将 LLM 式推理连接到机器人策略的巨大潜力。在真实机器人上,性能从 16.7% 跃升至 97.3%;在仿真环境(LIBERO-PRO)中从 12.8% 提升到 53.3%。TRI Dao 指出这等于无需额外训练即实现 4 倍 SOTA 提升。同时,WorldDiT 作为一个统一的机器人世界建模与控制架构在 LIBERO 上发布,在不依赖 VLM 生成动作的公开方法中处于 Pareto 前沿。

8. Cursor 进军印度市场,移动端 Agent 控制成趋势

Cursor 在印度推出了"Cursor Start",定价 ₹649/月,捆绑 Grok 4.5、Composer、云端 Agent、MCP 服务器、hooks 和 iOS 支持。CEO Aman Sanger 透露印度使用量同比增长三倍,人均 Agent 请求数超过任何其他国家。

更广泛的趋势是"随地使用 Agent"的交互模式正在固化。多位意见领袖描述了通过 ChatGPT Voice + Codex 在跑步、步行或驾驶时持续监督 Agent 工作——重点是优先级判断而非亲手输入。Perplexity 同步推进同一方向,发布了 Windows 版 Personal Computer(本地 Agent 框架,操作文件、应用和网页)以及内建的 Model Council(多模型比较与引用合成)。

9. Anthropic 发布 Claude Mythos 密码学研究成果

Anthropic 宣布 Claude Mythos Preview 帮助研究人员发现了密码算法中的弱点,发表了关于 HAWKAES 相关的论文,并推出了 CryptanalysisBench 基准测试。防御性叙事很直接——专家级密码学研究具有明确的安全价值——但发布也在社区中引发了对信息传递和实际影响的质疑。部分观点认为这更像是研究能力的展示,而非可立即落地的安全工具。

10. Fish Audio 获 5200 万美元种子轮,发布 S2.1 Pro 语音模型

Fish Audio 宣布获得 5200 万美元种子轮融资,同时发布 S2.1 Pro 语音模型。该模型声称支持 5 秒语音克隆、速度比 Cartesia 快 2 倍、成本仅为 ElevenLabs 的 1/6。MCP 协议也在同日迎来最大更新:正式支持无状态 MCP、扩展机制、认证加固和弃用策略,由 Anthropic 的 ClaudeDev 账号宣布。


本日报基于 2026年7月27日-28日 AI News 整理,涵盖 12 个 subreddit、544 个 Twitter 账号及多个 Discord 频道的信息。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 1

是的,开源了!

1周前 评论

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!