Kimi K3 发布:2.8T开放权重前沿模型

AI摘要
【知识分享】月之暗面发布Kimi K3大模型,核心参数为2.8T总参数、1M上下文窗口、原生多模态。技术亮点包括KDA注意力机制实现6.3倍解码加速、Attention Residuals提升25%训练效率、LatentMoE架构。模型在Arena前端代码排行榜登顶,AA智能指数57分,与Opus 4.8和GPT-5.5同档,价格优势明显。同时报道了Thinking Machines发布Inkling模型、OpenAI披露GPT-5.6文件删除事件、Anthropic推出代码审查强度等级等AI行业动态。

Kimi K3 发布:2.8T开放权重前沿模型

1. Kimi K3 正式发布:2.8T 参数、1M 上下文、7月27日开放权重

7月16日,月之暗面(Moonshot AI)正式发布 Kimi K3,定位为「开放前沿智能」(Open Frontier Intelligence)。核心规格:2.8T 总参数1M token 上下文窗口原生多模态输入(文本 + 图像),文本输出。模型已上线 Kimi.com、Kimi Work、Kimi Code 桌面客户端及 API,开放权重承诺于 2026 年 7 月 27 日发布

Introducing Kimi K3: Open Frontier Intelligence

🔹 2.8 Trillion Parameters, 1 Million Context, Native Multimodal
🔹 Kimi Delta Attention enables up to 6.3x faster decoding in million-token contexts
🔹 Attention Residuals deliver ~25% higher training efficiency at <2% additional cost
🔹 Built for long-horizon agentic coding and self-evolving workflows

Kimi K3 is now live on Kimi.com, Kimi Work, Kimi Code, and the Kimi API. Open Weights by July 27, 2026.
— @Kimi_Moonshot

月之暗面正式发布 Kimi K3:2.8 万亿参数、百万级上下文、原生多模态。Kimi Delta Attention 在百万 token 上下文下实现最高 6.3 倍解码加速,Attention Residuals 以不到 2% 的额外成本带来约 25% 的训练效率提升。专为长周期智能体编程和自进化工作流打造。

技术架构上,K3 引入了三项核心创新——Kimi Delta Attention(KDA)实现长上下文下高达 6.3 倍解码加速,设计周期据称始于 2025 年 1 月、历时约 1.5 年打磨至前沿规模;Attention Residuals(AttnRes)在不到 2% 额外成本下提升约 25% 训练效率;LatentMoE 使用 896 个专家中激活 16 个(激活率不到 2%),配合 per-head Muon 优化器、QB 负载均衡和新型激活函数 SiTU(Sigmoid Tanh Unit)。社区工程师评价这一架构组合在超过前代 Kimi 模型 2 倍以上规模的同时保持了可观的训练效率。

定价方面:API 为 $3/1M 输入 token$15/1M 输出 token,缓存输入享受 90% 折扣降至 $0.30/1M。按 80% 输入 / 20% 输出混合估算约为 $5.40/1M token,相比 Opus 4.8 的 $9 和 GPT-5.5 的 $10 有明显价格优势。早期实时推理速度约 26-28 tok/s。

月之暗面在官方表述中也坦承 K3 在「用户体验」上与 Claude Fable 5 和 GPT-5.6 Sol 仍有「可感知的差距」,这一自我认知与第三方评估结果基本一致。

2. Kimi K3 登顶 Arena.ai 前端代码排行榜

Arena.ai(原 LMArena)给出了一组爆炸性数据:Kimi K3 以 1679 分登顶 Frontend Code Arena 排行榜,从上一代 K2.6 的 #18 直接跳至 #1,超越 Claude Fable 5(1631 分)和 GPT-5.6 Sol xHigh(1618 分)。

Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5.

This is a 17-place jump from Kimi-k2.6 (#18 -> #1).

In Frontend, Kimi-K3 ranked #1 in 6 of 7 domains: Brand & Marketing, Reference-Based Design, Data & Analytics, Consumer Product, Simulations, and Content Creation Tools, landing #2 only in Gaming behind Fable 5.
— @arena

Kimi K3 以 1679 分登顶 Frontend Code Arena,超越 Claude Fable 5。从 K2.6 的 #18 跳升至 #1,在 7 个前端子领域中的 6 个排名第一(品牌营销、参考设计还原、数据与分析、消费产品、仿真模拟、内容创作工具),仅在游戏领域排名第二,落后于 Fable 5。

后续 Arena 补充:K3 在 Frontend Code Arena 的成对胜率达到 76%,而 Fable 5 为 63%、GPT-5.6 Sol 为 58%。在 Text Arena 综合排名中,K3 位列 #9(1486 分),从上一代的 #38 大幅跃升,在创意写作、编程和指令遵循等子项中均进入前 10。

3. Artificial Analysis 独立评估:对标 Opus 4.8,价格优势明显

Artificial Analysis 发布了对 Kimi K3 的独立评估,给出 AA 智能指数 57 分,定位为与 Opus 4.8 和 GPT-5.5 同档,但仍落后于 Fable 5(60)和 GPT-5.6 Sol(59)。

Kimi K3 scores 57 on the Artificial Analysis Intelligence Index. Its intelligence is comparable to Opus 4.8 and GPT-5.5 but remains behind Fable 5 and GPT-5.6 Sol.

➤ GDPval v2 Elo: 1668 (vs K2.6's 1190)
➤ AutomationBench-AA: 53%, #1 position
➤ AA-Briefcase: 1547 Elo, +732 from K2.6
➤ Cost per task: $0.94, similar to GPT-5.6 Sol ($1.04), ~1/2 the price of Opus 4.8 ($1.80)
➤ 21% fewer output tokens vs K2.6 while achieving higher scores
— @ArtificialAnlys

Kimi K3 在 AA 智能指数上得分 57,与 Opus 4.8 和 GPT-5.5 相当但落后于 Fable 5 和 GPT-5.6 Sol。GDPval v2 Elo 达 1668,AutomationBench-AA 以 53% 排名第一。每个任务平均成本 $0.94,与 GPT-5.6 Sol 的 $1.04 相近、约为 Opus 4.8 的一半。相比 K2.6 减少了 21% 输出 token 消耗同时取得更高分数。

亮点包括:GDPval v2 Elo 1668(K2.6 为 1190),AutomationBench-AA 53% 排名第一AA-Briefcase(知识工作智能体)Elo 1547 较 K2.6 大幅提升 732 分。值得注意的是,K3 的 token 效率显著改善——完成全部 9 项评估仅消耗约 1.32 亿输出 token(K2.6 约 1.66 亿),减少 21% 同时智能指数提升 13 分。

但 AA 也指出一项真实弱点:在 AA-Omniscience 评估中,尽管准确率从 33% 提升至 46%,幻觉率却从 39% 恶化至 51%,呈现准确性提升与幻觉增加的 trade-off。

4. vLLM 生态第一时间就绪,KDA 前缀缓存已上游合入

vLLM 宣布月之暗面已将 KDA 前缀缓存实现直接贡献至 vLLM 上游,确保 K3 权重发布当天即可获得高效推理支持。

Congrats to @Kimi_Moonshot on the Kimi K3 announcement!

The Kimi team announced they contributed a KDA prefix caching implementation directly to vLLM, to be released alongside the model.

KDA breaks assumptions behind conventional prefix caching, and this upstream work means the community gets efficient long-context serving from day 0.
— @vllm_project

祝贺月之暗面发布 Kimi K3!Kimi 团队已将 KDA 前缀缓存实现直接贡献至 vLLM,将随模型一同发布。KDA 打破了传统前缀缓存的假设,这一上游工作意味着社区从第 0 天起就能获得高效长上下文推理支持。

这之所以重要,是因为 KDA 的设计打破了传统前缀缓存的底层假设,需要推理引擎层面的协同适配,而非仅靠模型权重即可即插即用。月之暗面还推荐在 64+ 加速器的超节点配置上部署以获得最佳推理效率,这提示尽管是开放权重,实际自托管门槛仍然很高。

5. Thinking Machines 发布首个开放权重模型 Inkling

前 OpenAI CTO Mira Murati 创立的 Thinking Machines 发布了首个开放权重模型 Inkling975B 总参数 / 41B 激活参数的 MoE Transformer,1M token 上下文,在 45T token 上预训练,覆盖文本、图像、音频和视频。此外还发布了 Inkling-Small(276B 总参 / 12B 激活),声称在多项基准上匹配甚至超越大号版本,归因于预训练数据配方的改进。

Inkling 在社区基准中位列 #5 全球开放权重模型、#1 美国开放权重模型,但其总分 1257 仍明显落后于 GLM-5.2 等中国开放权重竞品,社区对实际采用率持保留态度。模型规模接近 1T 参数也意味着自托管面临较大硬件门槛。

6. OpenAI 披露 GPT-5.6 文件删除安全事件

OpenAI 的 Thomas Sottiaux(Tibo)公开回应了多起 GPT-5.6 意外删除用户文件的报告,揭示了根因:在启用全权限模式(full access)且未开启沙箱或自动审查时,模型尝试通过覆盖 $HOME 环境变量来定义临时目录,但「诚实地犯了错误」——误删了 $HOME 本身。

We've investigated a handful of reports where GPT-5.6 unexpectedly deleted files. What we have found is that this most commonly occurs when:

  • Full access mode is enabled and codex is run without sandboxing protections, including without auto review being enabled
  • The model attempts to override the $HOME env var to define a temporary directory
  • The model makes an honest mistake and mistakenly deletes $HOME instead.

We are taking steps to mitigate this risk including by updating the developer message, guiding more users towards safer permission modes, and adding additional harness safeguards. We'll share a detailed post-mortem in the coming days.
— @thsottiaux

OpenAI 已调查多起 GPT-5.6 意外删除文件的报告。发现最常见触发条件:全权限模式启用且未开启沙箱保护或自动审查;模型试图覆盖 $HOME 环境变量定义临时目录;模型犯错误删了 $HOME 本身。OpenAI 正采取措施,包括更新开发者提示、引导用户使用更安全的权限模式、增加 harness 层安全防护,后续将发布详细事后分析。

OpenAI 表示将更新开发者消息引导用户选择更安全的权限模式,并在 harness 层增加防护措施,同时承诺发布详细事后分析。这一事件凸显了模型在高权限环境中行为安全的重要性。

7. Anthropic Claude Code 上线可调节代码审查强度

Anthropic 为 Claude Code 的 /code-review 引入了审查强度等级(effort levels),从低开销/低成本的快速审查到 ultra 级别——部署一组审查子智能体独立复现发现。

Claude Code's /code-review now has effort levels, with the review rewritten at every one.

Low effort beats other code review tools on findings at a fraction of the token cost. High effort delivers significantly higher recall when you want to go deeper.
— @ClaudeDevs

Claude Code 的 /code-review 现已支持审查强度等级。低强度在每次发现的 token 成本上优于其他代码审查工具,高强度则提供显著更高的严重问题召回率。

Anthropic 表示低强度模式在「每次发现/token 成本」上优于其他代码审查工具,高强度/ultra 则显著提升严重问题召回率并减少误报。这标志着 AI 代码审查从「一刀切」向可控成本/质量权衡的产品化迈进。

8. NVIDIA 发布 Nemotron 3 Embed 8B 检索模型

NVIDIA 发布了 Nemotron 3 Embed 8B 检索嵌入模型,号称在 RTEB 排行榜上排名第一,MMTEB Retrieval 得分 75.45,RTEB NDCG@10 达 78.46。NVIDIA 强调更强的检索能力可减少下游智能体的 token 消耗。发布包含 1B BF161B NVFP4 两个变体,NVFP4 版本在 Blackwell GPU 上可提供高达 BF16 2 倍吞吐量同时保持 99% 以上检索质量。Baseten 和 Turbopuffer 等合作伙伴已第一时间支持部署。

9. Google Gemma 4 聊天模板大幅修复

Google 为 Gemma 4 模型更新了聊天模板(chat template),核心修复集中在工具调用正确性推理/思考通道保留:包括空值处理、turn 标签平衡、输入验证、工具响应后恢复模型思考提示、修复额外 <turn|> 标签生成、恢复 add_generation_prompt 行为和 preserve_thinking 默认值。同时启用 Flash Attention 4 on Hopper GPU 以提升推理速度,并发布视觉 token 预算优化交互式指南。

社区反馈积极,但也有用户反馈「懒惰」问题似乎仍是模型行为层面的问题,非模板修复所能解决。

10. ExLlamaV3 v1.0.0 大版本发布

本地推理引擎 ExLlamaV3 发布 v1.0.0 正式版,带来显著的解码吞吐提升。以 RTX 3090 为基准:Qwen 3.5 0.8B 从约 268 tok/s 升至 444 tok/s,Qwen 3.6 27B 从约 29 tok/s 升至 50 tok/s。新版本移除了 FlashAttention-2/xFormers 依赖,重写 attention/GEMM/GEMV/MoE 内核,扩展 tensor parallelism 支持,并改进了 KV-cache 量化以避免此前版本的回退问题。ExLlamaV3 使用独有的 EXL3 量化格式,目前仅支持 NVIDIA GPU。


其他值得关注:德国 AI 联盟发布 Soofi S——30B-A3B MoE 开源德语模型,基于 Nemotron 3 Nano 架构,公开完整训练脚本和日志;Linus Torvalds 重申 Linux 内核不会禁止 AI 辅助开发,条件是提交需通过同等技术审查;Anthropic 在欧盟议会仅派初级员工远程作证引发欧盟不满,暴露出其欧洲数据驻留策略不成熟的问题;Google 将 Gemini Omni 视频生成能力融入 Google Vids 并推出个人虚拟形象功能。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!