GLM-5.3 发布,Cursor 加入 SpaceXAI
GLM-5.3 发布,Cursor 加入 SpaceXAI
8 月 13–14 日这两天看似"安静",实则多个开源前沿模型集中亮相、编码智能体赛道加速整合。本文筛选当日最重要的 10 个事件。
1. Z.ai 发布 GLM-5.3:后训练驱动的 coding 与安全能力跃升
当天最重要的技术事件是 Z.ai 发布 GLM-5.3,定位为 coding 与网络安全(cyber)导向的模型。它并非全新预训练,而是在 GLM-5.2 所使用的同一个 743B 基座模型上做后训练(post-training)得到。官方与后续分析称其在智能体与安全评测上取得大幅提升,包括 Terminal Bench 3.0: 28.3、DeepSWE: 66.9、Agents' Last Exam: 28.5、GDPVal-AA: 1769。由于网络能力增强,该模型初期仅对部分合作伙伴开放,待安全审查后再逐步开放权重。
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense.
- Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model
- A major leap in cybersecurity, setting a new standard among open models
— @Zai_org发布 GLM-5.3:为代码而生,为网络防御而备。通过在 743B 基座模型上的后训练,获得顶级的编码与智能体能力;在网络安全领域实现重大飞跃,在开源模型中树立新标准。
工程师们最关注的一个论断是:这次能力跃升完全来自更大规模的后训练/RL(针对更长周期、可执行的任务),而非更大的基座模型。社区普遍将其解读为"后训练规模化"路径的又一有力证据。
2. 阿里发布 Qwen3.8-27B:Apache 2.0 原生多模态本地模型
阿里巴巴发布 Qwen3.8-27B,一个 Apache 2.0 协议的原生多模态稠密(dense)模型,原生上下文 262K,可经 YaRN 扩展到 1M。官方明确将其定位为面向真实世界的编码、办公工作流与智能体,而非仅针对学术基准。同日也再次强调了已发布的 Qwen3.8-2.4T-A95B Max 级别模型。
We promised open weights for Qwen3.8. Now, time to meet them! 🎉
⚡ Qwen3.8-27B:
- A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows.
- 262K native context, easily extendable to 1M tokens via YaRN.
- Built for builders. Highly efficient, high-quality, and licensed under Apache 2.0.
— @Alibaba_Qwen我们承诺过 Qwen3.8 会开放权重,现在来见它们吧!Qwen3.8-27B:一个原生多模态稠密模型,仅 27B 参数即在整体上超越 Qwen3.7-Plus,并在真实编码与办公工作流中表现亮眼;拥有 262K 原生上下文,可经 YaRN 轻松扩展到 1M token;为构建者而生,高效、高质量,Apache 2.0 授权。
Day-0 推理支持异常广泛:vLLM、Ollama、llama.cpp/GGUF、SGLang(单张 RTX 5090 上 206 tok/s),以及 Together、Fireworks、Modal、DigitalOcean、DeepInfra 等云厂商。Qwen 还强调 27B 可在 17GB 内存上本地运行。Reddit 上有用户通过架构 diff 指出,Qwen3.8-27B 与 Qwen3.6-27B 在架构上零变化,能力提升主要来自训练数据与后训练更新。
3. Cursor 加入 SpaceXAI,并入 Grok 全家桶
当天互动量最高的公司事件是 Cursor 官宣正式完成收购,团队并入 SpaceXAI,将参与 Grok、Grok Build、Grok Bot、Grok API 和 Cursor 的开发。这被视作编码智能体团队正被当作战略性模型/平台资产(而非单纯的 IDE 产品)的明确信号。
Cursor is now part of @SpaceX.
Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more.
— @cursor_aiCursor 现在是 SpaceX 的一部分了。今天,我们已正式完成收购。我们将加入 SpaceXAI 团队,帮助把 Grok 打造成世界上最有用的 AI,并改进 Grok Build、Grok Bot、Grok API、Cursor 等产品。
SpaceXAI 随后确认并补充,Cursor 将"从软件工程起步,再扩展到知识工作",加速通往"世界上最有用的 AI"的路径。
4. DeepSeek V4-Pro 发布,MIT 开源权重
DeepSeek 发布 DeepSeek-V4-Pro,vLLM 当日宣布支持,并强调 MIT 许可、与预览路径的 checkpoint 兼容性,以及集成的 draft(投机解码)支持。权重已发布至 Hugging Face(deepseek-ai/DeepSeek-V4-Pro-0813)。该模型为 V4-Pro 与 V4-Flash 提供灵活推理强度(简单任务用 low、日常智能体工作流用 high、复杂任务用 max),并原生支持 OpenAI Responses API、针对 Codex 一键配置。
We're launching DeepSeek-V4-Pro today! 🚀
🔷 Major Agent upgrades with strong production gains!
🔷 Flexible reasoning effort for V4-Pro & V4-Flash: low for simple tasks, high for daily Agent workflows, max for complex tasks.
🔷 Native OpenAI Responses API support, optimized for Codex with one-click setup.
— @deepseek_ai我们今天发布 DeepSeek-V4-Pro!主要智能体升级,带来显著的生产力提升;为 V4-Pro 与 V4-Flash 提供灵活推理强度——简单任务用 low、日常智能体工作流用 high、复杂任务用 max;原生支持 OpenAI Responses API,针对 Codex 优化,一键配置。
社区讨论从 API 经济性转向自托管可行性:若性能有竞争力且基础设施/电力成本划算,开源权重有望让第三方服务商以更低价格提供推理。
5. 小红书 RedNote 发布 dots3-note Preview
小红书的 AI 实验室发布 dots3-note Preview,一个 280B 多模态 MoE(16B 激活参数)、512K 上下文的模型,面向长周期运行的智能体,并配套提出新 RL 方法 TEMPO,用于长时程自我评估。多个评论者将 Z.ai、DeepSeek、Moonshot、Qwen、MiniMax、RedNote 共同视为一个快速演进、各有专长的开放生态。
6. Gemini 3.7 Flash 全面铺开
Google 将 Gemini 3.7 Flash 广泛推广到 Gemini 应用、Search AI Mode、Google Workspace / Sheets canvas 以及 Spark,定位是"迄今最智能的编码与智能体工作马(workhorse)模型"。
Gemini 3.7 Flash is now available to all Pro and Ultra users in Gemini chat.
This model update delivers improved reasoning and accuracy for multi-step tasks like intelligently connecting the dots across dozens of files and emails into one master document.
— @GeminiAppGemini 3.7 Flash 现已向 Gemini 聊天中的所有 Pro 与 Ultra 用户开放。本次模型更新提升了多步骤任务的推理与准确性,例如把数十份文件和邮件中的信息智能地串联成一份主文档。
外部评测信号温和偏正面:Vals 将其排在 Vals Index v2 第 7 名(59.4%),较 Gemini 3.6 Flash 的第 14 名有所上升。Reddit 上有用户报告一次异常:模型在测试中一度用中文推理但仍正确完成任务。
7. DeepSeek Harness 发布:一切皆插件的智能体运行时
DeepSeek 开源 DeepSeek Harness(dsh),一个"一切皆插件"的智能体运行时,由 Cordis 驱动,提供生命周期管理、响应式依赖与可逆 effect。其技术要点不在于"模块化",而在于支持热插拔运行时组件、甚至可能让智能体在无需重启的情况下修改自身运行时,同时保留可审计的事件日志、避免隐藏状态。它还提供 Code Mode(把工具注册表转成类型化 SDK)、把 Codex 与 Claude Code 当作可替换的 worker,并从架构层面优化 KV Cache 复用。项目明确处于开发者预览阶段,兼容性破坏性变更随时可能发生。
8. DeepSeek API 大幅涨价:缓存命中最高 +1114%
DeepSeek 宣布自 2026 年 8 月 16 日 16:00 UTC 起调整 API 定价,引入峰/谷时段计费(高峰时段为 01:00–04:00 与 06:00–10:00 UTC,价格为谷时的 2 倍)。涨幅最大的是缓存输入 token:V4-Pro 缓存命中从 $0.003625 涨至谷时/高峰 $0.022/$0.044 每百万 token(+507%/+1114%);V4-Flash 缓存命中从 $0.0028 涨至 $0.007/$0.014(+150%/+400%)。输出 token 同样大涨:V4-Pro 输出从 $0.87 涨至 $1.98/$3.96,V4-Flash 输出从 $0.28 涨至 $0.66/$1.32。社区情绪负面,有用户表示已迁移走,认为 DS4"只有便宜时才值得"。
9. Claude Code 推出 Auto mode 默认权限模式
Anthropic 为 Claude Code 的 Pro/Max/Team 用户推出 Auto mode 作为默认权限模式,并通过 /auto-mode-setup 做仓库感知配置,为可信仓库/域名提供建议。用户仍可用 Shift+Tab 切换模式,或在设置中固定 defaultMode。开放/本地侧,Hermes 新增 /loop(cron 式会话内重复任务),Ollama 也加入了对本地启动 DeepSeek Harness 的支持。
10. 评测怀疑论持续:ARC-3、评分 bug 与 LLM 裁判
对厂商基准宣传的怀疑成为当日反复出现的主题。Vik Paruchuri 批评某 LlamaIndex 基准,称评分器 bug 可让系统从 65% 跳到 93.6%,并直言开发者应跑自己的评测、不要轻信营销。François Chollet 重申 ARC-3 公开演示集不是训练或评测数据,排行榜分数对私有集表现是弱代理。
Regular reminder -- the set of public ARC 3 games is called "demonstration set", not "eval set" nor "training set". It is not meant to be used as training data, and it is not meant to be used as an eval. Scores on the public demonstration set are not indicative of scores on the actual benchmark.
— @fchollet例行提醒——公开的 ARC 3 游戏集被称为"演示集",而不是"评测集"或"训练集"。它既不该被当作训练数据,也不该被当作评测。公开演示集上的分数并不能代表真实基准上的分数。
此外,Meta 的 Wiggle Framework 对 LLM 裁判施加重新提问与对抗压力测试,发现在静态反驳下结论可翻转 25–71%,在对抗性说服者作用下翻转 62–91%,进一步放大了对单一基准分数的质疑。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu