神秘模型 Ox Alpha 刷榜,DeepSeek 发布多模态版
神秘模型 Ox Alpha 刷榜,DeepSeek 发布多模态版
8 月 20–21 日这轮新闻看似「安静」,实则暗流涌动:一个代号 Ox Alpha 的神秘模型在编码/agent 社区刷屏,DeepSeek 发布了多模态 Flash 实验版,OpenAI 一边降价一边宣告 Codex 用户破 2000 万。当天有两条主线——中文实验室在价格/性能和「多模态 agent」上持续压缩前沿差距,以及训练范式正从「提示词」转向「环境」。此外,开源模型与本地推理也在持续改善(Ollama 接入 Kimi K3、UC Berkeley 的 FreeToken、Marin 535B 开训),但算力仍是硬约束。
1. 神秘模型 Ox Alpha 刷爆基准,社区锁定智谱 GLM-5.3 系
Ox Alpha 是当天的核心谜团:多位开发者报告它在编码和 agent 任务上表现异常强劲,社区推测它来自智谱/Zhipu 的 GLM-family——很可能是 GLM-5.3 Vision 或一个 flash 变体,而非全新的巨型基座模型。Theo 称它「slaughtering」内部基准,并基于它的批准合并了 8 个 PR;Kimmonismus 则引用 Ben Davis 的实测数据,把它推上热点。
Wtf! Ben ran this mystery model through 10 DeepSWE tasks and it scored over 80%, versus 65% for Fable and 52% for GPT-5.6-sol!
this is insane. Probably a chinese company. Either a new GLM or Kimi model, I reckon.
— @kimmonismus天哪!Ben 拿这个神秘模型跑了 10 个 DeepSWE 任务,得分超过 80%,而 Fable 是 65%、GPT-5.6-sol 是 52%!这太疯狂了。很可能是一家中国公司,要么是新的 GLM,要么是 Kimi 模型。
社区对这个模型的解读最主流的是「post-training + infra > 规模」:Tim Dettmers 指出它 partial prefill 偏慢但输出快,推测活跃参数在 300–500B 或更少;scaling01 认为可能是更大的 teacher 蒸馏进 5.3 类模型;teortaxesTex 则反复把范围收窄到 GLM-5.3/5.4 Vision。模型通过 Hermes Agent/OpenCode/OpenRouter 和 Cline 迅速扩散,OpenRouter 上的「Ox Alpha」被指为即将发布的 GLM 5.3 Flash。
2. DeepSeek 发布 V4-Flash-Vision-Exp,多模态 + Files API
DeepSeek 交付了当天最具体的产品发布:DeepSeek-V4-Flash-Vision-Exp 在保留 V4-Flash 文本能力的同时加入多模态输入,官方称其多模态 agent 性能接近 Opus-4.8。
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀
🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge.
🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.
— @deepseek_aiDeepSeek-V4-Flash-Vision-Exp 现已在 DeepSeek API 平台上线!🚀 这个实验性多模态模型在文本能力上(包括 agent、推理和世界知识)与 DeepSeek-V4-Flash 持平;在多模态 agent 基准上,V4-Flash-Vision-Exp 相对 V4-Flash 实现重大跃升,使多模态 agent 性能接近 Opus-4.8。
随版本一起推出的还有:支持 Chat Completions、Messages、Responses 三套 API,混合图文输入支持 base64/外部 URL/Files API;图像按 117–384 tokens 计费(Flash 价格),并新增 Files API 用于可复用的上传(file_id 引用,避免重复传输)。社区贴出的基准表中,它拿下 Terminal Bench 2.1 83.9、Toolathlon-Verified 75.9、Chartography 64.3,DeepSWE 较 0731 版本提升约 +4 分。这一发布也部分解答了 Ox Alpha 的谜团——观察者指出神秘模型在部分测试中可能是一个「blinded VLM」。
3. OpenAI 下调 GPT-5.6 Sol 价格超 20%,叠加多项促销
OpenAI 宣布 GPT-5.6 Sol 的 API 与 credit 定价在接下来 3 个月下调 超过 20%。
As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months.
— @OpenAI在持续推进能力前沿并提升效率的同时,我们将在未来 3 个月内把 GPT-5.6 Sol 的 API 和 credit 定价下调超过 20%。
这叠加了产品层面的多项促销:Code 提供 9 月 3 日前 50% 折扣;Cognition 指出在 Devin 上,Sol 叠加折扣后 10 月 3 日前相当于 76% off。外界把此举解读为一次利用率/效率更新,同时也是对廉价中国推理的竞争回应。
4. Codex 用户破 2000 万,向用户发放「banked reset」
OpenAI 的 thsottiaux(Tibo) 宣布 Codex 本周达到 2000 万活跃用户,并为所有 Codex 和 ChatGPT Work 用户发放一次可自行支配的「banked reset」(额度重置)。
First of all, we have hit 20M active users for Codex some time this week. Second of all, this is cause for celebration and during the day we will credit every Codex and ChatGPT Work user with a BANKED reset that you can use at your own leisure.
— @thsottiaux首先,本周某个时候 Codex 已经达到 2000 万活跃用户。其次,这值得庆祝,当天我们会给每位 Codex 和 ChatGPT Work 用户发放一次「banked reset」额度重置,你可以在自己方便的时候使用。
他同时澄清了近期「用量限额消耗更快」的疑问:官方未发现异常,但调查发现部分受影响用户在使用 sub2api(把订阅转成 API 流量再转售/共享),这类用法会被反欺诈系统标记;通过官方客户端或支持 ChatGPT 登录的 OSS 客户端(Pi、OpenCode 等)正常使用则没有问题。社区还流传一个 anecdote——Theo 称一个长任务在额度归零后仍消耗了约 $800 的 token。
5. GLM-5.3 深度解读:沙盒与 SAO 成为新的扩展轴
当天最扎实的技术解读来自 ZhihuFrontier 对 GLM-5.3 的拆解:它沿用 与 GLM-5.2 相同的基座模型,全部收益来自扩展后的 post-training。
GLM-5.3: When Better Sandboxes Matter More Than a Bigger Base Model
Z.ai's GLM-5.3 ... uses the same base model as GLM-5.2, with its reported gains coming entirely from scaled post-training. ... GLM-5.3 outperformed the much larger DeepSeek-V4-Pro-0813 on several long-horizon Agent benchmarks: DeepSWE 66.9 vs 62.7, CyberGym 84.5 vs 83.3, Agents' Last Exam 28.5 vs 25.7.
— @ZhihuFrontierGLM-5.3:当更好的沙盒比更大的基座模型更重要。Z.ai 的 GLM-5.3 使用与 GLM-5.2 相同的基座模型,其报告的收益完全来自扩展后的 post-training……在多个长程 agent 基准上,GLM-5.3 超越了体量大得多的 DeepSeek-V4-Pro-0813:DeepSWE 66.9 对 62.7、CyberGym 84.5 对 83.3、Agents' Last Exam 28.5 对 25.7。
核心观点是「Sandbox Scaling Law」:长程 RL 的信用分配信号是坏的(80 步正确探索、第 79 步一个 typo 就全盘归零),而 GLM 的 SAO(Self-Adaptive Optimization) 借鉴 MCTS 的思路,对中间状态采样反事实分支,保护有价值的早期动作、把惩罚集中在真正出错的地方。为此 Z.ai 大幅扩充了可执行环境的数量和多样性,并开源了 slime 框架,异步分离「生成/rollout、沙盒执行与验证、参数更新」三类负载。这条思路也与 Google 的 EnvHarness / EnvRigger 呼应——通过插件层和策略诊断重塑静态环境,held-out 性能提升最多 9 分、执行步骤减少 9.8%。
6. NVIDIA AVO 在 ARC-AGI-3 公开集 100%,Chollet 提醒别过分解读
NVIDIA 宣称其通用编码 agent AVO 在 ARC-AGI-3 交互式推理基准上拿到 100%,完成了 25 个公开环境中全部 183 个关卡,且「没有指令、显式规则或既定目标」。但 ARC-AGI 作者 François Chollet 明确提醒:这只是公开演示集,不等于完整基准。
This is very nice work from NVIDIA. ... To be clear, like with several other recent claims, scoring 100% on the public demonstration set is not the same as "scoring 100% on the ARC-AGI-3 benchmark". It would be like saying you beat a videogame because you cleared the tutorial level.
— @fchollet这是 NVIDIA 非常漂亮的工作……需要说明的是,和其他一些近期声称一样,在公开演示集上拿到 100% 不等于「在 ARC-AGI-3 基准上拿到 100%」。这就像说你通关了某个游戏,其实只打完了新手教程关。
Chollet 指出,像所有 ARC-AGI-3 高分方法一样,AVO 用的是「深度学习引导的即时符号世界模型合成」——通过生成程序来表示所知道的世界。这一结果的价值需要留到私有测试集或不相关的交互环境上验证。
7. NVIDIA 6 亿美元授权 Poolside「Model Factory」
据 The Information 报道,NVIDIA 将以 约 60 亿美元非排他授权 Poolside 的模型开发堆栈,并再以 120 亿美元 pre-money 估值投资约 10 亿美元;与 Laguna 相关的 109 名 Poolside 员工据报已收到 NVIDIA 的 offer。关键资产是用于构建 Laguna 编码模型的「Model Factory」。评论者态度分裂:一部分视为美国开源/Nemotron 生态的利好,另一部分担心这是一场变相 acqui-hire,可能让 Poolside 独立的 Laguna 路线停摆、被并进 NVIDIA/Nemotron。
8. Agent 基准越来越难:FACET / SWE-bench Science / CADBench / AI4AI-Bench
一批新基准把难度又往上抬了一档:FACET 从 agent 技能生成可执行终端任务,验证了 6,078 个任务;SWE-bench Science 引入 119 个科学软件任务,即使 Claude Code + Opus-5 也低于 50% pass@1;CADBench 在现实 Fusion 360 任务上,顶尖模型只有 24.6% 通过率;AI4AI-Bench 测试递归自我改进(覆盖 10 个研究仓库),最佳模型平均分仅 0.288。这些数字说明评测正在从「通用问答」转向更长程、更贴近真实工具的衡量。
9. 研究精选:Recirculation、Pandora's Router 与 vLLM IsoExec
推理侧架构与研究有三点值得注意:DeepMind 的 Recirculation 在推理时把深层上下文化激活回灌到更早处理,无需重训,报告 -60% 上下文化错误、-23% perplexity、+21% GSM8K;Google DeepMind 的 Pandora's Router 把模型路由建模为「带代价检查的最优搜索」,在不频繁调用昂贵估计器的前提下匹配穷举估计质量;vLLM 的 IsoExec 解决浮点非结合性导致的 rollout/training logprob 不匹配,在 Qwen3.5-35B-A3B + DAPO(8×H100)上把 logprob 差异从 1.6e-2 降到 6.7e-7,开销 25.3%。
10. 机器人进展:T-Rex、GEN-1.5 与 WRC'26
机器人领域当天更新密集:Jim Fan 介绍 T-Rex,一个触觉反应式灵巧操作堆栈,采用异步视觉/触觉专家,并放出号称最大的开源触觉数据集——50 小时 / 约 5,500 episodes / 22-DoF 硬件;Generalist AI 发布 GEN-1.5,自称 embodied AI 的「one-shot learner」,演示一次即可复现并泛化任务,被社区类比为「机器人领域的 GPT-2」;WRC'26 现场则有 DaxAI 的「机器马」(100 km/10 h 续航、300 kg 载重、40 km/h 极速)和「与人一样快」的包裹翻转机械臂,后者引发了对真实错误率 vs 人类基线的讨论。
相关链接
- DeepSeek-V4-Flash-Vision-Exp 发布
- OpenAI 下调 GPT-5.6 Sol 价格
- Codex 达到 2000 万活跃用户
- Ox Alpha 基准数据
- GLM-5.3 沙盒解读
- NVIDIA AVO ARC-AGI-3 声明
- Chollet 对 AVO 的提醒
- NVIDIA 授权 Poolside 报道
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu