OpenAI Codex 周增长 2.5 倍,GPT-5.6 Sol 需求爆炸

OpenAI Codex 周增长 2.5 倍,GPT-5.6 Sol 需求爆炸

1. OpenAI Codex/Work 使用量周增 2.5 倍,GPT-5.6 Sol 需求"疯狂"

Sam Altman 连续发文透露 OpenAI 的 Agent 产品正在经历爆发式增长。Codex 和 ChatGPT Work 的使用量在过去一周增长了 2.5 倍,而 GPT-5.6 Sol 的需求更是被 Altman 直接形容为"疯狂"。

2.5x increase in usage of our agentic products (codex and chatgpt work) in the last week!

welcome.
— @sama

5.6 sol growth is insane.

the inference team has done heroic work to be able to support demand.

we are going to move mountains to continue to scale, but it is possible there are some hiccups soon.
— @sama

Altman 坦言推理团队已竭尽全力支撑需求,但提醒可能会在短期内出现扩容瓶颈。生态响应同样迅速:JetBrains 已将 Codex 列为推荐 Agent,@theo 发现了 Codex 被低估的"question tool",OpenAI 开发者团队则展示了用 GPT-5.6 从头构建命令行评估工具的全过程。

然而,swyx 也提出了一个重要警告:随着 Agent 使用量飙升,过时的 agents.md 指令会变成"自我注入的提示攻击"

cosign. models have overtuned to this now and do not realize when the agentsmd is out of date and should be changed/ignored.

last night i goaled 5.6 sol to complete a 5 stage task and woke up to find it was still stuck on stage 0. ... poor sol spent 8 hours only refining and verifying stage 0 because /goal would not let it stop and agentsmd would not let it proceed.

if you dont know whats in your agentsmd before you fire off each task, it is an indirect prompt injection you perform on yourself.
— @swyx

LangChain 同步跟进,为 Codex 添加了 tracing 支持,随后扩展到 Cursor、Copilot、Pi 和 OpenCode。Teknium 则为 Hermes 更新了并行工具调用和"banked resets"功能。正如 @andykonwinski 所言:能将自身价值编码到评估和环境中的公司,可能比依赖资本或规模的公司获得更持久的优势

2. AI 攻克数学物理难题:Claude Fable 解半年度难题,GPT-5.6 再证 Erdős 猜想

东京大学顶尖理论物理学家 Yuji Tachikawa 发推称 Claude Fable 帮助他的团队解决了一个卡了约 6 个月的技术难题,随后因不喜关注度而删除了推文(非撤回结论)。社区讨论焦点在于:AI 不仅执行已知流程,还能提出"我想知道是否……"这样的探索性假设——这正是 AI 辅助研究长期以来被认为缺失的能力。

同日,斯坦福数学家 J. D. LichtmanPrzemysław Chojecki 各自发推称 GPT-5.6 解决了又一个 50 多年未解的 Erdős 问题,Sébastien Bubeck 转推确认。值得关注的技术细节是 Chojecki 产出 AI 辅助证明的速度已超过同行评审容量,验证吞吐量成为关键瓶颈。

3. PrismML 发布 Bonsai 27B:27B 模型压缩到手机可运行

Khosla 投资的 PrismML 发布了 Bonsai 27B,基于 Qwen 3.6 27B,将 54GB 的 16 位模型压缩到两个版本:Ternary Bonsai 27B(5.9GB / 1.71 有效位)1-bit Bonsai 27B(3.9GB / 1.125 有效位),全部以 Apache 2.0 开源。

Today, we're announcing Bonsai 27B: the first 27B-class model to run on a phone.

Bonsai 27B is the new multimodal flagship of the Bonsai family. Based on Qwen3.6 27B, it brings a new capability tier to local AI: multi-step reasoning, structured tool use, long-context workflows, and coherent agentic loops.

It comes in two variants:
• Ternary Bonsai 27B: 5.9 GB, 1.71 effective bits per weight, optimized for laptop-class quality.
• 1-bit Bonsai 27B: 3.9 GB, 1.125 effective bits per weight, optimized for phone-class footprint.

Everything is open-sourced today under the Apache 2.0 license.
— @PrismML

社区对 4GB 跑完整 27B 参数的质量存疑。技术讨论的基准点不是"压缩版能否匹敌原版",而是"4GB 三元 27B 能否击败常规 4GB 8B Q4 模型"。此前 PrismML 的 Bonsai-8B 量化版表现不如 BF16 4B,但好于 1.7B。Hermes 的演示展示 Bonsai 27B 在 RTX 5090 上实际运行,Locally AI 则突出了手机部署场景。

4. Anthropic 向参议院指控:阿里巴巴用 2.5 万假账户蒸馏 Claude

Anthropic 向美国参议院作证称,阿里巴巴在 4 月至 6 月的约六周内,使用约 25,000 个虚假账户进行了 2,880 万次 Claude API 对话,目的不是使用模型,而是蒸馏 Claude 的代理推理和编程能力到 Qwen 中。Anthropic 将其描述为迄今最大的"蒸馏攻击",规模超过 DeepSeek、Moonshot 和 MiniMax 的类似行为总和。因法律灰色地带,Anthropic 选择了国会信函而非直接诉讼。

社区反应两级:大量评论认为 AI 实验室在用公共/创意数据训练时援引合理使用原则,如今却反对自己的输出被同样方式利用,立场虚伪。技术类比将 API 蒸馏比作传统竞争性逆向工程——如汽车厂商买对手产品研究。但也有观点指出阿里运营云基础设施,可疑流量可能来自阿里云客户而非阿里自身。

5. 中国开源模型霸占 OpenRouter 前五,OpenAI/Google 跌出前十

OpenRouter 月度 Token 用量排名显示,前五名全部为中国模型:DeepSeek V4 Flash、MiMo-V2.5、MiniMax M3、Hy3 preview 和 DeepSeek V4 Pro,前十名中占七个席位,OpenAI 和 Google 均被挤出前十。这不代表全球 LLM 用量,但反映了 OpenRouter 作为实际路由/原型层的选择偏好。

社区总结的关键驱动因素:"很难比较基准,但很容易比较账单"。DeepSeek V4 Flash 和 MiMo-V2.5 等模型便宜且"够好",有时通过 API 调用甚至比自托管电费+硬件成本更低。另外,中国电力成本不到美国一半,在推理定价上形成结构性优势。

6. Perplexity 开源 WANDR:500 任务深度搜索 Agent 基准

Perplexity 开源了内部基准 WANDR,包含 500 个去标识化的生产级研究任务,需要 170,495 条有源验证记录,覆盖多个难度层级。

We're open sourcing WANDR.

WANDR is an internal benchmark we built and used for building deep and wide research capabilities inside Perplexity Computer.
— @perplexity_ai

与传统固定金标准打分不同,WANDR 重新抓取原始引用页面,将声明与底层证据逐一核实——更贴合动态网页搜索的真实场景。@AravSrinivas 称这是 Perplexity Computer 深度搜索引擎背后的评估体系,@denisyarats 强调 WANDR 同时也是一个从生产痕迹合成的 RL 环境

7. Sakana AI "智能细胞砖块"登 Nature Communications

Sakana AI 在《Nature Communications》上发表"Smart Cellular Bricks"研究:数百个相同立方体,每个运行小神经网络,仅与物理邻接通信,就能识别整体形状并检测损伤,无需中央控制

何百個の立方体が、中央の制御装置を持たないまま、自分たちが形づくる全体の姿を認識し、傷ついた部分を自ら直していく。この研究成果「Smart Cellular Bricks」が、科学誌『Nature Communications』に掲載されました。

各ブリックは同一の小さなニューラルネットワークを動かし、物理的に接続された隣のブリックとだけ通信します。それぞれのブリックは、自分の位置も、全体がどんな形なのかも知りません。
— @SakanaAILabs

细节尤为引人注目:细胞能以 95% 准确率检测六个空间方向上缺失的邻居,并重新生长目标结构;在仿真中可扩展至 18,000+ 个立方体。这是 Sakana AI 将"集合智能"从软件延伸到物理世界的第一步。

8. 开源模型密集发布窗口:Kimi K3、DeepSeek V4 GA 与 GLM 新版本

Reddit 社区汇总了即将到来的密集发布:Kimi K3 预计数小时内发布(继承 K2.6 在编程 Agent、256K 上下文、视觉和低成本子 Agent 协调上的积累);DeepSeek V4 GA 本周晚些时候正式版;新的 Liquid 非 Transformer 模型和 Mistral 本月内发布;另有传闻 GLM 5.5 在 8 月推出。

用户普遍呼吁更强但更实用的模型——当前众多前沿开源模型是 0.5T+ 参数级,需要多张 RTX PRO 6000 或约 1TB ECC DDR5 才能运行。理想目标:100B 以下、35B 以上的强模型。有用户运行 GLM 5.2 Q4 进行全仓库代码审查,速度仅约 0.5 tok/s,一次运行 3.5 天,仍能发现 10-15 个 bug。

9. 财富 500 强因成本撤回 AI 工具,Copilot 按量计费触发反思

一家"AI First"的财富 500 强企业在一次 Agent 试点失败后大规模回撤:Agent 在将遗留应用逆向工程为形式化规格时反复遗漏细微业务规则,日产出的代码存在安全性问题(如生成的 SQL 在 DML 路径中丢失约束)。公司停止了 AI 培训/演示,取消了 Claude 访问权限,要求团队限制使用或回归更便宜的老模型。

社区认为 GitHub Copilot 转向按量计费是触发企业重新审视 AI 支出的导火索——固定席位费掩盖了消耗风险,而计量计费直接暴露了 Agent/子 Agent 大量推理调用带来的材料运营成本。有评论指出,所有 AI 项目都失败或被放弃,原因不一定是模型能力不足,而是团队不愿维护生成的"烂代码"。

10. OpenMOSS 发布实时视觉语言模型 MOSS-VL-Realtime

OpenMOSS 发布了 MOSS-VL-Realtime,一个 11B 参数的视觉语言模型家族,Apache 2.0 许可,支持 256K 上下文,专为连续视频流设计。关键系统特性:可以在生成的同时持续观察,根据场景变化修正或中断回答,证据不足时保持沉默。

其技术架构采用交叉注意力机制XRoPE 统一时空定位编码,以及离线/流式/实时设置的统一模板。同期,基于 Qwen2.5-Omni-7B 的 OmniAgent 使用"观察-思考-行动"循环,在 LVBench 上以约 203 帧 vs 768 帧获得了 50.5 分,击败了 Qwen2.5-VL-72B 的 47.3 分,展现了主动证据搜索替代被动帧摄入的巨大效率提升。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!