GPT-5.6 Sol 修复与 Grok Build 代码泄露

GPT-5.6 Sol 修复与 Grok Build 代码泄露

1. GPT-5.6 Sol 使用量修复:OpenAI 罕见透明公开推理引擎变更

上周末,OpenAI Codex 与 ChatGPT Work 用户发现 GPT-5.6 Sol 的 token 消耗突然飙升,引发社区强烈不满。OpenAI 的 Tibo(Codex & ChatGPT 团队成员)罕见地发布长篇透明说明,详细解释了四个技术变更及其修复:推理优化带来了约 10% 的额外使用量节省;上下文限制从 272k 扩大到 372k 后导致计费异常,已回退至 272k;内部推理预算参数(称为 "juice values")的实验性调整已回滚;高/极高推理档位下多 agent 过度活跃的问题正在修复。同时,临时暂停的 5 小时使用上限继续不生效。

Updates for Codex and ChatGPT Work users. No nerfing, only good stuff!

  • We have landed inference optimizations and are passing down savings to all the subscriptions for GPT-5.6 Sol. That should result in around 10% more usage on its own.
  • We noticed that by changing the context size limit in the product to 372k for GPT-5.6 Sol, up from 272k for GPT-5.5, it resulted in more usage being charged than intended. We have reverted to 272k and will work to roll back out to 372k in the days to come.
  • To understand where the extra usage was coming from, we ran some experiments where reasoning efforts were changed (referred to as juice values under the hood) and have reverted this.
  • There is slightly more usage of multi-agent than intended in high and xhigh reasoning effort, we are fixing this going forward.
    — @thsottiaux

Codex 和 ChatGPT Work 用户更新。没有削弱,只有好消息!我们落地了推理优化并将节省传递给所有订阅用户,GPT-5.6 Sol 大约多出 10% 的使用量。注意到将上下文限制从 272k 扩大到 372k 导致了超出预期的计费,已回退。对推理预算参数的实验性调整已回滚。高/极高推理档位下多 agent 行为略超预期,正在修复。

社区反应两极分化,有人批评这是"变相削弱",但更多人赞赏这种罕见的透明度。Sam Altman 随后也发声,以一句简洁有力的表态回应了整个周末的争议。

come for the best model, stay because we don't treat you with contempt
— @sama

为最好的模型而来,因为我们不蔑视你而留下。

2. Grok Build CLI 隐私泄露:xAI 被曝上传整个 Git 仓库至云端

本周最严重的安全事件来自 xAI 的 Grok Build CLI。安全研究者通过抓包分析发现,该工具在运行时将整个 Git 仓库——包括私有代码和未脱敏的密钥——上传至 xAI 的 Google Cloud 桶(grok-code-session-traces),远超实际编码任务所需的文件范围。

‼️ BREAKING: xAI's Grok Build CLI was uploading entire Git repositories to a Google Cloud bucket, private codebases and unredacted secrets included. The uploads quietly stopped via a hidden server-side flag, and xAI still has not said a word about scope, retention, or deletion.

The scale is staggering. On a 12 GB test repo, 5.1 GB flew out the door to xAI's grok-code-session-traces bucket while the actual coding task needed just 192 KB. The tool grabbed whatever repository it ran in, not the files it needed.

The fix arrived as a hidden flag, disable_codebase_upload: true, a day after a researcher's wire-level analysis. The "Improve the model" opt-out never stopped the uploads.
— @IntCyberDigest

突发:xAI 的 Grok Build CLI 在将整个 Git 仓库上传至 Google Cloud 桶,包含私有代码和未脱敏密钥。上传通过隐藏的服务器端标志悄悄停止,xAI 至今未就范围、留存或删除作出说明。规模惊人:一个 12 GB 测试仓库中,5.1 GB 被传了出去,而实际编码任务仅需 192 KB。修复以隐藏标志 disable_codebase_upload: true 的形式出现,且"改进模型"的退出选项从未真正阻止上传。

xAI 随后回应称,对于使用零数据留存(ZDR)的团队,代码和 trace 数据不会被保留,用户可通过 /privacy 命令禁用留存并删除已同步数据。但社区对默认行为、历史上传数据的处理以及披露规范仍存疑虑。此事引发了更广泛的讨论:当你把 AI 编程工具指向私有代码时,线路上实际传输了什么比设置页面显示的内容更重要。

3. Prime Intellect 发布 Verifiers v1:Agent RL 基础设施重大突破

Prime Intellect 发布了 Verifiers v1,这是一次对其 Agent RL 基础设施的实质性重设计。核心架构将环境拆分为 taskset、harness 和 runtime 三层,并明确支持用户自定义 harness(BYOH),适用于编程和计算机操作 agent 在不同执行环境下的异构部署。

最关键的技术改进是 rollout traces 现在以 消息 DAG 的形式存储,每条消息只存储一次而非在每个完整历史中重复复制。这将 trace 增长从 O(n²) 降至 O(n),使得长周期多模态 rollout 和 router replay 变得切实可行。

you can now train:

  • a 100B-parameter reasoning model
  • for 40-turn SWE agent tasks
  • in your own coding harness
  • for 1000 RL steps
  • on just 6 H200 nodes
  • in under 2 days

infra co-design is magical
— @willccbb

你现在可以训练:一个 100B 参数推理模型,用于 40 轮 SWE agent 任务,使用你自己的编程 harness,进行 1000 步 RL,仅需 6 个 H200 节点,不到 2 天。基础设施联合设计太神奇了。

vLLM 团队也确认 Verifiers 的 rollout 路径运行在 vLLM 上,并使用精确的 token ID/logprobs 以避免推理和训练之间的 tokenization 漂移。

4. Anthropic 订阅危机:$200/月用户或将失去 Fable 5 访问权限

Anthropic 面临其付费用户社区可能是今年最大的一次信任危机。据社区消息,Anthropic 计划将最新最强模型 Fable 5 从订阅计划中移除,转为仅限 API 按量计费。这意味着每月支付 $200 的用户将无法直接使用公司的旗舰模型。

Reddit 上的讨论热度极高,多个相关帖子合计获得数千条互动。物理学家 Yuji Tachikawa(立川裕二)声称 Claude Fable 帮助解决了他与合作者搁置 6 个月的理论物理问题(后续澄清删帖仅因关注的类型不适,并非撤回主张)。用户的核心论点不是定价本身,而是可预测的配额和透明的沟通——多位用户表示将转向 Codex $200 计划或 GPT-5 等固定费用替代方案。

更深层的信号是:如果前沿模型越来越倾向于 API-only 模式,固定价格的消费者订阅可能面临结构性变化。

5. Hugging Face Transformers 与 vLLM 整合:一次实现,到处部署

Hugging Face 宣布 Transformers 模型现在可以在 vLLM 中以原生速度运行,性能通常匹敌甚至超越手写实现。这解决了开源 AI 生态长期存在的痛点——每个新架构需要实现两次:一次在 Transformers 中用于研究和训练,一次在 vLLM 中用于高性能推理。

Big unlock for open-source AI inference: Hugging Face Transformers models can now run in vLLM at native speed, often matching or beating hand-written implementations.

Until now, every new architecture often needed to be built twice: Once in Transformers for training and research, again in vLLM for fast production inference.

The conventional wisdom is that abstractions make systems slower. The best abstractions make the whole ecosystem faster.
— @ClementDelangue

开源 AI 推理的重大突破:Hugging Face Transformers 模型现在可以在 vLLM 中以原生速度运行,通常匹敌甚至超越手写实现。此前每个新架构通常需要实现两次:一次在 Transformers 用于训练和研究,一次在 vLLM 用于快速生产推理。传统智慧认为抽象会让系统变慢,但最好的抽象让整个生态系统更快。

基准测试显示,Transformers 后端在从 4B 到 235B 参数的模型上,吞吐量匹配或超越原生 vLLM,覆盖 tensor parallel 和 MoE 配置。这有望显著加速新模型架构的采纳和部署。

6. 中国 AI 模型霸榜 OpenRouter 前五,成本优势驱动实际使用量

OpenRouter 的最新模型使用量排行榜显示,中国模型占据了前五名位置,前十中占据七席。DeepSeek、MiMo、MiniMax、Hy3 等模型领先于西方前沿模型,Anthropic Claude 仅出现在第 6 和第 8 位,OpenAI 和 Google 则完全跌出前十。

这反映的实际趋势是——成本正在成为比基准测试分数更重要的指标。正如社区所总结的:"benchmark 很难比较,但账单很容易比较。" 另一方面,这也可能因为 OpenAI 和 Google Gemini 的大量用户直接访问官方 API,而非通过聚合平台。中国较低的电力成本也被认为是推理定价竞争力的一个因素。

此外,消息称 DeepSeek 正在开发自研 AI 芯片,作为应对受限 GPU 供应的长期策略。

7. Coding Agent 竞争升级:Harness 成为产品核心,成本从 Token 转向任务

行业的关注点正在从模型质量转向 Harness/Orchestrator 设计。多篇帖子一致认为,编程 agent 的胜负手不再是模型本身,而是任务专用的 harness。LangChain 创始人明确指出,赢家将来自任务专用 harness 而非通用封装器。Factory 推出了"设计模式"UI,让用户直接指向界面元素而非口头描述修改。

成本计量方式也在变化:Cognition 报告称 Devin Fusion 使用 Fable 5 后,由于更强的委派和判断能力减少了不必要操作,每任务成本反而低于 Opus 4.8。关键数据是:在 81% 的 Fable 主导运行中,主模型从未做过代码编辑。Arena 的 agent 排行榜基于 7.8K 真实世界 session,GPT-5.6 Sol 排名第 2,Grok-4.5 跃升至第 13 位。

8. Claude 价值观跨模型跨语言研究:Anthropic 分析 30 万+对话

Anthropic 发布了一项大规模价值观研究,分析了 30 万+匿名对话中 Claude 表达的价值观如何因模型版本和语言而变化。

In previous research, we found that Claude expresses over 3,000 values, like honesty and warmth. In new work, we asked how the values Claude expresses vary between Claude models and across languages. We analyzed 300K+ anonymized conversations to find out.
— @AnthropicAI

在先前研究中,我们发现 Claude 表达了超过 3000 种价值观,如诚实和温暖。在新工作中,我们探索了 Claude 表达的价值观如何在模型之间和跨语言变化。我们分析了 30 万+匿名对话来寻找答案。

研究将价值观压缩为四个可解释的轴,为理解和控制大模型在不同文化和语言环境中的行为提供了新视角。

9. 持续学习成为系统级研究方向:从 Morpheus 到"LLM 的睡眠与梦境"

持续学习正重新涌现为一流系统问题。多个相关工作集中在这一方向:Skyfall AI 推出 Morpheus——一个持久的企业仿真环境用于真实世界 RL,世界不会像传统 episodic RL 那样重置,获得了 François Chollet 的背书;一篇新论文提出 LLM 可能需要一个"睡眠阶段"来巩固短期记忆到长期记忆,以及一个"梦境阶段"用于递归自我提升,引入知识播种(Knowledge Seeding)机制;同时,强化学习先驱 Rich Sutton 与合作者成立 Oak Lab,追求从经验中学习的"动物级智能"。

10. 开源硬件与推理优化:E-Waste GPU 基准测试与 P100 静默错误修复

社区对旧 GPU 推理的热情不减。一份长达一年的基准测试覆盖了 15 款 Tesla "电子垃圾" GPU,结论是 V100 16GB 性价比最高,P40 在 LLM 推理上优于 P100(存疑的技术争议点)。更关键的是,社区发现 Tesla P100 在 llama.cpp 中因一个架构分类错误,在 fp16 快速路径上产生了静默的数值噪声已有数年。仅三行代码的 CUDA 补丁将 KL 散度中位数从 0.0023 改善至 0.000001(约 2300 倍),top-token 一致性从 96.5% 提升至 99.9%,且无性能损失。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!