AT&T 40% AI 流量转开源模型,编码成本降 56%
AT&T 40% AI 流量转开源模型,编码成本降 56%
8 月 19–20 日的 AI 新闻表面安静,实则埋着几条重要信号:企业侧开始大规模转向开源模型、OpenAI 与 Anthropic 的 Agent 产品面继续扩张、多模态与 Agent 基准测试密集刷新。以下是当日最重要的 10 个事件。
1. AT&T 成为企业混合路由最清晰的公开案例:40% 流量已走开源模型
当日最具战略意义的企业数据点来自 AT&T 的内部 AI 部署总结:员工 AI 使用中已有 40% 路由到开源模型,目标是进一步提升到 60–70%;在规模达 450 亿 token/天 的用量下,编码成本下降了 56%,而质量仅下降 2%。AT&T 的 AI 负责人称开源模型在许多任务上"一样好甚至更好",前沿闭源模型仍保留给最关键的硬任务,其余全部交给更便宜的开源模型。
这一数据支持了日渐流行的判断:前沿闭源模型正在退守最难的那一小块任务,而"够用就好"的开源模型正在吃掉企业需求的中间腹地。@amir 直接将其解读为对 OpenAI/Anthropic 企业护城河的警告信号,而 @ollama 则欢迎 AT&T 加入开源阵营。
AT&T is doing exactly what OpenAI and Anthropic fear about enterprise. they're routing 40% of employee AI usage to open models, and intend to boost it to 60-70%. coding costs down 56%, quality dropped just 2%, 45B tokens/day btw. AT&T AI chief: open models are "just as good or better" for many tasks. they still use frontier models for the critical work but everything else gets routed to cheaper open models.
— @HesamationAT&T 正在做 OpenAI 和 Anthropic 在企业侧最担心的事:他们把 40% 的员工 AI 用量路由到开源模型,并打算提升到 60–70%。编码成本下降 56%,质量只降了 2%,而且每天 450 亿 token。AT&T 的 AI 负责人说,开源模型在很多任务上"一样好甚至更好"。他们仍然用前沿模型做关键工作,其余一切都交给更便宜的开源模型。
2. OpenAI 一波推送桌面与构建器功能:Apple Messages 插件 + ChatGPT Sites 协作编辑
OpenAI 在同一波更新里打包推送了多个桌面与构建器能力。ChatGPT 在 Mac 上推出了 Apple Messages 插件,支持在桌面端搜索消息、追赶对话进度、草拟并发送回复,现已上线 ChatGPT Work 和 Codex。同时,@OpenAIDevs 为 ChatGPT Sites 加入了协作编辑,团队成员可共享一个项目、由 Codex 管理 git/CI;配合只读对话分享链接与 PR 上下文分享,ChatGPT/Codex 正在从一个聊天界面走向一个"协调工作台"。API 侧,GPT-Image-2 的透明背景功能进入 preview,可用于生成可复用的设计素材。
此外,OpenAI 的桌面记忆/工作流功能继续按地区铺开:Computer History 与跨应用记忆已在 EEA、英国和瑞士上线(面向 Pro/Business/Enterprise 的 Mac 用户),Record & Replay 也同步落地。这些功能共同指向一个产品策略:在设备端捕获用户工作流,把重复动作沉淀为可复用的技能。
Everyday conversations just got easier with the new Apple Messages plugin. Search messages, catch up on conversations, draft and send replies—all with ChatGPT on your Mac. Now available in ChatGPT Work and Codex on desktop.
— @ChatGPT日常对话因新的 Apple Messages 插件而变得更轻松。搜索消息、追赶对话进度、草拟并发送回复——全都在 Mac 上的 ChatGPT 里完成。现已上线桌面端的 ChatGPT Work 和 Codex。
3. Anthropic Agent 平台全面 GA:computer use、浏览器工具、Skills API、Files API
Anthropic 让自家 Agent 平台更可组合、更贴近生产。@ClaudeDevs 宣布 computer use、browser tool、Skills API 和 Files API 在 Claude 平台上正式 GA。其中 Skills API 增加了可版本化复用的流程;Files API 支持过期控制、速率上限提升 5 倍至 500 RPM、以及每组织 1 TB 的容量。Anthropic 还发布了 Claude Managed Agents 的 AG-UI 适配器,可将聊天线程映射到托管会话,并把文本、工具调用与思考过程流式输出到自定义 UI。
这标志着 Anthropic 的 Agent 平台从实验走向成熟:开发者现在可以在没有 API 的应用里自动化工作、减少每次任务的路由往返,并在版本化技能与可复用文件之上构建托管 Agent。
Computer use, the browser tool, the Skills API, and the Files API are now generally available on the Claude Platform. Automate work in applications that have no API with fewer round trips per task, and build Claude Managed Agents on versioned skills and reusable files.
— @ClaudeDevscomputer use、浏览器工具、Skills API 和 Files API 现已在 Claude 平台上正式 GA。用更少的单任务往返次数,在没有 API 的应用里自动化工作,并在版本化技能与可复用文件之上构建 Claude Managed Agents。
4. 闭源模型价格战加剧:GPT-5.6 Sol 五折,同时用量上限争议浮现
价格压力正在闭源模型分发端加剧。@eglyman 宣布 GPT-5.6 Sol 通过 Router 五折促销,@github 和 @code 也为 GitHub Copilot / VS Code 用户放大了这一临时折扣。与此同时,用户情绪显示供应约束正以"用量上限"而非"质量下降"的形式浮现:@bridgemindai 抱怨 200 美元/月的 OpenAI Pro 计划可能在一次重度 Codex 使用中就被耗尽,@theo 则指出在触达标称上限后仍可能继续消耗大量 token。
更广的信号是:各实验室仍在寻找高端模型访问与经济上可持续的 Agent 用量之间正确的产品边界。
5. Meta Muse Spark 1.2 基准大放异彩:Agent Arena 净提升 +2.1%
Meta 的 Muse Spark 1.2 迎来一个强劲的基准日。@AIatMeta 展示了覆盖视觉编程、机器人规划、音视频理解的 demo,并预告了内部评测 WildArtifactBench——用人类/Agent 评判的胜率与 Elo 来衡量实用多模态任务。第三方测量同样利好:@arena 报告其在 Agent Arena 净提升 +2.1%(v1.1 为 0.9%),尤其在 Bash Recovery 上达到 +11.4%;@DesignArena 将其列为 Video-to-Website 第 1、Image-to-HTML 第 2、Image-to-Frontend 第 3,同时指出它坐落在"价格-偏好"帕累托前沿上。
Muse Spark 1.2 (xHigh) by @AIatMeta is now in Agent Arena, with a net improvement of +2.1%! Muse Spark 1.2 improves on Muse Spark 1.1, more than doubling the Net Improvement score from 0.9% to 2.1% (~2.3x). By signal, Muse Spark 1.2 (xHigh) improved significantly in Bash Recovery (CLI error recovery) compared to Muse Spark 1.1, from +5.9% to +11.4%!
— @arenaMeta 的 Muse Spark 1.2 (xHigh) 现已进入 Agent Arena,净提升 +2.1%!相比 Muse Spark 1.1,净提升分数从 0.9% 翻倍多到 2.1%(约 2.3 倍)。按信号看,Muse Spark 1.2 (xHigh) 的 Bash Recovery(CLI 错误恢复)相比 1.1 从 +5.9% 大幅提升到 +11.4%!
6. 智谱 GLM-5.3 Max 移动 Code Arena WebDev 帕累托前沿
智谱的 GLM-5.3 持续出现在 Agentic/代码评测中。@AutoClawAIer 宣布 GLM-5.3 集成进 AutoClaw(Z.ai 的工作 Agent)。更重要的是,@arena 称 GLM-5.3 Max 移动了 Code Arena: WebDev 的帕累托前沿,预计在开源模型中排第 2、总榜第 8,成绩 1597 分、3.65 美元/M token。此外,@ZixuanLi_ 重新提起 SAO(Single-Rollout Asynchronous Optimization,单次 rollout 异步优化),视其为 GLM-5.2/5.3 在稳定异步 Agentic RL 上的关键进展。
7. Gemini 3.7 Flash 继续积累"便宜又强"的证据
Gemini 3.7 Flash 在成本调整后的推理表现上继续凸显。@arcprize 报告其在 ARC-AGI-2 上拿到 84.6%(0.25 美元/任务)、ARC-AGI-1 上拿到 95.5%(0.12 美元/任务),在相对其他前沿模型的低成本与高得分上格外突出。@JonathanJarvis 则单独称其非常适合Agentic 视觉任务。
Gemini 3.7 Flash from @Google on ARC-AGI (Verified): - ARC-AGI-2: 84.6%, $0.25/task - ARC-AGI-1: 95.5%, $0.12/task. Gemini 3.7 Flash stands out for its low cost and high scores on ARC-AGI-1 and ARC-AGI-2 relative to other frontier models.
— @arcprizeGoogle 的 Gemini 3.7 Flash 在 ARC-AGI(已验证)上的成绩:ARC-AGI-2 为 84.6%、0.25 美元/任务;ARC-AGI-1 为 95.5%、0.12 美元/任务。相比其他前沿模型,Gemini 3.7 Flash 在 ARC-AGI-1 与 ARC-AGI-2 上以低成本、高分数脱颖而出。
8. OpenAI 下一代预训练算力上 Rubin:首批 NVIDIA Vera Rubin 机架就位
OpenAI 的下一代预训练基础设施出现罕见的具体信号。@udayruddarraju 发文称 OpenAI 的首批 NVIDIA Vera Rubin 机架已经安装并运行训练栈,明确与"下一代前沿预训练"挂钩。@gdb 将其称为 OpenAI 与 NVIDIA 合作中的一个重要里程碑。
A milestone for our infrastructure: our first NVIDIA Vera Rubin racks are here and now running our training stack. This is an important step as we expand compute that powers OpenAI's next generation of frontier AI pre-training.
— @udayruddarraju我们基础设施的一个里程碑:首批 NVIDIA Vera Rubin 机架已经到位,并正在运行我们的训练栈。这是我们在扩展驱动 OpenAI 下一代前沿 AI 预训练算力上的重要一步。
9. Cerebras CS-4:不缩小制程节点的推理扩展
Cerebras 的 CS-4 因"不做节点缩微"的推理扩展而受到关注。@kimmonismus 总结这次发布是在同样的 5nm 晶圆、4 万亿晶体管、90 万 AI 核心上通过重新设计供电与散热实现性能翻倍。报告的规格包括每个 WSE-3 Turbo 250 PFLOPs、43.2 PB/s 内存带宽,以及 3 晶圆 CS-4 机架 750 PFLOPs。对从业者最有说服力的说法是:在 GPT-OSS-120B 上每用户 4,400+ tok/s,最高比基于 GPU 的系统快 30 倍。
10. Qwen3.8-27B 的量化与提速:Unsloth Dynamic v3 与 DFlash2
本地 LLM 社区的热点集中在 Qwen3.8-27B。Unsloth 发布 Dynamic v3.0 GGUF 量化,宣称在同尺寸下 top-1 准确率较其他量化提供方提升 >10%,仅做后训练量化(无 QAT/QAD、不在 imatrix 校准集上训练),内存目标从约 8GB RAM 可跑的 1-bit 量化覆盖到 BF16。推理侧,llama.cpp PR 加入的 dflash2 在 RTX 6000 上把中位吞吐从基线 47.4 tok/s 拉到 140.6 tok/s(约 3 倍);另一份 RTX 3090 优化栈则报告单请求约 138 tok/s、64 并发 942 tok/s。
社区也注意到一个权衡:Qwen3.8-27B 相对 3.6 在离线/纯权重的事实记忆上有明显回退(与 Artificial Analysis 的 Omniscience 知识基准一致),但在工具调用、编码与 Agentic 工作流上更强——这被普遍解读为 27B 参数容量下"把记忆型冷知识换成编码/Agent 能力"的有意取舍。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu