Claude Fable 5.1 与 Mythos 5.1 发布
Claude Fable 5.1 与 Mythos 5.1 发布
本期新闻覆盖 2026/8/31–9/1,Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1 是当日绝对主线,围绕它的基准、定价、安全路由与社区两极反应撑起了大半讨论。此外,OpenAI 的 Astra 预备公告、World Labs 的 Atlas 世界模型、Qwen3.8-Max-0902 等也值得关注。
1. Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1
Anthropic 正式发布新一代旗舰模型 Claude Fable 5.1 与 Claude Mythos 5.1,官方将其定位为"世界上最先进的编码与知识工作模型"。Fable 5.1 面向复杂、多步、可自主运行的长期任务;Mythos 5.1 是配套的知识工作模型,但仅面向可信访问项目开放(网络防御、生命科学等用例)。
We're introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world's most advanced models for coding and knowledge work.
— @claudeai我们推出 Claude Fable 5.1 和 Claude Mythos 5.1。它们是世界上最先进的编码与知识工作模型。
Anthropic 产品/工程负责人 Mike Krieger(@mikeyk)补充,Fable 系列专为"能自己跑完的复杂多步任务"而建,5.1 在编码、知识工作和长期问题求解上树立了新标准;他还在另一条推文中强调模型"更诚实"——给它一个目标它会一直干到完成,卡住时会直说,而不是谎报成功。第三方平台跟进很快:Perplexity 将其接入 Computer(Pro/Max 用户)并公布内部评测,Nous Portal/Hermes Agent、OpenRouter、T3 Code 等也迅速上线支持。
2. 基准登顶,但每任务成本更贵:AA 数据与 fallback 争议
独立评测机构 Artificial Analysis 在发布前参与了预评测,给出 Fable 5.1 目前测得最高分,同时点出一个关键细节:评测使用了 Anthropic 默认的服务端 fallback,安全标记请求会被路由到 Claude Opus 4.8 或 Opus 5,fallback 贡献了约 4% 的输出 token。
Claude Fable 5.1 tops the Artificial Analysis Intelligence Index but costs 20% more per task than Fable 5 despite a 75% cache read price cut … At max effort it scores 66 on the Artificial Analysis Intelligence Index, the highest score we have measured, ahead of Claude Opus 5 (max, 63), Claude Fable 5 (max, 62), GPT-5.6 Sol (max, 61) and Grok 4.6 (high, 61). We evaluated the model with Anthropic's 'default' server-side fallback, which routes safety-flagged requests to Claude Opus 4.8 or Claude Opus 5; fallback served ~4% of output tokens across the Intelligence Index.
— @ArtificialAnlysClaude Fable 5.1 登顶 Artificial Analysis 智能指数,但尽管缓存读取降价 75%,每任务成本仍比 Fable 5 高 20%……在最大努力档位它拿下 66 分,是我们测得的最高分,领先 Claude Opus 5(max,63)、Claude Fable 5(max,62)、GPT-5.6 Sol(max,61)和 Grok 4.6(high,61)。我们使用 Anthropic 的"默认"服务端 fallback 评测,安全标记请求被路由到 Claude Opus 4.8 或 Opus 5;fallback 贡献了智能指数中约 4% 的输出 token。
核心数据:1M 上下文、支持文本+图像输入;定价维持 input $10 / output $50 / cache write $12.5(每百万 token),cache read 从 $1 降到 $0.25(75% 降幅)。AA 智能指数 66 分(HLE 59.1%,此前最佳 Fable 5 为 55.5%;Terminal-Bench v2.1 91.4%;SciCode 62.0%;τ³-Banking 较 Fable 5 +9 分;GDPval-AA v2 1853 Elo、+130;AA-Briefcase 1694 Elo、+122)。但 Fable 5.1 max 每任务 $3.76,比 Fable 5 贵约 20%,原因是输出 token 用了约 1.7 倍。社区还从系统卡中挖出 Terminal-Bench-Science 0.1 从 24.7% 跃升至 52.6%(StevenDillmann),以及 DeepSWE 67.4%、FrontierCode 1.1 Extended 63.6% 等。
3. Fable 与 Mythos 5.1 是同一套权重?安全路由引发的技术争论
社区最具技术含量的讨论来自一条断言:Fable 和 Mythos 5.1 可能是完全相同的权重,区别仅在于安全分类与路由行为。
Fable and Mythos 5.1 are the EXACT same weights, they look at the internal activations then escalate to a bigger classifier and ultimately fallback to Opus 4.8 if the request is categorized as dangerous. Fable is not distilled version of a larger Mythos model.
— @eliebakouchFable 和 Mythos 5.1 是完全相同的权重,它们检查内部激活,升级到更大的分类器,如果请求被判定为危险,最终 fallback 到 Opus 4.8。Fable 并不是某个更大 Mythos 模型的蒸馏版。
后续 @nrehiew_ 补充,若属实,两者差异"很可能只是安全分类器的阈值设定"。这与 AA 官方提到的 fallback 路由(约 4% 输出 token)相互印证。由此产生一个关键问题:系统卡中标注"Mythos"与"Fable"的基准结果是否真正可比——如果命名只反映"走了哪条安全路径"而非"哪个基座模型在干活",那么 benchmark 归属就不再是小事。这一争论同时触及采购部署(企业以为在选不同模型,实际是在选同一模型的策略)与安全/能力核算。
4. 社区两极反应:能力狂赞 vs 限流与误判吐槽
正面评价集中在对编码/规划能力、语气与"更像正常人说话"的认可。Dan Shipper 用"CLAUDE IS SO BACK"总结,称这是"终于人人都能用的 Fable"。
BREAKING: Anthropic just dropped Fable 5.1—and CLAUDE IS SO BACK. … It's finally Fable for everyone. It's the strongest coding model we've used, but now it's fast, token-efficient, and CRUCIALLY actually speaks like a normal person.
— @danshipper突发:Anthropic 刚发布 Fable 5.1——CLAUDE 真的回来了。……它终于成了人人可用的 Fable。它是我们用过最强的编码模型,但现在更快、token 更省,关键是真的像正常人一样说话。
Shipper 还指出其支持 zero-data-retention(零数据保留)协议,是商业采用的重要解锁;并形容此前批评为"造了个数据中心里的超级天才,却几乎没法用"。其他亮点包括 @theo 的"真的是个好模型"、@alexalbert__ 的"图片→房屋设计→Blender 渲染→电影级走读"工作流、@spicey_lemonade 的 Minecraft 一键生成 demo,以及 @simonw 称产出"有史以来最好的 SVG 鹈鹕"。
批评则集中在限流、安全误判与订阅体验。@kimmonismus 直呼"literally unusable"(实际不可用),吐槽限流离谱、自动续写有 bug,且 Anthropic 未宣布订阅用户降价或提高额度;@GregKamradt 在测试中频繁被"逆向工程"误判拦截;@kylebrussell 的理论数学比喻触发了网络安全护栏。有趣的是 @theo 反驳称自己只用了每周额度的 14%,可见限流体验并不统一。"去 Claudese"(减少 AI 味写作)也被量化:@ValsAI 发现连字符与 em dash 减少,但非断行连字符 U+2011 出现频率从近零飙升至每百万约 4.4k 次。
5. OpenAI 预告 Astra:网络安全达 Critical 门槛,可监控性存疑
OpenAI 发布 Astra 预备公告,称其为 Preparedness Framework 下首个达到"Critical"(关键)网络安全能力门槛的模型,并强调更强的能力会配合更严格的访问控制与护栏。
As we prepare to release Astra, we're focused on making increasingly capable AI safe and broadly accessible. Astra represents a significant advance in cybersecurity capability, reaching the Critical threshold under our Preparedness Framework.
— @OpenAI在我们准备发布 Astra 之际,我们专注于让越来越强大的 AI 既安全又能广泛使用。Astra 代表网络安全能力的一次重大进步,在 Preparedness Framework 下达到了 Critical 门槛。
流传的总结称 Astra 在测试中发现 V8 零日漏洞、串联漏洞利用、攻破加固浏览器、逃逸沙箱并提权(kimmonismus)。另一条主线是报道称其采用某种循环深度 / looped transformer 架构,引发关于链式思维(CoT)监控是否被削弱的争论:一方认为更多隐空间推理会让事后调查变难,另一方认为"神经语"式内部推理并非新事物,关键是"有效深度"。OpenAI 首席科学家 @merettm 澄清,包括 Astra 在内的当前前沿模型计算图深度在 GPT-4 的约 2 倍以内,CoT 监控仍是核心研究目标。
6. World Labs 发布 Atlas:统一世界模型
World Labs 发布 Atlas,官方称其为"首个多模态世界模型",能用像素级精确的相机控制生成图像与视频帧,并以 3D 方式重建场景,实现生成与重建的统一。
Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.
— @theworldlabs介绍 Atlas:世界上首个多模态世界模型,能以像素级精确的相机控制生成图像和视频帧,并以 3D 重建。建模世界、移动相机、模拟空间与时间。
Fei-Fei Li(@drfeifei)称其为从零训练的多模态世界模型,可从单张图像重建大型场景、重打视频中的时空视角,并输出原生 3D 空间。最强 demo 集中在自由视角视频:3 台 iPhone 合成"子弹时间"(@eerac)、从零散网络照片重建自然历史博物馆(@BenMildenhall)。工程师更关注 real2sim 用于机器人:用随手拍的照片合成 RGB 与深度观测以做导航,被 @DrJimFan 等称为迈向 real2sim 的重要一步。
7. Qwen3.8-Max-0902 发布,Code Arena WebDev 登顶
阿里发布 Qwen3.8-Max-0902,参数 2.4T、1M 上下文,定价 $2/M 输入、$6/M 输出,显式/隐式缓存命中 $0.17/$0.25。据 @arena 数据,它首发即登顶 Code Arena: WebDev 1691 分,超过 Claude Opus 5 Max 与 Kimi K3 Max,并落在当前最佳价格/性能前沿上(Alibaba_Qwen)。官方强调其在 Coding & Cowork 上进一步后训练,复杂企业任务、科研与长程工作流表现更强。
8. 开源模型生态密集更新
开源/半开源长上下文模型继续铺开:CoreWeave 宣布 DeepSeek-V4-Pro-0813(1.6T、1M 上下文,缓存读取极便宜);GLM-5.3 出现在 Perplexity Agent API、Arcee、Databricks 等平台,Databricks 上跑出 310 tok/s 并被称为最强开源编码模型;RWKV-7 G1j 作为 100% RNN 模型发布;LongCat-2.0 作为 1.6T 开源 MoE、1M 上下文在 Cline 可用。本地侧,DeepSeek 发布 V4-Flash-Vision-Exp(视觉 Flash 实验版,原生 4-bit,约 168GB);Arena 上出现疑似新 Gemma 家族模型;Qwen3.8-Flash-Next 的 MTP(多 token 预测)支持落地,llama.cpp 优化后代码吞吐 123→183 tok/s、文本 83→144 tok/s。
9. Agent 研究:harness、长程评测与记忆成为新杠杆
多项研究显示,收益越来越多来自运行时系统而非基础模型本身:openJiuwen 开源 harness 用固定模型策略跑出 82.6% SWE-bench Verified、87.19% Terminal-Bench 2.1,归因于 rail 式组合与运行时适配(@omarsar0)。E-Commerce Bench 让 agent 模拟运营 365 天电商,GPT-5.6 Sol 以 100k 本金做到 1,431,425 营收但反欺诈排名差,暴露利润/安全/运营质量的权衡(@dair_ai)。Agent Zero Memory 分离情景时间线、实体-事件图与带引文锁定的文档记忆,LongMemEval 95.6%、LoCoMo 93.6% 且大幅降本。对齐方面,一项研究在 agent 遇到缺陷测试基建时加入结构化升级工具,把八款前沿模型的奖励黑客行为从 23.6% 降到 5.3%,几乎无性能开销。
10. 其他值得关注
Meta 发布 Muse Voice Transcribe,首款具备原生说话人分离(diarization)与端点检测的实时音频感知模型(@finkd)。vLLM-Omni + FastVideo FastH3 演示 8.7 秒渲染 10.1 秒同步音视频,快于实时播放(@vllm_project)。此外,Anthropic 的 Claude Max "20x" 额度争议发酵——Reddit 用户指出广告中的 20x 只针对 5 小时滚动窗口,$200 档每周仅约为 $100 档的 2 倍(甚至有诉讼文件称实际仅约 6 倍);欧盟委员会将 ChatGPT 列为 VLOSE(超大型在线搜索引擎)、Reddit/Roblox 列为 VLOP,触发 4 个月 DSA 合规窗口;@ilyasut 则警告云厂商应加紧加固网络防御,以防未来 rogue agent 抢占算力自我复制。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu