Ornith-1.5 开源发布,9B 至 397B 全系
Ornith-1.5 开源发布,9B 至 397B 全系
1. Ornith-1.5 开源发布:MIT 协议、9B 至 397B,宣称对标 Claude Opus 4.8
当天最重磅的发布来自 Ornith。@ornith_ 一口气放出 Ornith-1.5,覆盖 9B Dense、35B MoE、397B MoE 三个规格,全部采用 MIT 协议,并提供 FP8、GGUF、MLX、NVFP4 等量化格式。核心卖点是"端到端自我改进":模型自己提出新任务、生成任务专用脚手架、产出用于强化学习的 rollout,从而持续创造新的训练经验——这是对 Ornith-1.0 中 self-scaffolding 策略的完整闭环扩展。
跑分方面相当能打:Terminal-Bench 2.1 86.1、SWE-Bench Verified 86、DeepSWE 56、HLE 44.6、ClawEval 81.4、Tool Decathlon 71.2。发布后很快被 vLLM 和 Ollama 接入推理栈。
Aloha! 🌺 Introducing Ornith-1.5, a family of open-source LLMs spanning 9B Dense, 35B MoE, and 397B MoE, trained with self-improving strategies. It achieves state-of-the-art performance among open-source models of comparable size and delivers performance comparable to Claude Opus 4.8 across reasoning, agentic, and coding tasks: Terminal-Bench 2.1 (86.1), SWE-Bench (86 on verified), DeepSWE (56), HLE (44.6), Tool Decathlon (71.2).
— @ornith_中文翻译:Aloha! 介绍 Ornith-1.5,一个覆盖 9B Dense、35B MoE 和 397B MoE 的开源 LLM 系列,采用自我改进策略训练。它在同规模开源模型中达到 SOTA,并在推理、Agent 与编程任务上达到可与 Claude Opus 4.8 媲美的表现:Terminal-Bench 2.1(86.1)、SWE-Bench(Verified 86)、DeepSWE(56)、HLE(44.6)、Tool Decathlon(71.2)。
这条推文转发超 700、点赞近 5000,被普遍视为开源阵营对标 Claude Opus 4.8 的一次正面冲击。
2. OpenRouter 加入 Stripe:token 路由成为核心基础设施
Stripe CEO Patrick Collison 亲自确认 OpenRouter 被 Stripe 收购。他把 token 市场比作"智能资本的新货币",认为未来每家企业都要同时管理资金流和 token 流。
OpenRouter is joining Stripe… OpenRouter is the world's leading token marketplace, helping businesses effectively allocate the new currency of intelligence capital. We think that there's a lot to build together.
— @patrickc中文翻译:OpenRouter 将加入 Stripe……OpenRouter 是全球领先的 token 市场,帮助企业高效配置"智能资本"这一新货币。我们认为有很多可以一起建设的东西。
这起收购被广泛解读为对 token 路由/模型市场这一赛道的强力背书:它正从边缘工具升级为核心基础设施。
3. Z.ai 创始人 Jie Tang 发文谈 Scaling Law:GLM-5.3 靠一个月 RL 换大提升
清华教授、Z.ai 创始人 Jie Tang 发布长文《Thoughts About Scaling Law》,核心观点是 scaling 并未结束,只是业界过度聚焦了参数量。他回顾了从 Kaplan 到 Chinchilla 再到 MoE 稀疏化的演进,指出总参数量决定"知识容量",而激活参数与有效深度决定"推理深度"。
GLM-5.3 被作为受控实验:与 GLM-5.2 相同的基座、架构、总参数与激活参数,唯一变化是约 一个月的长程环境 + RL 训练,收益"不是边际性的"。
Interesting take by the zAI (GLM-Models) founder: AI scaling is not over, but we just focused too much on model size… GLM-5.3 reportedly uses the same base model, architecture and parameter count as GLM-5.2. The main change was one month of additional reinforcement learning, and the gains were very substantial.
— @kimmonismus中文翻译:zAI(GLM 模型)创始人提出了一个有意思的观点:AI scaling 并未结束,只是我们过去过度聚焦于模型规模……GLM-5.3 据说使用了与 GLM-5.2 相同的基座模型、架构和参数量,主要变化只是一个月的额外强化学习,而收益非常显著。
4. Gemini 3.7 Flash 登顶 AA-AnalystAgent,并深度嵌入 Google 产品
@_philschmid 等指出 Gemini 3.7 Flash 在 Artificial Analysis 新的 AA-AnalystAgent 榜上排名第一,评测覆盖 80 个跨 14 个领域(金融、医疗、水文、政府拨款等)的真实定量分析任务。
Gemini 3.7 Flash just took #1 on @ArtificialAnlys new AA-AnalystAgent… Accuracy: #1 with 60.0% pass^5 (70.5% pass@1, 77.5% pass@5) • Speed: 1.32s per task (fastest) • Cost: $0.54 avg per task (middle)
— @_philschmid中文翻译:Gemini 3.7 Flash 刚刚在 Artificial Analysis 新的 AA-AnalystAgent 榜上拿下第一……准确率:第一,60.0% pass^5(70.5% pass@1,77.5% pass@5);速度:每任务 1.32 秒(最快);成本:平均每任务 $0.54(中等)。
Google 同时把它推进更多产品面:Gemini chat 与 Spark、AI Mode 中即时生成的搜索式交互模拟,以及 AI Studio 的 GitHub sync 用于构建工作流。
5. Anthropic:Claude 自主设计疾病靶向蛋白,湿实验成功率 35%
Anthropic 报告 Claude 能自主生成疾病靶向蛋白设计,并在湿实验中得到验证,成功率 35%,对比人类蛋白设计基线约 10–15%。关键点不在 in silico 打分,而在于真实实验验证——这暗示 Claude 有望成为治疗性蛋白工程迭代设计的引擎,若对比方法公平则意味着超过 2 倍的提升。
6. Anthropic 收入 $11.6B,超过 OpenAI 同期 $6.7B
WSJ 报道:Anthropic 营收同比翻倍至 $11.6B 并实现小幅运营盈利;OpenAI 季度营收增至 $6.7B 但运营亏损扩大。所谓"两倍"实为约 1.7 倍(11.6 / 6.7 ≈ 1.7)。这显示尽管社区有"用户抛弃 Claude"的叙事,企业/市场采用可能强于可见的消费者情绪。
7. TrueFoundry 开源 TrueForge:harness 本身成为成本变量
TrueFoundry 开源了 MIT 协议的 TrueForge——一个自托管、厂商中立的 agent harness,包含工具编排、上下文管理、子 agent、代码沙箱、人工审批与 trace。其核心主张是:保持模型不变,harness 也能显著改变经济学。在 14 任务的 DevRev Enterprise-Bench 上,TrueForge 达到与 Claude Managed Agents 大致相同的答案,却只用约 40% 的 token、单次运行成本低约 30%;换用 GLM-5.2 后,相对 Opus 4.8 的 $11.8/次,成本下降约 75% 而解决率相近。
TrueForge reached roughly the same answers as Claude Managed Agents while using about 40% of the tokens and costing roughly 30% less per run. Compared with Claude Managed Agents on Opus 4.8 at $11.8 per run, that is roughly 75% lower cost at a similar solve rate.
— @truefoundry中文翻译:TrueForge 得出了与 Claude Managed Agents 大致相同的答案,却只用了约 40% 的 token,单次运行成本低约 30%。与 Claude Managed Agents 在 Opus 4.8 上每次 $11.8 的成本相比,成本降低了约 75%,且解决率相近。
8. DeepSeek Harness(DSH):极简是刻意设计,一切皆插件
关于 DeepSeek Harness 的解读指出,DSH 是一个刻意做薄的壳,底层是名为 Cordis 的插件架构,连 agent loop 本身都是插件。早期 beta 用户一周内贡献了 100+ 插件、提交 400+ issue,从五子棋模型测试床到闭环 SQL 数据库 agent(把模型连接到实时查询执行)皆有。其定位更像"开放 agent runtime",而非产品化的助手,强调用户可扩展工具、可替换控制回路与业务规则注入。
9. OpenAI:私有安全处理 + GPT-5.6 Luna 免费化
OpenAI 宣布继续为前沿模型提供 Zero Data Retention(零数据留存),并预览 Private Safety Processing,在不让人工接触到底层内容的前提下识别跨交互安全风险。
We will continue to offer Zero Data Retention for frontier models… we're previewing Private Safety Processing, which is designed to improve safety without giving OpenAI personnel access to the underlying content.
— @OpenAI中文翻译:我们将继续为前沿模型提供 Zero Data Retention(零数据留存)……我们正在预览 Private Safety Processing(私有安全处理),其设计目标是在不让 OpenAI 人员接触底层内容的前提下提升安全性。
另一边,Replit 推出由 GPT-5.6 Luna 驱动的 Free Mode,被解读为效率胜利——不久前还是 SOTA 级的模型如今便宜到可以广泛免费送出。
10. Unsloth 发布 Qwen3.8-27B Dynamic V3 GGUF:1-bit 量化保住 77% BF16 精度
Unsloth 发布 Qwen3.8-27B Dynamic V3 GGUF,宣称同体积下 top-1% 精度较其他供应商提升约 10%,并提供 1-bit 量化——在 8GB RAM 上运行仍保留约 77% 的 BF16 精度。新的 Divergence-300 指标把 top-1% 贪心精度扩展到更长生成,使用 Terminal Bench、DeepSWE 等未见样本。社区反馈积极,也有人请求补上与上一代 UD 2.0 量化的直接对比、按类别与 KV-cache 量化的 KLD 数据。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu