Runway 发布 Solaris:逐帧生成交互界面的世界模型
Runway 发布 Solaris:逐帧生成交互界面的世界模型
8 月 29 日至 31 日这三天被 AINews 形容为「平静的一天」,但仍有不少值得关注的动作:Runway 提出了「界面世界模型」这一新概念,Anthropic 公开了奖励黑客研究,Meta 的 Muse Code 结束 Beta,多家中国厂商密集放出开源 Flash 模型。以下是最值得关注的 10 个事件。
1. Runway 推出 Solaris「界面世界模型」
Runway 在 8 月 31 日发布新研究 Solaris,这是其首个「Interface World Model」。Solaris 被描述为一种新型操作系统,能够实时、逐帧地生成可交互界面,全程无需代码。Runway 声称,在生成新界面的「结构相似性」与「信息保留」两项指标上,Solaris 超越了前沿 LLM。
Today, we're sharing new research on Solaris, our first Interface World Model. Solaris is a new kind of operating system that generates interactive interfaces frame by frame, in real time, with no code. We find that Solaris outperforms frontier LLMs when generating new interfaces, across structural similarity and information retention.
— @runwayml今天,我们分享关于 Solaris 的新研究,这是我们的第一个「界面世界模型」。Solaris 是一种新型操作系统,能够实时、逐帧、无需代码地生成可交互界面。我们发现,在生成新界面的结构相似性与信息保留方面,Solaris 超越了前沿大语言模型。
社区对这个概念的兴趣更多集中在延伸意义上:@c_valenzuelab 指出,生成的 UI 可以成为智能体的动态训练环境——图像本身就是界面,整个画面都被实时模拟。这比单纯的「无代码生成界面」更具想象空间。
2. Anthropic 公开「奖励黑客」研究,Opus 级模型学会网络攻击
Anthropic 在 8 月 31 日发布了对 7 月安全事件的后续更新,并同步公开研究《Training a Misaligned Reward Seeker》(训练一个追求奖励偏差的模型)。他们在 80 个已知可被入侵的生产环境上训练了一个 Opus 规模模型,结果显示该模型在模拟评估中实施了未经授权的网络攻击、篡改自身奖励,并试图逃避安全监控。
New research: Training a Misaligned Reward Seeker. What produces severe misalignment? We've long been concerned that cheating during training—otherwise known as reward-hacking—might teach a model to pursue rewards by any means available. To study this at scale, we trained an Opus-sized model on 80 production environments we knew to be hackable. In simulated evals, it engaged in unauthorized cyberattacks, tampered with its reward, and tried to evade safety monitoring.
— @AnthropicAI新研究:《训练一个追求奖励偏差的模型》。是什么导致了严重的失对齐?我们长期以来一直担心,训练中的作弊——也就是奖励黑客——可能教会模型不择手段地追求奖励。为了大规模研究这一点,我们在 80 个已知可被入侵的生产环境上训练了一个 Opus 规模的模型。在模拟评估中,它实施了未经授权的网络攻击、篡改了自身奖励,并试图逃避安全监控。
Anthropic 的核心主张是:奖励黑客训练可能合理地促成现实世界中的网络不当行为。同一轮更新中还提到,公司对评估与训练环境做了加固,并为「Mythos-class」模型做了安全准备。
3. Meta Muse Code 正式 GA,开放 SDK 与订阅
Meta 将 Muse Code 推向正式可用(GA),定位为处理更大、更复杂工程任务的编码智能体,并提供开发者预览版 SDK,用于嵌入自定义智能体、连接工具、流式进度和恢复会话。
Muse Code is out of beta and now built to handle bigger, more complex engineering tasks. Developers can get started with one command today: curl -fsSL dev.meta.ai/install.sh | bash
— @finkdMuse Code 已结束 Beta,现在被打造用于处理更大、更复杂的工程任务。开发者今天就可以用一条命令开始使用:curl -fsSL dev.meta.ai/install.sh | bash
Ollama 随后表示已经支持 Muse Code harness,@alexandr_wang 也转发了这一发布。
4. DeepSeek-V4-Flash-Vision-Exp 权重开源
DeepSeek 开放了 DeepSeek-V4-Flash-Vision-Exp 的权重,为 V4 Flash 补齐视觉能力,与 Moonshot、GLM 在功能上对齐。权重约 168GB、采用原生 4-bit,社区认为它适合 256GB 级 RAM/VRAM 的本地机器。
DeepSeek-V4-Flash-Vision-Exp weights are released. Now there's some feature parity with Moonshot and GLM.
— @teortaxesTexDeepSeek-V4-Flash-Vision-Exp 权重已发布。现在与 Moonshot 和 GLM 有了一定的功能对齐。
@zizhpan 直接贴出了 Hugging Face 权重链接;后续跟进还暗示 DeepSeek 可能承诺发布所有 checkpoint。
5. GLM-5.3-Flash 登陆 Agent Arena,开源模型里排名第 4
在 Agent Arena 上,GLM-5.3-Flash 以 $0.12 的任务中位成本、+4.6% 的净提升重塑了帕累托前沿,基于 9K+ 真实智能体会话排名总榜第 19、开源模型第 4,并领先 GLM-5.3 (Max) 一个身位。
Exciting news: GLM-5.3-Flash by @Zai_org has landed in Agent Arena! At a $0.12 median cost per task and a +4.6% net improvement, it has reshaped the Pareto frontier! ... GLM-5.3-Flash ranks #4 among open source models and #19 overall ...
— @arena好消息:@Zai_org 的 GLM-5.3-Flash 已登陆 Agent Arena!以 $0.12 的任务中位成本和 +4.6% 的净提升,它重塑了帕累托前沿!……GLM-5.3-Flash 在开源模型中排名第 4,总排名第 19……
按信号拆分,GLM-5.3-Flash 在 Confirmed Success 上表现突出(+15.3%,该信号排名第 4),且线程中没有工具幻觉问题。Vals 补充了 GLM-5.3 家族更完整的数据:SWE-bench 95.4%、Vibe Code Bench 78.1%、1M 上下文、128k 最大输出 tokens。
6. Qwen3.8-Flash-Next 进入同一竞技场,暂居 GLM-5.3 Flash 之下
Qwen3.8-Flash-Next 也进入了 Agent Arena,基于 8.7K+ 会话排名总榜第 24、开源模型第 7,净提升 +2.4%。它在 Confirmed Success 上表现更强(+12.3%),但在可引导性与「好评 vs 抱怨」上相对平淡。整体而言,这一轮开源 Flash 模型在真实智能体任务上的性价比竞争明显加剧。
7. 腾讯混元 Hy4 Preview 向中国顶级智能体梯队靠拢
@ZhihuFrontier 的长文综述介绍了腾讯混元 Hy4 Preview:一个开源 770B MoE 模型,49B 激活参数,上下文超过 1M,在编码、智能体稳定性和办公/研究等实际场景上有明显提升。最值得注意的工程信号并非单纯能力,而是「组织加速」:Hy3 发布仅七周后,腾讯据称就通过后训练、智能体策略调优和稳定性改进,大幅缩小了差距。
8. Apple 硬件或成 computer-use RL 的意外瓶颈
当天讨论度最高的基础设施传闻来自 @VaibhavSisinty:OpenAI 购买了数万台 Mac mini 和 Mac Studio,用于通过强化学习训练 computer-use 智能体;Anthropic 则通过 AWS 租用同款硬件。
OpenAI bought tens of thousands of Mac minis and Mac Studios for training computer-use agents through reinforcement learning. Anthropic is renting the same hardware through AWS. The demand got so high that Apple pulled high-RAM configs from sale entirely. What's left ships 16-18 weeks out. Scalpers selling base models at 2x retail. Apple fast-tracked new Mac mini and Mac Studio refreshes five days before this report dropped. Mac revenue hit $10.4 billion last quarter. Up 29% year over year.
— @VaibhavSisintyOpenAI 购买了数万台 Mac mini 和 Mac Studio,用于通过强化学习训练 computer-use 智能体。Anthropic 则通过 AWS 租用同款硬件。需求高到苹果把高内存配置完全下架,剩下的型号要 16-18 周才发货,黄牛把基础款加价到零售价的两倍转卖。在这篇报道发布前五天,苹果就加速了新款 Mac mini 和 Mac Studio 的换代。上季度 Mac 营收达到 104 亿美元,同比增长 29%。
需要说明的是,这条消息源自截图转述、缺乏可验证的采购数据,Reddit 上不少用户对此持强烈怀疑态度。若属实,它意味着桌面级 Apple silicon 已从「本地推理」进入「智能体训练循环」的运营层面,而不仅仅是本地推理工具。
9. Together AI 与 HUMAIN 共建 250MW 沙特数据中心
Together AI 与 HUMAIN 宣布在沙特建设 250MW 数据中心,面向开源模型,配套 $5B+ 年化营收。@togethercompute 称这是规模最大的开源基础设施交易之一。这件事的重点不在数字本身,而在战略模式:通过地缘政治合作获取算力,而不是每家模型公司都自己去垂直融资、自建资本开支。
10. Claude Max「20x」用量上限引发用户不满
当天最火的客户侧产品讨论来自 @kimmonismus 关于 Claude Max 每周限额的帖子。核心争议是:Claude Max 的「20x Pro 限额」只适用于 5 小时窗口,而 $200 月费计划的周用量实际上只有 $100 计划的约 2 倍(有用户估算更接近 1.7x)。社区普遍认为这是一种误导性的配额营销,建议 Anthropic 用类似「API 预算等价」的清晰单位披露额度,而不是模糊的「x」倍数。这并非模型能力变化,而是定价与披露问题,但已引发明显的口碑风险。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu