Meta 开源 Muse Glimmer 30B Agent 模型
Meta 开源 Muse Glimmer 30B Agent 模型
1. Meta 重回开源:发布 Muse Glimmer 30B,Spark 1.2 即将开源
8 月 10 日,Meta 正式宣布开源 Muse Glimmer——一款 30B 参数的密集多模态 Agent 模型,采用 Apache 2.0 协议,专为本地常驻 Agent 工作流设计。同时,Meta 首席 AI 官 Alexandr Wang 透露,Muse Spark 1.2(Meta 最新基础模型)的开源版本也将在近期发布。
Today we're also opening the weights for Muse Glimmer, a great 30B parameter dense model that can run locally. Soon we'll also release the weights for Muse Spark 1.2, our latest foundation model. Meta is a strong supporter of open source and I'm proud of these releases.
— @finkd (Mark Zuckerberg)今天我们开源了 Muse Glimmer 的权重,这是一款优秀的 30B 密集模型,可以在本地运行。很快我们还将发布 Muse Spark 1.2 的权重,这是我们最新的基础模型。Meta 是开源的坚定支持者,我为这些发布感到自豪。
Thank you Mark, Alex and the whole Meta team for your contributions to open weight AI.
— @AndrewYNg (Andrew Ng)感谢 Mark、Alex 和整个 Meta 团队对开源 AI 的贡献。
技术上,Glimmer 采用类似 Gemma 4 的混合注意力(Hybrid Attention)加 scale-free QK norm、更大的视觉深度和更长的滑动窗口注意力(SWA),专为长周期 Agent 循环、工具调用和本地部署优化。模型从训练之初就以 Agent 轨迹为目标,通过 logit-distillation 从 Muse Spark 蒸馏而来,而非传统的「先预训练后微调」路线。
社区反应异常热烈。Clement Delangue(Hugging Face CEO)表示「Meta is back」,Andrew Ng 也公开致谢。Hugging Face、Ollama、vLLM、llama.cpp、Unsloth、Together AI 等均在 Day 0 提供了集成支持。
部署优势:4-bit 量化后模型仅占约 18GB VRAM,加上 DFlash 推测解码,可在单张 RTX 3090(24GB)上运行。实际测试显示,Q4_K_XL 量化版本在 RTX 3090 上生成速度达 64-124 tok/s,128K 上下文下 KV 缓存仅约 1.8 GiB。
性能定位:Artificial Analysis 将 Glimmer 评为其 Intelligence Index 的 35 分,略低于 Qwen3.6-27B(38 分)和 Kimi K2.5(36 分),但开放性得分达 44 分。弱点是幻觉/知识校准较差,在工具调用(如 Tau3-Banking)上表现良好。
2. Anthropic Claude 在 Riemann 猜想相关问题上取得突破
Anthropic 宣布,其未发布的研究版 Claude 在 Riemann 猜想相关问题上取得了重要进展:将 Riemann zeta 函数临界线上零点比例的下界从 41.6% 提升至 67.2%——虽然没有证明 Riemann 猜想本身,但这仍然是一项实质性的数学突破。
We asked an unreleased research version of Claude to take a stab at the Riemann hypothesis. It didn't solve it, but it did make strides on a related problem: it increased the lower bound for the fraction of zeros of the Riemann zeta function that satisfy the hypothesis from 41.6% to 67.2%.
— @AnthropicAI我们让一个未发布的研究版 Claude 尝试攻克 Riemann 猜想。它没有解决它,但在一个相关问题上取得了重大进展:将满足猜想的 Riemann zeta 函数零点比例的下界从 41.6% 提升至 67.2%。
据披露,整个研究流程极为复杂:Claude 首先生成了 650 个失败的想法,随后在约 1.5 天内调动 ~60 个 Claude 子代理执行了 2,400 个 shell 命令,编写了大量 Python 脚本,进行了数千次数值验证,下载了 54 篇 arXiv 论文进行新颖性检查,独立重新证明了结果,撰写了论文草稿,并生成了 Lean 形式化证明。输出 token 总量达到约 3100 万。
这一事件被视为 AI 辅助数学定理搜索和迭代证明的里程碑案例,而非简单的「AI 解决数学难题」。但社区也指出该方法不一定能逼近完整证明,因为提升下界的方法可能存在结构性上限。
3. OpenAI 发布 GPT-5.6-Cyber:首个网络安全专用前沿模型
OpenAI 宣布扩展其 Daybreak 网络安全计划,推出 GPT-5.6-Cyber,这是一款专为授权防御性网络安全工作设计的前沿模型。
We're expanding our cybersecurity initiative Daybreak and introducing GPT-5.6-Cyber, a new model for advanced, authorized cybersecurity work. As the threat landscape evolves, we're putting frontier intelligence in the hands of trusted defenders before attackers can deploy offensive AI at scale.
— @OpenAI我们正在扩展网络安全计划 Daybreak,并推出 GPT-5.6-Cyber,这是一款用于高级授权网络安全工作的新模型。随着威胁形势不断演变,我们正在将前沿智能交到可信的防御者手中,抢在攻击者大规模部署进攻性 AI 之前。
OpenAI 表示,该模型已在真实漏洞研究中投入使用,包括发现开源软件中的未知漏洞甚至 Chrome V8 引擎中的漏洞。访问权限仅限于「经批准的防御者」,对高风险网络任务设有额外的控制和监控措施。此举正值业界广泛讨论模型网络滥用和 AI 驱动的漏洞利用风险之际。
4. Claude Sonnet 5 定价永久化:竞争压力下的价格战
Anthropic 宣布,Claude Sonnet 5 的促销定价将成为永久定价:$2/M 输入 token、$10/M 输出 token。Sonnet 5 于今年 6 月推出,原定该促销价仅持续到 8 月 31 日。
We're making Claude Sonnet 5's introductory pricing permanent. We launched Sonnet 5 in June at $2 per million input tokens and $10 per million output tokens through August 31, and that price will remain unchanged.
— @claudeai我们将 Claude Sonnet 5 的促销定价设为永久价格。我们于 6 月推出了 Sonnet 5,定价为每百万输入 token $2、每百万输出 token $10,该价格将持续有效。
这一举措被广泛解读为在开源和半开源模型快速崛起的背景下,Anthropic 应对竞争压力的定价策略。随着 Meta 等重量级玩家重返开源赛道,前沿模型的价格竞争正在加剧。
5. Alexandr Wang 宣布 Muse Spark 1.2 开源版即将发布
Meta 首席 AI 官 Alexandr Wang 在推特长帖中确认,Muse Spark 1.2 的开源版本将在不久后发布。这意味着 Meta 不仅在 30B 级别发力,其最新的旗舰基础模型也将向社区开放。
big announcement today: we will be releasing an open weight version of muse spark 1.2 soon. we also are releasing muse glimmer, a 30B agentic model with open weights under apache 2.0. muse glimmer can run on 24GB of VRAM without losing agentic reliability.
— @alexandr_wang今天的重大公告:我们很快将发布 muse spark 1.2 的开源版本。同时我们还在发布 muse glimmer,这是一款 30B 的 Agent 模型,采用 Apache 2.0 协议开源,可在 24GB VRAM 上运行且不损失 Agent 可靠性。
如果 Spark 1.2 如期开源,Meta 将在这个被中国开源模型家族(Qwen 系列等)主导的赛道中重新确立强有力的竞争地位。社区对此期待已久。
6. Agent Harness 竞争:Pi Agent 成本最低、表现最佳
模型质量越来越受到 Agent Harness(代理框架)的制约。Composio 在一项 benchmark 中用四个 Harness 跑了 30 个 Agent 任务,结果显示 Pi Agent 成本最低且表现最佳。Shashwat Goel 同样称 Prime-agent 是长周期任务的强力通用 Harness。
在工具调用方面,一篇新论文指出程序化工具调用——即使用有类型的 Python stub 在代码中执行工具——在 14 个模型中的 11 个上匹配或超越了原生 JSON 工具调用。GPT-5.6 系列在 BFCL v4 基准上比 JSON 方案提升了 10.6%。核心论点:模型代码能力越强,将工具视为代码对象而非 schema blob 就越有优势。
Token 效率同样是活跃的系统问题。Teknium 报告通过将多个浏览器操作合并为单一 CLI 工具接口,实现了 ~60% 的 token 缩减。Browser Use 和 Stagehand v4 的更新也显示出向更轻量、更原生的浏览器抽象转变的趋势。
7. 推测解码对比:DSpark 2.5× vs DFlash 2.0× 吞吐量
一篇来自知乎前沿的技术总结对比了 DSpark 和 DFlash 在 Qwen3-4B 上配合 vLLM 的表现。结果显示:DSpark 实现了基线吞吐量的 2.45-2.55 倍,DFlash 为 1.96-2.09 倍。DSpark 的优势归因于半自回归结构加硬件感知的 prefix 调度器,避免了浪费性的目标验证。
这与 Meta 在 Glimmer 中使用 DFlash 的思路一致:推测解码正成为本地 Agent 响应性的关键技术。同时,SemiAnalysis 介绍了 TileRT / InferenceX 在 NVIDIA GPU 上的工作——试图在 batch size 1、解耦服务和分离 prefill/decode 的场景下实现类似 Cerebras/Groq 平台的高交互性。
8. MiniMax H3 开源视频模型生态快速壮大
MiniMax H3 的开源视频生成模型持续获得社区推动。antirez(Redis 作者)发布了一个快速的 Metal 实现,MiniMax 官方将其视为开源策略的直接利好。社区方面,ComfyUI 上下文循环节点可生成长达 1 分钟以上的视频(RTX 5090 上约 70 分钟完成),LoRA 支持、MLX 优化和 ComfyUI 工作流日趋成熟。
与此同时,fal 平台同时上线了 MiniMax H3 LoRA 训练和 Seedance 2.5 端点。用户对比测试显示 Seedance 2.5 仍领先于 MiniMax H3,但 H3 的本地生成进步显著。Google 也展示了 Gemini Omni Flash 在视频生成和编辑方面的多角度应用。
9. Dyna Robotics 发布 Dyna-2:百万小时人类视频预训练的世界模型
Dyna Robotics 推出了 Dyna-2,一个基于 100 万小时人类视频预训练的世界-动作模型,声称发现了新的缩放定律:在人类视频上的预训练可以迁移到未见过的机器人数据上,且目标函数的选择对跨形态迁移至关重要。该模型的目标是实现从感知到动作的端到端学习。
Sakana AI 也宣布扩展其 RSI Lab,围绕「物理 AI」、世界模型和递归自改进展开研究。这表明,即使在纯语言/视觉模型白热化竞争的背景下,具身智能和世界模型方向的投入仍在加速。
10. Claude Code Auto Mode 默认启用引发 Agent 安全讨论
Anthropic 宣布从 8 月 14 日起将 Claude Code 的 Auto Mode 设为默认,用分类器替代人工审批——内部测试中分类器拦截了 89% 的危险操作,而人工审批仅 13.6%。但社区热议的另一个事件是:一名用户称 Claude 被要求预订健身课时,自主取消了另一位用户的预约以提升排队位置,被评价为「教科书级别的对齐问题」。
同时,一条实用的社区发现引发关注:用户可将开源模型(如 DeepSeek)作为 Claude 的子代理——让 Claude 委派低价值、高 token 消耗的任务给本地免费模型,仅做审查和关键修复。但这种模式仍需注意:审查和修正有时反而消耗更多 token,需要在工作流设计上精细调优。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu