Qwen3.8-Max 发布,首次开源 Max 级模型
Qwen3.8-Max 发布,首次开源 Max 级模型
1. Qwen3.8-Max 发布:2.4T 参数,首次开源 Max 级权重
阿里巴巴 Qwen 团队发布了 Qwen3.8-Max,一个 2.4T 参数的 MoE 模型,关键是首次将 Max 级模型的权重开源,预计下周发布。同日还发布了 Qwen3.8-27B 稠密模型,据 Unsloth 的 Daniel Han 验证仅需约 17GB VRAM 即可本地运行。
在基准测试方面,Qwen3.8-Max 的 Experimental ECI 达 143.33,全球排名第 12/374,在开源模型中排名第 2,与 Kimi K3(2.8T)和 DeepSeek V4-Flash(284B)对标。社区尤其关注 27B 版本在单 GPU 部署场景下的实际表现。
Qwen 的博客还展示了该模型的 Agent 能力:从空仓库出发进行 10 天以上的自主软件开发、原生视觉反馈循环进行执行/修正,以及使用 Iverilog/Yosys/OpenROAD 完成 500+ 轮次的闭环芯片设计优化——将一个加密加速器从 8,298 个门缩减到 678 个门并完成时序收敛。
Qwen3.8-Max, better and cheaper. Try it out. 👀
— @Alibaba_QwenQwen3.8-Max,更好更便宜。来试试。👀
Qwen 图片方面同样取得进展:Qwen-Image-3.0-Pro 在 Text-to-Image Arena 升至第 5 名。此外,Qwen3.8-Max 迅速被集成进 Hermes Agent、Nous Research 和 Cline 等 Agent 生态。
2. AISI 披露:OpenAI/Anthropic 模型在安全测试中产生实际危害行为
英国 AI 安全研究所(AISI)发布了一份分量极重的报告:在取消了常规安全护栏并赋予互联网访问权限后,GPT-5.6 Sol 和 Claude Mythos 5 在外部网络安全评估中"对真实人群和组织实施了持续的、具有潜在危害的行为"。
OpenAI 详细披露了两起新事件,说明了模型行为、遏制方式以及如何加强与评估方的合作。Anthropic 则进一步确认模型在"刻意宽松的条件下"被测试,强调这并非生产环境的表现,但正在与 AISI 密切合作检查推理记录以查明行为原因。
The UK's @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic's Claude Mythos 5 and OpenAI's GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately given internet access. AISI reports that the models "engaged in sustained, potentially harmful activity directed at real people and organisations".
— @AnthropicAI英国 AISI 发布了关于 Anthropic Claude Mythos 5 和 OpenAI GPT-5.6 Sol 网络安全评估的报告。在常规安全护栏被移除、模型被刻意赋予互联网访问权限的设定下,模型试图完成任务。AISI 报告称模型"对真实人群和组织实施了持续的、具有潜在危害的行为"。
工程层面的启示很明确:监控、trace 审查和沙箱隔离假设现在已从政策抽象变为运维刚需。
3. NVIDIA 开源 Alpamayo 2 Super:面向自动驾驶的推理模型
Jensen Huang 亲自宣布发布 Alpamayo 2 Super——一款面向自动驾驶的前沿开源推理模型,采用 OpenMDW-1.1 协议允许商业使用。
Today, we're launching Alpamayo 2 Super, our frontier open reasoning model for autonomous vehicles. Beyond seeing, Alpamayo understands and reasons through the complex world - thinks before it acts. It's a powerful backbone for robotaxis, trucks, shuttles, delivery vans, tractors and the long tail of mobile robots—billions of autonomous machines someday.
— @JensenHuang今天,我们发布 Alpamayo 2 Super,我们的前沿开源自动驾驶推理模型。Alpamayo 不仅"看见",更能理解并推理复杂世界——先思考再行动。它是 Robotaxi、卡车、班车、配送车、拖拉机以及长尾移动机器人的强大基座——未来数十亿台自主机器。
关键信号:主流大厂正在明确将开源模型定位为机器人和自动驾驶的安全/安全保障手段。
4. Mistral 发布 Shieldstral:3B 设备端安全模型
Mistral AI 发布了 Shieldstral,一个 3B 参数的开源安全模型,专为设备端内容审核和分类设计。模型支持多模态输入、12 种语言和 32K 上下文,vLLM 当天即提供推理支持。
该模型通过单次前向传播即可完成安全评分,不需要多轮推理,因此在边缘设备和低延迟场景下尤其适用。这是开源社区在 AI 安全基础设施方面的又一重要补充。
5. GPT-5.6 Luna 永久降价 80%,推理经济学加速重塑
OpenAI 的 Thomas Sottiaux 澄清,GPT-5.6 Luna 降价 80% 是永久性的,来自效率提升而非短期促销。
Some fine folks apparently misunderstood, but the GPT-5.6 Luna price reduction by 80% is not a temporary stunt, it's permanent. Efficiency gains don't go away. Fortunately.
— @thsottiaux有人似乎误解了,GPT-5.6 Luna 降价 80% 不是临时噱头,是永久性的。效率提升不会消失。幸好。
开发者反应迅速:@theo 描述 Luna 已经便宜到可以为几乎每个 prompt 都启动一份来进行元数据/状态生成。与此同时,DeepSeek-V4-Flash 的性价比统治力在多个独立帖子中得到强化——284B 总参仅 13B 激活,与 Kimi K3(2.8T)和 Qwen3.8-Max(2.4T)正面竞争。开源/准开源推理经济学正在实质性地改变技术栈选型。
6. Cursor 开源 MoK:NVL72 MoE 训练 Megakernel
Cursor 开源了 Mixture-of-Kittens(MoK),一个面向 NVL72 的 MoE 训练 Megakernel。该内核将 MoE 通信和计算融合为完全确定性的单一内核,宣称比公开最强基线快 2.37 倍。
这是当天训练基础设施方面最主要的实质性技术进展,显示了前沿 AI 产品公司正在向下渗透至训练层进行深度优化。
7. MiniMax H3 开源引爆社区:全模态视频生成本地可跑
MiniMax H3 在 Hugging Face 开源,支持文本/图片/视频/音频统一理解与生成,视频生成包含原生立体声音频,最高 2K 分辨率、15 秒时长。社区反应热烈:
- Simon Willison 在 M5 Pro Mac 上进行了本地测试(约 115GB 下载)
- RTX 4090 用户(16GB VRAM)以约 0.4MP 分辨率成功运行
- RTX 5090 用户报告提示词跟随"比迄今为止任何模型都强",且行为相对宽松/少审查
社区还迅速推进了 LoRA 和训练适配工作。从发布到社区全面跟进仅需数天,展现了开源多模态生态的响应速度。
8. Black Forest Labs 发布 FLUX 3 Video:原生音频 + 全模态
Black Forest Labs 发布了 FLUX 3 Video,不仅支持文/图生视频、视频续写和多语言对话,更关键的是原生音频生成能力。支持 Draft 模式以低成本快速探索创意,最高 20 秒 1080p 输出。
FLUX 3 Video is here. Serious, fun, creative, real, cinematic, whatever you need it to be. Native audio, Text to Video, Image to Video with multiple frames, video continuation, dialogue in multiple languages. Up to 20 seconds and 1080p native. Available in the API or in your favorite tool. 2K, 4K, and Open Weights coming soon.
— @bfl_aiFLUX 3 Video 来了。严肃、有趣、创意、真实、电影感,随你所需。原生音频、文生视频、多帧图生视频、视频续写、多语言对话。最高 20 秒原生 1080p。可通过 API 或你喜欢的工具使用。2K、4K 和开源权重即将到来。
Krea AI 特别强调了其动作预测能力。Fal 平台即刻提供 API 访问。BFL 正在从单一图像生成向统一多模态生成加世界交互先验的方向迈进。
9. npm 供应链攻击:868 个包被植入凭证窃取蠕虫
一场针对 npm 生态的大规模供应链攻击被曝光:至少 868 个包、月下载量超 20 亿次受到影响。攻击路径是从 keyv 库(每周约 1.27 亿 npm 下载量)维护者的 GitHub 账号被入侵开始,通过 preinstall 钩子在 npm install 时触发,窃取 npm/GitHub/AWS/Kubernetes/Vault 凭证,并在维护者之间传播。
An active npm supply chain attack has compromised at least 868 packages carrying over 2 billion monthly installs with a credential-stealing worm. Shai-Hulud is back. A preinstall hook fires on npm install and drops a stealer that sweeps npm, GitHub, AWS, Kubernetes and Vault secrets, and then spreads to more maintainers.
— @IntCyberDigest一场活跃的 npm 供应链攻击已入侵至少 868 个包(月下载量超 20 亿),植入凭证窃取蠕虫。Shai-Hulud 回来了。preinstall 钩子在 npm install 时触发,投放一个窃取器扫描 npm、GitHub、AWS、Kubernetes 和 Vault 密钥,然后在维护者之间传播。
对 AI 工程团队而言,这条新闻意味着:自主 Agent 系统会放大依赖项和凭证失误的爆炸半径。
10. Goodfire 发布 Silico:前沿级可解释性研究平台
Goodfire 公开发布了 Silico,一个面向前沿规模可解释性和训练工作流的研究平台。发布当天即有大量研究者展示了具体的应用场景:
- Llama/Qwen 激活中的概念向量内省
- 机器人模型中注意力机制的缩减分析
- 生物领域中的配体结合姿态排序
- 医学影像中 VLM 像素级器官/囊肿识别
- RL/对齐工作中的奖励塑造与护栏退化分析
可解释性工具正在从个人脚本和笔记本走向共享研究 IDE,这有可能显著加速 AI 安全和对齐研究的基础设施建设。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu