Qwen3.8-Max 发布:2.4T参数开源旗舰
Qwen3.8-Max 发布:2.4T参数开源旗舰
1. Qwen3.8-Max 发布:2.4T 参数旗舰下周开放权重
阿里巴巴通义千问团队在 8 月 3 日正式发布 Qwen3.8-Max,这是其迄今最强大的模型,并宣布下周将开放权重,同时 27B 版本的 Qwen3.8-27B 也将开源。
Qwen3.8-Max 是一个 2.4T 总参数的 MoE 模型,每次推理激活约 95B 参数(激活率约 4%),支持 1M token 上下文窗口和最高 128K token 输出。官方将其定位为面向编程和长周期协作(coding and cowork)的旗舰系统,主打三大能力:10 天以上的自主编程(从空文件夹到生产级交付,完整代码轨迹已公开在 GitHub)、500 轮以上芯片设计优化、365 天电商策略执行,以及视觉反馈闭环的原生多模态智能。
API 定价为输入 $2.00/M tokens、输出 $6.00/M tokens、缓存 $0.25/M tokens,可通过 Qwen Studio、API 和 Command Code 等渠道使用。Baseten、Hermes Agent 等平台已确认集成支持。
📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding… Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction.
— @Alibaba_Qwen📢 隆重推出 Qwen3.8-Max——我们迄今为止最强大的模型。下周 Qwen3.8-Max 开放权重,Qwen3.8-27B 也将开源!2.4T 参数的编程与协作新标杆:自主编程 10 天以上,从空文件夹到生产级交付无需人工干预…长周期掌控:系统级自主规划与闭环自适应学习,驱动 500+ 轮芯片设计优化和 365 天电商策略。原生多模态智能:视觉不仅是输入,更是规划、执行和自我修正的持续反馈闭环。
第三方评测方面,Qwen3.8-Max 在 Frontend Code Arena 排名第 4(1,668 Elo),仅次于 Claude Opus 5 Max(1,705)和 Kimi K3 Max(1,676),与 Claude Opus 5 High(1,669)基本持平。Vals Index 得分 66.1,在开源模型中排名第 2,与 Claude Opus 4.7 持平,但单次测试成本仅为后者的 43%($2.68 vs $6.17)。SWE-bench 得分 87.3%,超过 GPT-5.5(82.6%)和 GLM-5.2(83.3%)。
Big news: Qwen3.8-Max by @Alibaba_Qwen just landed at #4 on the Frontend Code Arena leaderboard with a score of 1,668! With 1,668 points, Qwen3.8-Max is trailing only Claude Opus 5 (Max) with 1,705 pts and Kimi K3 (Max) with 1,676 pts, on par with Claude Opus 5 (High) with 1669 pts. It also ranks high across all domains: #2 in Consumer Product, #3 in Brand & Marketing, Reference-based design, Gaming, and Content Creation Tools…
— @arena重大消息:Qwen3.8-Max 以 1,668 分空降 Frontend Code Arena 排行榜第 4!仅次于 Claude Opus 5 Max(1,705)和 Kimi K3 Max(1,676),与 Claude Opus 5 High(1,669)持平。各细分领域表现同样出色:消费品设计第 2,品牌与营销、参考设计、游戏、内容创作工具第 3…
这是阿里首次将 Max 系列模型开放权重,被广泛解读为中国开源模型生态竞争的战略转折。此前打通义千问开源线最高只到 Qwen3-235B,Max 系列一直是闭源 API 独占。
2. MiniMax H3:开源视频生成新 SOTA
MiniMax 在同日发布了 H3 多模态生成模型,并在 Video Arena 上位列开源模型第 1 名,领先第二名 hunyuan-video-1.5 超过 280 分。在 Image-to-Video 子榜上以 1,476 分,仅差 2 分即可并列总榜第 1。
H3 是一个 33B 参数的多模态生成模型,同时支持文本、图像、视频、音频的理解与生成,包括带原生立体声音频的高达 2K 分辨率、最长 15 秒的视频生成。模型可通过 ComfyUI 在单张 RTX 5090(约 40GB 显存)上运行,5 秒视频生成约需 5.5 分钟。社区反馈显示其在提示遵循度、物理一致性(如桌子随物体重量自然震动)方面表现突出。
MiniMax H3 is now the SOTA open video generation model in both @arena and @ArtificialAnlys benchmarks.
— @MiniMax_AIMiniMax H3 在 Arena 和 Artificial Analysis 两个基准测试中已成为目前最强的开源视频生成模型。
不过 H3 的许可证同样存在争议,有用户指出其在美国、欧盟、英国、韩国等地使用需经过正式授权流程,并非无限制开源。
3. DeepSeek V4 Flash 0731:重新定义成本/性能边界
DeepSeek 更新了 V4 Flash 模型到 0731 版本,在 Artificial Analysis Intelligence Index 上形成了新的 Pareto 前沿——约 $0.03/task 的极低成本下达到约 50 的指数得分。Vals AI 称其为"Vals Index 上得分超过 60 的最便宜模型",比同档次下一便宜的模型便宜 35 倍,优势主要来自编程和 Agent 任务。
在具体基准上,DeepSeek V4 Flash 0731 在 WeirdML 上达到 57.1%(high)/ 63.0%(max),在 Chess Benchmark 上排名第 1(80% 胜率、Elo 1,538)。Together AI 已将其定位为长时间运行 Agent 的生产端点。
值得注意的是,V4 Flash 是一个约 284B 参数的 MoE 模型(约 13B 激活),远小于 Qwen3.8-Max(2.4T)和 Kimi K3(2.8T),但在性价比上形成了巨大的竞争优势。有社区成员通过新的 Mference 推理引擎在仅 5.3GB 内存下运行该模型(通过 SSD 流式加载专家权重)。
4. OpenAI 下一代模型解决 10 个数学开放问题
OpenAI 宣布其内部下一代模型在数学和理论计算机科学的长期开放问题上产生了 10 个新成果,总 token 成本仅约 $2,000(按 GPT-5.6 Sol API 费率计算)。
An internal version of our next major model produced 10 new results on long-standing open problems in mathematics and theoretical computer science, using roughly $2,000 worth of tokens at GPT-5.6 Sol API rates.
— @OpenAI我们下一代主要模型的内部版本在数学和理论计算机科学的长期开放问题上产出了 10 个新结果,按 GPT-5.6 Sol API 费率计算,仅消耗约 $2,000 的 token 成本。
这一声明引发了社区热议。一方面这展示了前沿模型的数学推理能力正在进入实用化阶段;另一方面也有声音质疑 $2,000 是否只统计了"成功出结果"的那次尝试,总实验成本可能远高于此。
5. GPT-Live 全双工语音架构发布
OpenAI 发布了 GPT-Live 的工程深度解析,这是一个重新设计的实时语音架构,支持边听边说的全双工对话。新架构将专用低延迟音频路径与异步推理/工具调用路径分离,使深度思考和工具使用不会打断对话流。会话启动从原先的 6 次网络往返缩减为 1 次。
GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model. This new architecture keeps audio flowing continuously, so deeper reasoning and tool use don't interrupt the conversation.
— @OpenAIGPT-Live 可以在说话的同时倾听。为了在 ChatGPT 规模上实现自然的对话体验,我们从客户端到模型全面重建了语音堆栈。这种新架构保持音频持续流动,因此深度推理和工具使用不会打断对话。
6. Agent 基础设施集中释放:Cloudflare、Cursor、LangChain
Agent 基础设施在同一天迎来集中更新。Cloudflare 发布了 @cloudflare/computer,一个 Agent 运行时,能在轻量级隔离环境和完整 Linux 容器之间动态切换,确保每个 Agent 拥有"自己的计算机"。Cursor 宣布其云端 Agent 实现了 20-30% 的 token 效率提升和 80% 的 computer-use 效率提升,并推出了 Google Workspace 插件,可直接在 Gmail、Drive、Calendar、Docs、Sheets 中操作。LangChain 则预告 Managed Deep Agents 将进入公开 Beta,内置评估、记忆、OAuth 工具访问、渠道集成和沙箱功能。
这些发布共同指向一个趋势:Agent 系统正在从"模型+提示词"组合,演变为"模型 × 运行时/中间件"的协同工程——harness(中间件)本身已成为控制平面,其设计直接影响长周期任务的成功率。
7. Qwen3.8-27B:实用部署的真正希望
在 Qwen3.8-Max 引发关注的同时,社区对同步发布的 Qwen3.8-27B 表现出极大兴趣。Unsloth 的 Daniel Han 在 LinkedIn 验证该模型仅需约 17GB VRAM 即可本地运行,推断可能采用了与 DeepSeek V4 Flash 类似的量化感知训练(QAT)。
Reddit 上相关帖子获得超过 2,000 的活跃度,社区普遍认为虽然 2.4T 旗舰模型需要 8 张 H100/B200 才能运行,但 27B 版本才是真正能普及到消费级硬件的关键。此外,Qwen 团队成员在社交平台透露,还在开发更多尺寸和架构变体,社区期待中的 35B-A3B、60B dense 甚至 122B 版本有望在后续推出。
8. GLM 5.3 即将发布
GLM(智谱)的新一代模型 GLM 5.3 被社区发现已在开发中。Java SDK 仓库中已出现 glm-5.3 分支,包含"支持 JSON Schema 结构化输出"等提交。同时有用户发现微软必应在中国的搜索结果中已索引"GLM 5.3"相关内容。当前 GLM-5.2 Max 已是 Frontend Code Arena 总榜第 2、开源第 1,因此 5.3 的动向备受关注。
社区普遍感受到中国开源模型的发布节奏在加速——有用户调侃"下载评估的速度赶不上模型发布的速度"。
9. Llama.cpp 支持 DeepSeek V4 Flash 投机解码
llama.cpp 合并了 PR #25784,为 DeepSeek V4 系列添加了 MTP 投机解码和 DSpark head 支持。实测数据显示在 DGX Spark 上可获得约 50% 的吞吐量提升(从 ~16.5 tok/s 到 ~25-28 tok/s),draft 接受率在 0.61-0.76 之间。社区贡献者提醒,0731 版本仅支持 DSpark 而非 MTP,用户需使用针对性转换的 GGUF。
另有用户测试发现,使用 MTP draft 模型后生成速度可进一步从 35 tok/s 提升到 50 tok/s,但有效上下文容量从 200K 降至 139K。
10. Epoch MirrorCode 更新与自动化研究进展
Epoch AI 更新了 MirrorCode 基准:Claude Fable 5 在 15 个中/大型程序(各两种语言、每次 10B tokens)上达到 64% 解题率,GPT-5.6 Sol 为 20%。此外,Intology 的自动化研究系统 Locus 声称在 PostTrainBench 上达到 SOTA,其后训练出的 Qwen3 1.7B Base 变体超越了人工后训练版本;在 Kaggle 实时竞赛中,Locus 运行 16 天后达到第 4 高平均排名。
同时 7 月的网络安全态势引人关注:Epoch 报告称 7 月披露了约 2,500 个高危/严重 CVE,是此前月度记录(在 Anthropic 公开自主漏洞发现能力之前)的约 5 倍。
本期 AI 新闻日报聚焦 2026 年 8 月 1 日至 3 日。 核心主题是中国开源模型的集体爆发——Qwen3.8-Max、MiniMax H3 在同一天分别改写了文本 LLM 和视频生成的开源 SOTA,而 DeepSeek V4 Flash 则在性价比维度上继续施压。与此同时,Agent 基础设施和实时语音架构的密集更新,表明 2026 年的 AI 竞争正从"谁的模型更强"转向"谁的模型 × 运行时系统更实用"。美国实验室凭借前沿闭源模型和工程系统仍保有领先地位,但中国开源模型在多个细分领域已形成实质性竞争力。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu