DeepSeek V4.1-Flash 发布,开源新旗舰登顶

DeepSeek V4.1-Flash 发布,开源新旗舰登顶

9 月 9–10 日,AI 圈被 DeepSeek 的新模型彻底刷屏:V4.1-Flash 以开源权重、MIT 许可和极低的 token 成本,在多个独立基准上反超上一代旗舰 V4 Pro。与此同时,OpenAI 的语音与 Agent 基础设施、Cognition 的 SWE-2、Cursor 的持久化项目线程,以及 Anthropic 的威胁情报报告,共同勾勒出这一天的主线——模型正在从"更大更强"转向"更便宜、可服务、可本地部署"。

1. DeepSeek V4.1-Flash 发布:AA Index 40 的开源新旗舰

DeepSeek 发布 V4.1-Flash,作为新的开源权重旗舰,主打极致推理效率与低成本。独立评测机构 Artificial Analysis 给出的核心结论是:V4.1-Flash 以 552B 总参数超越 1.6T 参数的 V4 Pro 0813,AA 智能指数得分 40,仅次于 GLM-5.3-Flash,但单 token 成本仅为 V4 Pro 的约 1/4。API 定价为输入 $0.30 / 1M、输出 $1.20 / 1M,缓存输入低至 $0.006 / 1M(98% 折扣),另有 50% 非高峰折扣;支持 1M 上下文、图文输入,MIT 许可。Vals 将其列为 Vals Index 上新的开源权重第一名,超过 Kimi K3,单次测试成本仅 $0.30。

DeepSeek V4.1 Flash overtakes DeepSeek V4 Pro 0813 as DeepSeek's new flagship model with a score of 40 on Artificial Analysis Intelligence Index. At just 552B parameters, it outperforms the Pro (1.6T) model while costing ~4x less per token, placing it just short of the Intelligence vs. Cost Pareto frontier because of its verbosity.
— @ArtificialAnlys

DeepSeek V4.1 Flash 以 Artificial Analysis 智能指数 40 分的成绩取代 DeepSeek V4 Pro 0813,成为 DeepSeek 的新旗舰。仅 552B 参数就超越了 Pro(1.6T)模型,单 token 成本还便宜约 4 倍,仅因输出冗长而差一点没登上"智能 vs 成本"帕累托前沿。

具体成绩上,AutomationBench-AA 达 69%,追平 GPT-6 Astra(69%)、高于 Grok 4.6(67%),比 V4 Pro 0813(57%)高 12 分;GDPval-AA v2 上升 164 Elo 至 1632,反超 Kimi K3(1584);AA-LCR v1.1 得 84%,与 GPT-5.6 Sol、Gemini 3.8 Flash 持平。值得注意的是,它是被测模型中最"啰嗦"的之一——每个智能指数任务平均输出 89k tokens,比 GLM-5.3 多 25%、比 V4 Pro 0813 多 62%,但由于 token 极便宜,单任务成本仍仅 $0.27,约为 GLM-5.3 和 Kimi K3 的 1/7。

2. V4.1-Flash 架构:causal encoder-decoder 与极致 KV 压缩

最受讨论的技术亮点是全新的因果 encoder-decoder 架构:输入/prefill 阶段仅激活 8B 参数,输出/decode 阶段激活 16B 参数,显著降低激活计算与 KV/缓存成本。Sebastian Raschka 称这是一次"大改版",直言"他们应该叫它 DeepSeek V5",并指出 encoder-decoder 设计是与前几代 DeepSeek 最关键的分野。社区普遍将其解读为"局部滑窗分支 + 稀疏检索分支"的混合体,与 HySparse、NSA 及 DeepSeek 自身 V4 的 CSA/HCA 一脉相承;nrehiew 强调 KV cache 压缩是该设计的核心,基准分数对应的 KV 大小仅约 890 bytes/token,并称其"非常明确地为推理而设计"。

Big overhaul on DeepSeek V4.1 using an encoder-decoder setup.
Tbh they should have called it DeepSeek V5!
Super cool and refreshing, though!
— @rasbt

DeepSeek V4.1 用 encoder-decoder 架构做了一次大改版。说实话,他们应该把它叫做 DeepSeek V5!不过确实非常酷、令人耳目一新!

此外,有 Reddit 用户检查 Hugging Face safetensors 后指出,包含 backbone(551.566B)与 engram(196.929B)以及可选 DSpark/MTP、视觉编码器后,模型存储总量约为 763.21B 参数 / 511.76GB,而非官方口径的 552B——争议源于对 FP4 打包权重、engram 查询表等是否应计入"参数"的统计口径不同。

3. 本地化部署:SSD 流式让旗舰模型跑在消费级硬件上

这轮讨论的另一个焦点是 V4.1-Flash 出人意料地容易在"消费级"硬件上运行。Fraser Price 报告在 4 块 Max-Q、仅 64GB 系统内存下实现全精度 200 TPS,把 200GB Engram/hash 表卸载到 NVMe;随后又改进到 4 块 RTX Pro 上 300+ TPS、峰值系统内存 <32GB。antirez 也在 128GB M5 Max 上通过 SSD 流式运行,速度超预期。

DwarfStar running DeepSeek v4.1 Flash on a 128GB M5 Max. I didn't expect with SSD streaming it could be so fast. Recent SSD streaming changes to retain the right experts surely helped, but also maybe DS4.1 uses the same experts more. Will push online when ready QA > ASAP.
— @antirez

DwarfStar 在 128GB M5 Max 上跑 DeepSeek v4.1 Flash。我没想到靠 SSD 流式能这么快。最近保留正确专家的 SSD 流式改动肯定帮了忙,但可能也因 DS4.1 更频繁地复用同一批专家。等 QA 准备好就尽快上线。

vLLM 同期新版本把 DeepSeek-V4 共享专家融合进 MegaMoE,Mooncake Store 也能卸载 decode KV,进一步解释了为何这类模型在开源基础设施上的服务门槛正在快速下降。

4. OpenAI GPT-Live-1 上线:全双工语音模型进入 API

OpenAI 将 GPT-Live-1 推向 API,定位为全双工语音接口:可以在"说话的同时倾听",并把工具调用或推理委托给后端模型。OpenAI 官方基准称其较 GPT-Realtime-2.1 全面提升,包括搭配 GPT-6 Astra 时 Tau3 首次尝试任务完成率 83.6%、Artificial Analysis Conversational Dynamics 97.3%、Full Duplex Bench v1 响应起始延迟 0.798s。LiveKit、HeyGen、Telnyx、Speak 与 Cognition 的 Devin Voice 等快速跟进,暗示它可能比此前的 realtime 栈更快成为生产级语音 Agent 的默认底座。

GPT-Live-1 is now available in the API.

Bring ChatGPT's natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose.
— @OpenAIDevs

GPT-Live-1 现已在 API 中可用。把 ChatGPT 那种自然的一来一回对话带进你的应用:语音 Agent 边听边说,并配合你选择的模型和 harness 一起工作。

5. OpenAI Agents API 与托管沙箱:托管 Agent 基础设施成型

除语音外,OpenAI 还宣布 Agents API 公测(搭载 Codex harness),并提供 OpenAI 托管的沙箱用于代码执行、文件与 artifacts,目标是把模型、运行时与沙箱收敛到同一表面。这一方向与 Google 的 docs-for-agents、Cursor 的持久工作区形成合力:行业正在从"无状态模型端点"转向"有状态、组织感知的 Agent 环境"。企业侧,ChatGPT Work 的数据 Agent 可基于接入的公司数据源提供看板、问答与行动,Box 则称其为"AI 的文件系统"。

6. Cognition 发布 SWE-2:最接近前沿的编码模型

Cognition 发布 SWE-2,称其为"迄今最接近前沿的模型",在主流编码评测上以最高低 70% 的成本追平近期前沿模型,并明确表示把 RL 扩展到了数万亿参数。团队自建算法、基础设施与数据;另有一项实用 RL 发现:一个简单的线性长度惩罚即可在训练时保持各努力档位下的帕累托曲线形状。Devin 栈同步多模态化——推出由 GPT-Live 与 SWE-2 驱动的 Devin Voice,并宣布 Dioxus Labs 加入 Cognition,负责 Devin 的 VM、computer use 与测试。

Introducing SWE-2, our closest model yet to the frontier.

On leading evals, it scores on par with recent frontier models – at up to 70% lower cost.

We scaled RL to multiple trillions of parameters, with a refined recipe that pushes the Pareto curve on both capabilities & cost.
— @cognition

推出 SWE-2,我们迄今最接近前沿的模型。在主流评测上,它以最高低 70% 的成本追平近期前沿模型。我们把 RL 扩展到数万亿参数,用一套打磨过的配方同时推进能力与成本的帕累托曲线。

7. Cursor Projects:编程代理走向持久化项目线程

Cursor 推出 "Projects" 功能:带协调器 Agent 的持久线程、跨 Agent 共享的记忆/artifacts,以及跨用户设备与 Agent 计算机的同步。这意味着从"每次对话一个任务"走向"长生命周期的软件项目基座",子 Agent 可以随时间累积状态。结合 Claude Code 的新窗口弹出、托管 Agent 会话查看器与 auto 模式,市场正在收敛到一个共识:编码 Agent 需要的不仅是更强的补全,而是持久上下文、可检视会话与显式编排控制。

8. 安全与治理:Anthropic 威胁情报报告与推理可监控性之争

Anthropic 发布了迄今最详细的威胁情报报告,覆盖利用 Claude 进行网络攻击、影响力行动、监控、生物与武器等滥用尝试,声称破坏了报告中描述的每一次行动,并在适当时与当局及其他 AI 公司共享发现。相关讨论的另一条线索是"推理可监控性":Redwood Research 提议为可能削弱思维链可见性的架构制定透明规范,Ryan Greenblatt 主张企业在部署大幅降低 CoT 依赖的架构前应公布证据与政策,Neel Nanda 则将 GPT-6 Astra 解读为"无 CoT 推理"可能令人担忧的跳跃。

We're publishing our most detailed threat intelligence report to date.

It covers how people tried to misuse Claude—for cyberattacks, influence operations, surveillance, biology, and building weapons—and how we found and stopped them.
— @AnthropicAI

我们发布迄今最详细的威胁情报报告。它记录了人们如何试图滥用 Claude——用于网络攻击、影响力行动、监控、生物和制造武器——以及我们如何发现并阻止他们。

在风险文化上,前沿实验室员工与离职者之间也出现公开分歧:有人强调 AI 的人道主义价值,也有人公开支持 >10% 灭绝风险的判断。治理方面,Hugging Face 宣布成立新的 Open Alignment 团队。

9. OpenAI 千禧难题证明争议:万代理运行 Navier–Stokes

Reddit 上热度最高的话题之一是 OpenAI 在多智能体数学求解上的"规模":据称针对 Navier–Stokes 存在性与光滑性问题,动用了约 10,000 个 Agent 运行 88 小时,约合 88 万 Agent 小时 / 100.5 Agent 年。社区争论的焦点是多 Agent 集群主要缩短墙钟时间、而非提升可解任务上限——"2 个 Agent 并非 1 个的 2 倍快",且协调开销导致效率大概率是次线性的。另有一位数学教授在 LinkedIn 发帖指控 OpenAI "可能窃取了又一个重大证明",但帖子未提供任何可验证证据,社区普遍认为这仍是未经验证的指控。

10. Agent 研究:harness 成为核心优化目标

一批论文把矛头指向了同一个主题:harness(脚手架)现在是核心优化对象。Salesforce 的一篇论文总结显示,用更强专家的完整轨迹训练较弱模型,在 harness 演化后可能反而让性能下降 4–30 分,因为微调模型学到了不兼容的规划风格;修复方案是只重写较弱模型自身 rollout 中失败的那一轮。字节跳动的 HarnessDev 则让 Agent 自己构建并迭代改进可运行 harness,但仅 34/64 的改动能在留出任务上方向性迁移。此外,Qwen 的 Elastic Horizon 用闭环控制器跟踪成功轨迹长度的 90 分位来调整最大交互轮数,最多省 25% 轨迹 token;PARSER 用并行冻结子 Agent + RL 训练的主 Agent 做 scatter-gather,在 896K 上下文下 +12 分、延迟最高降 11 倍。整体趋势是从"把 prompt 写得更狠"转向对脚手架、轨迹预算、技能文档与工具轨迹的闭环优化。


当日总结:DeepSeek V4.1-Flash 是绝对主角,它以开源权重、MIT 许可、1M 上下文、图文输入、极低缓存折扣,以及在 SSD/offload 消费级硬件上的可行性,把"可服务性"推到了与"能力"同等重要的位置。围绕它的争论也异常真实:评测数据亮眼,但 verbosity 极高、真实工作流中的脆弱性与技能缺口仍被从业者诟病。同一天里,OpenAI 把语音与 Agent 基础设施产品化,Cognition 与 Cursor 从两个方向押注持久化编码 Agent,Anthropic 则把安全透明度推上新高度——这一天不算"安静",反而相当密集。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!