Gemini 3.7 Flash 发布,价格腰斩

Gemini 3.7 Flash 发布,价格腰斩

1. Google 发布 Gemini 3.7 Flash,编码与智能体能力大幅跃升

Google 在 3.6 Flash 发布仅三周后就推出了 Gemini 3.7 Flash,定位为面向编码、网页开发、知识工作和 agentic 工作流的新一代主力模型。官方强调编码与自主性基准显著增强,并给出年内入门价 $0.75 / $3.75 每百万 input/output tokens(之后回升至 $1.50 / $7.50),相当于 3.6 Flash 原价的五折。

官方披露的基准提升包括:DeepSWE 65.3% vs 49.0%FrontierCode 43.6% vs 34.4%AutomationBench 30.4% vs 17.0%,以及 Code Arena Elo 1588(对比 1506/1538)。生态落地非常迅速,已覆盖 Gemini API、AI Studio、Android Studio、Antigravity、Gemini Enterprise 等,并快速进入 Cline、Devin、VS Code Agents 等外部编码工具链。

Today we're introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work. Now through the end of the year, Gemini 3.7 Flash is available at an introductory price of $0.75/1M input and $3.75/1M output tokens.
— @Google

今天我们推出 Gemini 3.7 Flash,这是我们迄今最智能的编码与智能体主力模型。该模型在软件工程、网页开发和复杂知识工作方面带来显著提升。从现在到年底,Gemini 3.7 Flash 以每百万输入 $0.75 / 每百万输出 $3.75 的入门价提供。

独立评测也大体确认了这一跨越:Artificial Analysis 将 Gemini 3.7 Flash (high) 放在智能指数 56(较 3.6 Flash 提升 4 分),输出速度约 340 tok/s1M 上下文,并同时登上智能-时间、智能-成本两个 Pareto 前沿;Arena 将其推至 WebDev Code Arena #8、Text Arena #9。从业者还提到它在工具循环中"更自律":更多探索、更多跑测试、更少浪费轮次。

2. DeepSeek-V4-Pro 发布,API 价格同步大幅上调

DeepSeek 同日发布 DeepSeek-V4-Pro,主打 agent 能力与生产环境收益,并为 V4-Pro 与 V4-Flash 引入灵活推理档位(低/高/最高),同时原生支持 OpenAI Responses API、为 Codex 做了一键优化。权重已上传 Hugging Face(deepseek-ai/DeepSeek-V4-Pro-0813),社区引用 DeepSWE 从 V4-Pro Preview 的 12.8 跃升至 62.7,据称超过 GLM-5.2 与 Opus-4.8。

We're launching DeepSeek-V4-Pro today! 🚀 Major Agent upgrades with strong production gains! Flexible reasoning effort for V4-Pro & V4-Flash: low for simple tasks, high for daily Agent workflows, max for complex tasks. Native OpenAI Responses API support, optimized for Codex with one-click setup.
— @deepseek_ai

今天我们发布 DeepSeek-V4-Pro!🚀 Agent 能力大幅升级,生产环境收益强劲!V4-Pro 与 V4-Flash 支持灵活推理档位:简单任务用 low,日常 Agent 工作流用 high,复杂任务用 max。原生支持 OpenAI Responses API,为 Codex 一键优化。

但社区讨论的焦点更多落在定价上:自 2026-08-16 16:00 UTC 起,DeepSeek 引入高峰/非高峰定价(高峰为非高峰的 2 倍)。其中 V4-Pro 缓存命中从 $0.003625 涨至 $0.022/$0.044,即 +507% / +1114%;输出从 $0.87 涨至 $1.98/$3.96。多位用户表示已开始迁移,认为 DS4 "便宜时才值得用",长期上下文/依赖 prompt 缓存的工作负载成本优势明显收窄。

3. DeepSeek Harness 以 MIT 协议开源

DeepSeek 开源了 DeepSeek Harnessdsh),采用 MIT 许可,目前为 0.1.0 开发者预览版。技术社区最关注的不是跑分,而是架构:多 harness"模式"、可组合插件、可见轨迹、KV-cache 感知的 append-only 历史语义,且项目本身大量由 agents/Codex 构建。一个反复出现的解读是:DeepSeek 把它当作递归自我改进的 OS/运行时基座,而非又一个 Claude Code 克隆。项目明确声明"会有破坏性变更",并引导开发者进入 Discord 讨论。

DeepSeek Harness was just released with MIT license. The current 0.1.0 version is a developer preview, and may still have many rough edges. Feedback is welcome!
— @tianyi

DeepSeek Harness 刚以 MIT 协议开源发布。当前 0.1.0 版本是面向 Harness 开发者的预览版,可能还有不少粗糙之处,欢迎大家反馈。

4. OpenAI 与 Cerebras 推出 GPT-5.6 Sol "Ultrafast" 模式

OpenAI 预览了 GPT-5.6 Sol 的 Ultrafast 模式,由 Cerebras 提供算力,速度高达 750 tokens/s、比标准模式快 14 倍,首阶段面向部分 API 客户。官方列举的用例包括低延迟的语音、客服、电商、编码、金融与安全工作流。这一发布也引发了一个更宏观的讨论:工具延迟而非模型延迟,即将成为 agentic 系统的瓶颈

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows.
— @OpenAI

预览 Ultrafast 模式:GPT-5.6 Sol 速度提升最高 14 倍。将先在 OpenAI API 面向部分客户推出,随着算力增长向更多企业开放。

5. Qwen3.8-2.4T-A95B 发布,本地推理门槛极高

Qwen 在 Hugging Face 发布了 Qwen3.8-2.4T-A95B,一个稀疏/MoE 风格的超大模型:名称暗示约 2.4T 总参数、每 token 约 95B 激活参数。bf16 下存全部权重需约 4.8–5 TB 内存/磁盘,社区普遍认为完整模型对普通家用/自建环境不现实,只有 95B 激活切片"勉强像本地模型"。有人估算本地吞吐约 0.003 tokens/s,并戏称需要约 10 万美元级硬件。用户同时也在期待更适合 RTX 3090 等 24GB 显卡的 27B 变体。

6. MiniMax-Music3 开源,H3 视频编辑登顶 Arena

MiniMax 发布了开源权重的音乐模型 MiniMax-Music3,描述为 8B LLM + 2.7B DiT,可将 prompt + 歌词直接生成完整歌曲,并可经 diffusers/ComfyUI/Hugging Face Spaces 在消费级硬件上运行。视频侧,MiniMax-H3Video Edit Arena 整体及开源模型中均排名 #1,得分 1390,据称领先第二名约 +32 分

🎵MiniMax-Music3 — Next-Generation Open-Weights Production-Ready & Versatile Music Model
— @MiniMax_AI

🎵MiniMax-Music3 —— 下一代开源权重、生产就绪的多功能音乐模型

7. Grok 4.6 基准测试:与 GPT-5.6 Sol 并列

Artificial Analysis 智能指数显示:Claude Opus 563 领先,Claude Fable 562,而 GPT-5.6 SolGrok 4.6 并列 61。社区着重强调性价比:Grok 4.6 定价约 $2/M 输入、$6/M 输出,远低于 GPT-5.6 Sol 的 $5/M / $30/M,同时据称是约 1.5T 参数的小体量模型。基准表中 Grok 4.6 High 在 GDPVal-AA v2、AA-Briefcase、Harvey LAB 上领先。有讨论认为其相当于"Grok 4.5 + 额外 RL",并推测 xAI 与 OpenAI 的差距可能仅约 3 个月。

8. OpenAI 推出 Computer History,桌面上下文记忆

OpenAI 为 ChatGPT 桌面应用加入 Computer History:可选择性地把电脑上应用与网站的活动作为上下文记忆,提供时间线视图与用户控制,让后续交互更个性化、无需反复解释。这是继"桌面应用可读屏"之后,OpenAI 在本地上下文侧的一次明显扩张。

ChatGPT can now remember your activity across the apps and websites on your computer. With Computer History in the desktop app, future interactions feel more personalized and require less explanation.
— @OpenAI

ChatGPT 现在可以记住你在电脑上跨应用和网站的活动。借助桌面应用中的 Computer History,未来的交互会更个性化,也更少需要解释。

9. 论文:可窃取 Claude/GPT 的隐藏推理轨迹

论文 "Stealing Reasoning Traces from Proprietary LLM APIs" 提出一种 API 侧泄漏方法,可恢复 ClaudeGPT 的隐藏推理 token(示例见 mitkox/stolen-thoughts)。其中一个 AIME 示例中,解码出的 Claude 轨迹直接识别出"这是已知 AIME 题,答案 60",引发对基准污染与闭源模型数学分数虚高的担忧。社区观点分化:有人认为这些轨迹只是记忆、不连贯中间 token 与过度思考,说明开源模型与闭源的差距可能被高估;也有人担忧此类泄漏已被用于大规模蒸馏闭源模型。

10. 六大厂商签署欧盟 AI 内容透明度行为准则

Anthropic、OpenAI、Google、Meta、Microsoft、Mistral 被报道签署了欧盟关于 AI 生成内容透明度的行为准则。OpenAI 表态希望把溯源信号扩展到包括文本在内的所有模态。社区将其解读为未来对生成代码与散文做隐形水印的起点,并争论:文本水印可能只需约 10M token 即可被小模型(如 1.5B)逆向去除,也可能干扰 agentic 代码生成与编译;还有担忧认为这会推动用户转向未签署方或中国模型。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!