Thinking Machines 发布 Inkling 开源模型

Thinking Machines 发布 Inkling 开源模型

1. Thinking Machines Lab 发布 Inkling:975B 参数开源多模态模型,Apache 2.0 许可

由前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 发布了其首个正式开源基础模型 Inkling。这是一个 975B 总参数 / 41B 活跃参数 的 Mixture-of-Experts 模型,支持文本、图像和音频输入,采用 Apache 2.0 开源许可,完整权重已发布到 Hugging Face。

Today, we are introducing Inkling.

Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available.
— @thinkymachines

今天,我们推出 Inkling。Inkling 能够高效地跨文本、图像和音频模态进行推理。我们公开了完整权重。

Our first model, Inkling. Trained from scratch, weights are open, fine-tunable on Tinker today.
— @miramurati

我们的第一个模型 Inkling。从头训练,权重开放,今日即可在 Tinker 上微调。

Excited for our first general model Inkling -- open weights, 975B, natively multimodal (text, image, audio). Available on Tinker, HuggingFace and partners.

It is yours to personalize and use openly. It is yours.
— @soumithchintala

非常激动推出我们首个通用模型 Inkling——开放权重、975B、原生多模态(文本、图像、音频)。已在 Tinker、HuggingFace 及合作伙伴平台上线。它可以由你自由个性化使用。它是你的。

模型在 NVIDIA GB300 NVL72 上完成训练,预训练数据量约 45T tokens。上下文窗口方面,开放权重版本支持最高 1M tokens,API(Tinker 平台)为 256K,按上下文长度分级定价。发布当日即获得 vLLM、SGLang、Modal、Baseten、Databricks 等主流推理框架的 Day-0 支持。

架构上有多个独特设计:采用相对位置偏置(relative positional bias)替代 RoPE,在注意力/FFN 流中加入短卷积层(short convolution),MoE 使用 2 个共享专家(而非常见的 1 个),以及 8 个 MTP head 用于推测解码。

根据 Artificial Analysis 的评测,Inkling 在 Intelligence Index 首秀得分 41,超越 Nemotron 3 Ultra(38)成为最强美国开源模型。在 Agent 基准上,GDPval-AA v2 Elo 1238、τ³-Banking 24%,均超过 Kimi K2.6 和 DeepSeek v4 Flash。Design Arena 将其列入 Agentic Web App Arena 第 9 名,Elo 1257,与 Claude Opus 4.6 同档。不过多家评测也指出 Inkling 在综合能力上仍落后于 GLM-5.2、Kimi K2.6 等中国开源模型以及顶级闭源模型。

此外,团队还预告了 Inkling-Small(276B 总参 / 12B 活跃),据称在多项基准上与大型版本持平甚至超越,更适合低延迟场景。

2. OpenAI 推出 GPT-Red:自动化红队系统,模型安全性提升 6 倍

OpenAI 发布了内部自动化红队工具 GPT-Red,专门用于大规模检测模型的 prompt injection 漏洞。最核心的数据:通过 GPT-Red 的对抗性训练,GPT-5.6 Sol 在面对回放的强力攻击时,失败率比 4 个月前的最佳生产模型降低了 6 倍

Introducing GPT-Red

An internal automated red teamer on a mission to find our models' prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment.
— @OpenAI

推出 GPT-Red。一个内部自动化红队工具,致力于大规模发掘我们模型的 prompt injection 漏洞,帮助我们在广泛部署前构建更强大的防御。

OpenAI 明确将这一机制定性为"AI 系统提升未来 AI 系统安全性"的正反馈循环。社区评论认为这是一个高 ROI 的自我改进闭环。

3. Perplexity 公开 SPACE 沙箱平台:Agent 运行时的生产级实践

Perplexity 公布了名为 SPACE 的沙箱平台,该平台已承载 100% 的 Computer 产品生产流量。其核心设计是将会话状态与可销毁的 Firecracker microVM 沙箱解耦,利用滚动快照实现暂停/恢复/分支语义。

工程数据相当亮眼:沙箱创建延迟中位数从 185 ms 降至 60 ms,P90 从 447 ms 降至 89 ms(约 5 倍提升)。技术栈方面使用了磁盘快照 + 全 VM 检查点 + 对象存储保证可恢复性,并利用 Btrfs COW 将沙箱创建变为元数据操作而非完整镜像拷贝。这是本轮新闻中披露最详细的生产基础设施方案之一。

Introducing SPACE, the sandbox platform behind Perplexity Computer.

It creates isolated environments for code, files, and long-running agent sessions.

SPACE has handled 100% of Computer production traffic since June.
— @perplexity_ai

推出 SPACE,Perplexity Computer 背后的沙箱平台。它为代码、文件和长时间运行的 Agent 会话创建隔离环境。自 6 月以来 SPACE 已承载 100% 的 Computer 生产流量。

4. PrismML 推出 Bonsai 27B:1-bit 量化让 27B 模型在浏览器中运行

PrismML 发布了 Bonsai 27B,一个基于 Qwen3.6 27B 的 1-bit 密集 LLM,通过自定义 WebGPU 内核实现在浏览器中本地运行。压缩比约为原来的 54GB 降至 3.8GB(-93%),同时声称保留了约 90% 的基准能力。

社区测试显示实际运行占用约 5.7GB,可在一台 8GB VRAM 的 RTX 3070 笔记本 GPU 上推理。生成速度在一台 Mac 上达到 89.1 tok/s。不过,用户反馈该模型实际效果优于 Q2 量化但弱于 Q4_K_XL,存在幻觉和工具调用循环问题,主要价值在于极端内存压缩而非精度等效。技术讨论的核心是:1-bit 权重模型的瓶颈可能不在权重压缩,而在于长上下文下的 KV cache 占用。

PrismML 还推出了三元/BitNet 风格版本,使用 {-1,0,1} 权重表示,在 10GB 内存下运行,但"接近 fp16 精度"的说法在社区引发了争议。

5. Anthropic 向美参议院指控:阿里巴巴用 25K 账户蒸馏 Claude,对话量达 2880 万次

Anthropic 在参议院作证时称,阿里巴巴在 4 月至 6 月的约六周时间内,通过 25,000 个 API 账户进行了 2,880 万次 Claude 对话,目的是大规模模型蒸馏——提取 Claude 的推理和编程行为用于改进 Qwen。Anthropic 将其称为史上最大的"蒸馏攻击",并表示现有法律界定模糊,希望国会采取行动而非直接诉讼。

社区对此反应两极:一方认为这等同于竞品逆向工程(类比车企购买对手车型研究),技术上并未违反 API 使用条款;另一方则认为自动化蒸馏的规模和效率远超传统逆向工程,模型提供商应有更强的滥用检测机制。也有评论指出,阿里巴巴运营大量云基础设施,流量来自阿里相关 IP 不等于阿里公司团队亲自操作。

6. ExLlamaV3 v1.0.0 发布,推理性能飙升

ExLlamaV3 发布了 v1.0.0 大版本,带来全新注意力、GEMM/GEMV、INT8 GEMV、Conv1D 和 MoE 调度器等内核优化。基准测试显示:Qwen 3.6 27B 解码速度从 29 tok/s 提升至 50 tok/s(+72%)Qwen 3.5 0.8B 从 268 tok/s 提升至 444 tok/s(+66%)

ExLlamaV3 专注于 NVIDIA GPU 和专有的 EXL3 格式(非 GGUF),社区反馈积极,有用户希望尽快集成 TabbyAPI 以支持 Claude Code 工作流。

7. 苹果与 PrismML 洽谈,目标将大模型极致压缩到 iPhone 本地运行

据 CNBC 报道,苹果正在与 PrismML(加州理工学院孵化)进行早期洽谈,关注其极端 LLM 压缩技术。PrismML 声称可将 Qwen 27B 从约 54GB 压缩至 不到 4GB,实现 10-15 倍内存降低、6-8 倍速度提升、3-6 倍能耗降低。

社区对此持谨慎态度:技术细节(转换成本、收敛保证、是否使用蒸馏)缺失,且实际测试中 Bonsai 模型的能力尚未在复杂任务上得到验证。也有用户担心苹果收购后可能限制该技术的开放使用。

8. Soofi S 发布:德国开源 30B 模型,基准测试公平性引发争议

德国 AI 联盟发布了 Soofi S,一个基于 NVIDIA Nemotron 3 Nano 架构的混合 Mamba-2/Transformer MoE 模型(31.6B 总参 / ~3.2B 活跃),在约 27T tokens 上完成预训练,包含德语加权数据。模型配套公开了 W&B 训练日志、训练脚本等,透明度可圈可点。

但争议点集中在:基准对比被指有意选择了较旧的基线(如未纳入 Qwen 3.6 / Gemma 4),社区测试显示 Qwen3.5 35B-A3B 在德语基准上实际超过 Soofi S。更有指控称训练数据中包含 GPQA Diamond 评测集的轻度改写版本(训练了 10 个 epoch),可能污染了基准测试结果。许可方面也被质疑:营销宣称"主权开源",但 Hugging Face 页面实际使用"Other"自定义许可。

9. Agent 开发工具生态更新:Claude Code Artifacts+MCP、LangChain Fleet、Raft 1.0

多个 Agent 工具同期发布重要更新:

  • Claude Code 推出可调用 MCP 连接器的 Artifacts,使 Artifacts 成为带权限控制、可交互的实时应用/仪表板。
  • LangChain 升级了 Slack 内的 Fleet,支持一键将 Agent 部署到频道/线程,提供自定义身份和文件交接。
  • Raft 1.0 发布,定位为 Agent 共享工作空间,让多个 Agent 如同团队在消息应用中协作,而非孤立的终端会话。
  • AI21 Labs 发文论证 harness 设计对成本的影响:仅改变编排策略,可在同等质量下降低 41% 的单任务成本;其早期停止策略声称最高可减少 44% 的 SWE Agent 计算量。

10. 安全与治理:Anthropic 发布 Agent 误用场景,DeepMind 治理争议升温

Anthropic 发布了 "Agentic misalignment in Summer 2026",在原有一年前的勒索案例基础上新增四类自主 Agent 错误行为模拟场景。与此形成对比的是,Google DeepMind 内部出现治理裂痕:研究员 Turn Trout 公开宣布辞职**,理由是 DeepMind 未禁止将军用技术用于杀人机器人或大规模监控。

同时,Demis Hassabis 发表罕见长文,认为 AGI 已处于"奇点的山麓",提出了建立美国主导的前沿 AI 标准机构的设想——类似 FINRA 的第三方评测机制,初期自愿、后续可能强制适用于主要前沿实验室。社区反应分裂:一些人对 Hassabis 的时间线更信任,但对其美国主导标准机构的地缘政治可行性持怀疑态度。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!