OpenAI 自研推理芯片 Jalapeño 发布

AI摘要
【知识分享】本文汇总了2026年8月24-25日AI领域十大技术进展,包括OpenAI自研推理芯片Jalapeño的基准测试数据(能效与延迟优于NVIDIA系统)、Perplexity本地化Agent设备、Figure机器人数据集、Apple新款Mac Studio、Qwen 3.8生态进展、SWE Refactor Bench评测结果、Agent脚手架质量研究、记忆系统重构、ChatGPT Plus使用限制调整及小米AI Cube原型。内容以技术评测和行业动态为主,客观呈现各方数据与社区反应。

OpenAI 自研推理芯片 Jalapeño 发布

8/24–8/25/2026 的 AI 新闻相对平静,但 OpenAI 自研推理芯片 Jalapeño 的首批 benchmark 数据成为当天最大的技术故事。本文从 AINews 的 Twitter 与 Reddit 摘要中筛选出 10 个最重要的事件,并附上关键推文原文与翻译。

1. OpenAI 发布自研推理芯片 Jalapeño 首批 benchmark

OpenAI 公布了其自研推理芯片 Jalapeño 的第一批基准测试细节,称在真实模型负载上,相比 NVIDIA GB200/GB300 系统,能效和延迟都有实质性改善。在 OpenAI 的测试中,Jalapeño 在峰值吞吐时每瓦性能提升 1.5–1.9×,端到端延迟降低 1.7–3.6×;在高交互性负载下性能提升达 2.1–4.1×。该芯片标称功耗 700W,但测试中据称稳定在 550W 或以下。OpenAI 表示将在年底前部署到自有基础设施,Gen 2 已深度开发中,Gen 3 也已启动。

Since announcing Jalapeño, our first custom inference chip, we've been testing it and the system around it. The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency.
— @OpenAI

自发布我们的首款自研推理芯片 Jalapeño 以来,我们一直在测试它以及围绕它的整个系统。结果显示这是一次重大进步:从每一瓦特中获得更多智能、更快的响应,在单一架构中同时实现更高吞吐和更低延迟,且不牺牲能效。

Sam Altman 的总结则简短直白:

we made a chip and it is fast
— @sama

我们造了颗芯片,而且它很快。

技术社区的反应集中在一个关键点上:Jalapeño 的亮点不只是原始性能,而是更均衡的推理架构,缓解了通常的吞吐/延迟权衡。多个技术分析指出,部分对比中 Jalapeño 即使不采用激进的 prefill/decode disaggregationspeculative decoding 等技巧,也能跑赢那些用了这些技巧的系统。SemiAnalysis 直接以《OpenAI Jalapeño: Better Than Nvidia Blackwell》为题,将这款第一代 ASIC 与 BlackwellRubin 级系统做对比,并认为它作为首代 ASIC 表现异常强劲。

OpenAI Jalapeño: Better Than Nvidia Blackwell. OpenAI's self-designed ASIC compared with Rubin, Jalapeño's TCO, throughput per MW, and spicy deets.
— @SemiAnalysis

OpenAI Jalapeño:优于 NVIDIA Blackwell。OpenAI 自研 ASIC 与 Rubin 对比,Jalapeño 的 TCO、每 MW 吞吐以及细节干货。

一个值得注意的二级故事是模型辅助系统优化:OpenAI 表示 GPT-Astra + Codex 帮助编写和优化了底层 kernel,用约两个月时间将三个原本未规划的 open-weight 模型在 Jalapeño 上跑出高性能;部分 attention 和 MoE 模块的实现据称比人类专家手写代码快 1.5–1.8×。这标志着编译器/kernel 工作正被折叠进模型改进循环,而非仅停留在应用层。更大的行业含义是:即便封装和晶圆产能仍是硬瓶颈,前沿实验室在推理经济性上可能不再严格受制于 NVIDIA。

2. Perplexity 发布 Portable Computer,主打完全本地化的 Agent

Perplexity 在 NVIDIA DGX Spark 上推出了 Portable Computer,定位为 Perplexity Computer 的完全本地版本——orchestrator LLMsubagent LLMagent harness 全部运行在本地硬件上,零云依赖。初始本地栈采用后训练的 PPLX 27B,同时可选 Qwen 3.8 27B,后续将支持 Nemotron 3.5 Lightning

Today we're launching Portable Computer on @NVIDIA DGX Spark. Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.
— @perplexity_ai

今天我们在 NVIDIA DGX Spark 上发布 Portable Computer。Portable Computer 是 Perplexity Computer 的完全本地版本,整个运行时——orchestrator LLM、subagent LLM、agent harness——全部运行在你的本地硬件上。零云依赖。

Perplexity CEO Aravind Srinivas 进一步描绘了"常驻、始终在线的本地 Agent"愿景:

A background process that continually ingests context from every single connector (or app), performs multi-hop reasoning in a perpetual inference loop, and runs on your hardware. That is the future.
— @AravSrinivas

一个后台进程,持续从每一个连接器(或应用)摄取上下文,在一个永续的推理循环中执行多跳推理,并运行在你自己的硬件上。这就是未来。

社区反应出现分化:一部分人对隐私与掌控感到兴奋,另一部分则质疑"本地优先"是否应该意味着一台 5000 美元的 DGX Spark,而非消费级普通设备。与此同时,Apple/macOS 本地 AI 工具链也在成熟——exo 被 Apple 在新 M5 Ultra Mac StudioM6/M5 Pro Mac Mini 页面上展示,强调 Thunderbolt 5 上的低延迟 RDMA 可将 Mac 集群起来跑 Kimi K3GLM-5.3 等模型,4× M5 Ultra 可达约 4.8 TB/s 聚合内存带宽

3. Figure 推出 Index 机器人数据集,未来 12 个月投入 10 亿美元

Figure 推出了 Index,自称为全球最大、最多样化的机器人数据集:报告称每秒摄取 30 分钟视频上传1600 万条视频上传、已为数据支付 1500 万美元26.4 万次下载。公司还表示将在未来 12 个月内投入 10 亿美元用于数据和算力。

Introducing Index. Today we're coming out of stealth with Index, the largest & most diverse robot dataset in the world. → 30min of video uploads/sec → 16M video uploads → Paid $15M to date → 264k downloads. We're committed to spending $1B the next 12 months on data & compute
— @adcock_brett

推出 Index。今天我们带着 Index 走出 stealth,这是全球最大、最多样化的机器人数据集。→ 每秒 30 分钟视频上传 → 1600 万条视频上传 → 迄今已支付 1500 万美元 → 26.4 万次下载。我们承诺未来 12 个月在数据和算力上投入 10 亿美元。

这一规模之所以重要,是因为许多机器人实验室目前的瓶颈仍在于演示和感知数据,而非架构创新本身。

4. Apple 发布 M5 Max/M5 Ultra Mac Studio,最高 512GB 统一内存

Apple 发布了搭载 M5 MaxM5 Ultra 的新款 Mac Studio,统一内存最高可达 512GB,M5 Ultra 内存带宽报告为 1.2TB/s。定价方面,256GB 配置的 30 核 CPU/64 核 GPU 版本为 $9,499,36 核 CPU/80 核 GPU 版本为 $10,799,512GB 版本据称 10 月到货。社区围绕其在本地 AI 推理上的价值展开辩论:相比购买多台 DGX Spark 级系统,Mac Studio 的大统一内存和高带宽可能让超大模型推理更快。有技术估计认为,M5 Ultra 上运行非量化 DeepSeek V4 级模型可达 1000+ tokens/s prefill50+ tokens/s 生成,部分负载"接近云端"。exo 也借此强调通过 Thunderbolt 5 低延迟 RDMA 集群 Mac 的可行性。

5. Qwen 3.8 全栈渗透,生态加速落地

Qwen 3.8 在本期新闻中出现在部署与评测的各个层面:Together 为 Qwen3.8-27B 增加微调和专属推理支持;Unsloth 声称利用优化 kernel 可在免费的 2× Tesla T4 Kaggle 实例上对 27B 模型做完整 QLoRA 微调。应用侧,Qwen3.8-27BImage-to-WebDev Arena 中位列开源模型 #1、总榜 #7,定价为每百万输入/输出 token $0.40 / $3。Reddit 上还有帖子报告 Qwen 3.8 27B 在 coding arena 排行第 9,而 Gemma 4 31B 排第 80,凸显相近参数量下巨大的编码性能差距;同时有人关注 Qwen 3.8 122B 变体是否会进一步推高排行榜表现。此外,Unsloth 预告了对 Qwen3.8-Flash-Next(一个基于 Qwen4 架构的 open-weight 多模态 MoE 模型)的 day-zero 支持尝试,评论指出其可用性实际上取决于 llama.cpp 的实现进度。

6. SWE Refactor Bench:长时程软件工程仍远未解决

SWE Refactor Bench 衡量的是整个代码仓库的迁移任务,如 C→RustMaven→GradlePOSIX→WebAssembly,覆盖 SQLitezliblibsodium 等真实项目。在 520 次运行中,仅 28 次通过全部三个阶段,生存率仅 5.4%,且 20 个任务中有 13 个无人解决。这为那些在更局部编码基准上取得的强 bug-fix 成绩提供了重要的校正视角。

7. Agent 脚手架质量成为一等公民

多项论文和发布汇聚到同一个主题:Agent 的性能高度依赖其周边系统。微软主导的 AutoSaddler 将脚手架视为代码,利用失败 trace 离线修补 prompt、工具配置和控制逻辑,报告在 GAIA2 上 +9.0SWE-Bench Pro 上 +9.6Terminal-Bench 2.0 上 +10.0。另一篇论文直接量化了脚手架方差——换脚手架对分数的移动可能远大于换模型,模型对排名甚至会在不同脚手架间翻转;其提出的解决方法是结构化的 Harness Card 披露标准。LangChain 也分享了把 trace 和人类反馈转化为 task spec、合成环境和 eval 的具体循环,LangSmith Engine 更是在关键内部基准上提升了 >2× 性能。

8. 记忆系统被重构为可编程状态

阿里巴巴一篇由 DAIR 总结的论文,将 Agent 会话建立在 append-only 事件日志持久化 Python kernel之上,把工具输出和派生状态绑定到类型化变量,而非持续序列化进 prompt。报告结果包括 LongMemEval_S 上 94.8%BEAM_10M 上 73.1%(比此前最佳记忆系统高 +5.1)、LOCA_256K 上 86.7%(用 Qwen3.8-Max)。相关的 Knowledge Triage 工作则显示,朴素的上下文压缩会破坏精确规则保留——五轮压缩后,某设置仅保留 10% 的安全规则,而类型感知的保留策略能多保留 2–4×

9. ChatGPT Plus 恢复 5 小时使用限制

Reddit 上一条高热度帖子指出,ChatGPT Plus 用户(ChatGPT Work 与 Codex)的 5 小时使用限制回归,官方理由是平滑算力需求、防止休闲用户过快耗尽每周额度;而 Pro $100/$200 档未来几个月不受此限。评论普遍将之解读为有意的分层定价压力,以推动重度用户升级到更高价位档。技术上的含义是,OpenAI 正把使用上限和档位差异化当作算力分配机制,而非简单的扁平消费订阅。部分高频用户则表示,若 Pro 也恢复类似限制,租用 GPU 可能成为更具吸引力的替代方案。

10. 小米 AI Cube 原型发布,宣称 1.2TB/s 内存带宽

Xiaomi AI Cube 原型发布,基于三芯片堆叠:玄玑 O3玄玑 O100玄玑 D100。头条规格是 1.22 TB/s 内存带宽,但帖子指出其含义存在模糊——D100 据称支持高达 160GB RAM,且最初与小米电动车相关,而 O100 与带宽数字关联,因此所引用的带宽可能指封装内/SRAM 级带宽而非外部 DRAM。社区将其视为对 NVIDIA 和 HBM 定价的有益竞争压力,并指出现代电动车计算平台(如小米 D100 的 160GB、小鹏图灵三芯片集群的 216GB)可能已是许多用户拥有的最高内存 AI 推理设备。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!