Agent Harness 成主战场,持久化 Agent 开源

Agent Harness 成主战场,持久化 Agent 开源

本周(8/22–8/24)AI 圈表面"平静",实则暗流涌动:Agent 基础设施迎来范式级变化——harness 设计取代模型本身成为主要优化面,持久化/自修改 Agent 从概念走向开源实现,MCP 补上企业级认证的最后一块拼图,Qwen3.8-27B 继续以小博大。以下是当日最重要的 10 个事件。

1. Headlong 开源:持久化 Agent 首次实现 48 分钟无人值守自修复

@andykonwinski 发布 Headlong——一个面向"持续思考"的持久化 Agent 的开源"微框架"(microharness)。与传统的"响应式"harness 不同,Headlong 的 Agent 永不休眠,会在外部交互之间持续生成内在思维流,自己设定兴趣和优先级,甚至主动 ping 用户汇报进展。整个框架用不到 1 万行 Bash 实现,轨迹以 jsonl 文件的 DAG 形式存储。最具代表性的是:某晚无人交互时,Agent 自己回头检查一个它早前构建的 recall 流程是否真正接入"大脑",发现没有,随即自主诊断、修复并端到端验证,全程 48 分钟、无任何人类介入。

Introducing Headlong, an open source microharness for persistent agents: self-guided agents that think continuously... A Headlong agent is never asleep. It keeps generating thoughts about whatever it decides is interesting, in a self-guided loop inspired by human inner monologue.
— @andykonwinski

推出 Headlong,一个面向持久化 Agent 的开源微框架:能够持续思考的自引导 Agent……Headlong Agent 从不休眠,它在一个受人类内心独白启发的自引导循环里持续生成关于任何它认为有趣事物的思考。

代价同样被坦诚写出:后台思考成本约 $1–$2/小时,Agent 曾三次意外停掉自己的服务,自我委托在第一天就失败了。这是 Laude Institute 与 MIT 的合作项目。与之呼应,@omarsar0 介绍了 exo——一个面向递归自我改进的 harness 架构,采用 append-only 事件日志、可替换执行器和支持快照/回滚的沙箱,专门设计成让 Agent 可以改写 prompt/工具/记忆却无法破坏持久状态。两者共同指向:下一代 Agent 基础设施的关键词是持久性、分叉、回滚与持续运行,而不再只是更好的提示词。

2. Harness 设计成为主要优化面:NVIDIA 提出"Skill Lift"取代结构扫描

多篇帖子汇聚到同一个判断:Agent 质量越来越多地由 harness 而非基座模型决定。NVIDIA 的新评估工作发现,对 Agent "技能"做结构检查几乎无法预测其实际有用性——扫描分数与判定质量的 Spearman 相关系数仅为 ρ = 0.14。因此提出用 "Skill Lift" 代替:在相同模型、沙箱、工作区和评分器下,把同一任务分别"加载技能"与"不加载技能"各跑一遍,度量完成工作量的差值。

NVIDIA measured whether that gate predicts anything. Across 145 real skills from internal and public catalogs, structural scan scores correlate with LLM-judge quality at a Spearman rho of 0.14. ACES proposes Skill Lift instead... run the same task twice under the same model, sandbox, workspace, and scorer, once with the skill loaded and once without.
— @omarsar0

NVIDIA 度量了那个审查门槛是否能预测任何东西。在来自内部与公开目录的 145 个真实技能上,结构扫描分数与 LLM 评审质量的 Spearman 相关系数仅为 0.14。ACES 于是提出 Skill Lift……在相同模型、沙箱、工作区和评分器下把同一任务跑两遍,一次加载技能、一次不加载。

该研究在 947 个配对样本(58 个生产技能、四个 harness)上做了归一化,跨 harness 对比轨迹。与之并列的还有一篇关于"Anthropic 风格 harness"的立场论文,主张企业应标准化到单一可复用的编码 Agent harness,而不是各自搭建编排图,并称 harness 选择在企业级任务上可能比模型选择更重要。

3. Anthropic 推出 MCP 连接器企业级认证,补齐企业部署缺口

Anthropic 宣布 MCP 连接器的企业托管认证(enterprise-managed auth)正式 GA。对 Claude Team 和 Enterprise 管理员来说,授权通过组织的身份提供商(IdP)集中完成;对最终用户来说,工具和数据自动连接,无需再对 Asana、Atlassian、Canva、Datadog、Figma、Notion、Slack、Supabase 等连接器逐个做 OAuth。

Enterprise-managed auth for MCP connectors is now generally available. For Claude Team and Enterprise admins, authorization is centralized through your identity provider. For users, tools and data are connected automatically, without the need for individual OAuth.
— @ClaudeDevs

MCP 连接器的企业托管认证现已正式可用。对 Claude Team 和 Enterprise 管理员而言,授权通过你的身份提供商集中完成。对用户而言,工具与数据自动连接,无需逐个进行 OAuth。

与此同时,MCP 路线图 预告了即将支持的长时运行任务(流式/服务端推送)、本地服务器的 HTTP、大型目录的渐进式发现,以及标准身份与委托权限。这弥合了"玩具 demo"与"可审计的企业部署"之间的关键鸿沟,是当日对生产级 Agent 部署影响最直接的平台更新之一。

4. Qwen3.8-27B 挤进 Code Arena WebDev 前 10,同尺寸唯一

在 Code Arena: WebDev 榜单中,Qwen3.8-27B1595 分位列总榜 #9,是其尺寸级别里唯一进入前 10 的模型,仅比大得多的 Qwen3.8-Max 落后 6 个名次,并重塑了 Pareto 前沿。作为参照,4 月发布的 Gemma 4-31B 仅排在第 80 位。

Qwen3.8-27B by @Alibaba_Qwen just landed in Code Arena: WebDev at #9 overall with 1595 pts. It is the only model in its size class in the top 10, and also reshapes the Pareto Frontier! It is only 6 ranks behind the much larger Qwen3.8-Max.
— @arena

@Alibaba_Qwen 的 Qwen3.8-27B 刚刚以 1595 分登上 Code Arena: WebDev 总榜第 9。它是同尺寸级别中唯一进入前 10 的模型,并且重塑了 Pareto 前沿!它仅比大得多的 Qwen3.8-Max 落后 6 个名次。

它在消费产品、品牌/营销、游戏等品类也排名靠前。一个相关的开源衍生模型 Carnice-V3-27B@kaiostephens 发布:一个 27B 的 Qwen 基座、Hermes-agent SFT 模型,面向消费级 GPU(3090+),提供合并 BF16 与 GGUF 变体。Reddit 上的大量实测也印证了 harness 决定论:同样的 Qwen3.8-27B 在 VS Code Copilot 下黑屏失败,换成带截图反馈的 agentic harness 后却能生成可用的海洋渲染甚至临时写了一个 PNG 解码器。

5. OpenAI 推出 GPT-5.6 并大幅降价 Sol,与 Anthropic 定位持续博弈

OpenAI 开发者宣布 GPT-5.6 已在 Kiro 可用,并与 AWS 合作优化性价比:在 Terminal-Bench 2.1 上,GPT-5.6 Terra 在 Kiro 的 spec 驱动开发环境中实现了每成功任务约 82% 的成本下降

We worked with @AWSCloud to optimize Kiro and GPT-5.6 for stronger price-performance. On Terminal-Bench 2.1, GPT-5.6 Terra delivered an ~82% cost reduction per successful task when run in Kiro's spec-driven development environment.
— @OpenAIDevs

我们与 @AWSCloud 合作优化了 Kiro 与 GPT-5.6 的性价比。在 Terminal-Bench 2.1 上,GPT-5.6 Terra 在 Kiro 的 spec 驱动开发环境中实现了每成功任务约 82% 的成本下降。

同时 OpenAI 将 GPT-5.6 Sol API 价格下调至 $4/M 输入、$20/M 输出 token,Arena 更新显示 Sol 与 Luna 正在推移成本/性能的 Pareto 前沿。Anthropic 一侧,@tenobrus 指出已有超过六个月没有明确的 Opus 线升级,尽管外部测试者报告新的 Claude 变体在中等推理任务上表现更强。两家前沿实验室的定位与定价战仍在持续。

6. 未发布模型传闻潮:claude-melon-eap、Ox Alpha、GPT Astra

本周关于未发布前沿模型的传闻明显升温。被标记为 "claude-melon-eap""claude-marshmallow-eap" 的 EAP 模型据称强调 3D/RL 类任务并使用大量思考 token(演示);@kimmonismus 收集了新 Claude 模型、Ox AlphaQwen 4 与已确认的 GPT Astra 的迹象;@eliebakouch 则声称能访问一个仍在训练中的模型(有公开的 W&B run)。大多数内容应被视为生态信号而非已核实规格,但值得注意的是,讨论重心已从公开发布转向预发布访问的不对称@michael_nielsen 也警告:控制未发布模型的访问权正成为权力集中的来源。

7. sPTC:把工具调用做成"投机执行",推理提速 1.0–1.2×

@a1zhang 提出投机式程序化工具调用(Speculative Programmatic Tool Calling, sPTC):在代码生成过程中预测安全的工具调用,并在环境副本中提前启动执行,使其与 token 生成和 REPL 执行时间重叠。

Introducing Speculative Programmatic Tool Calling (sPTC)! A general class of technique for speculating on tool calls during code generation in a harness and queuing them early to overlap with token generation + REPL execution time.
— @a1zhang

推出投机式程序化工具调用(sPTC)!这是一类通用技术,在 harness 中的代码生成阶段投机工具调用并提前排队,使其与 token 生成和 REPL 执行时间重叠。

目前报告的性能提升还比较温和——约 1.0–1.2×——但机制本身更重要:它把优化焦点从 token 级解码技巧转向了 Agent 工作流流水线化@lateinteraction 将其类比为 CPU 的投机执行,强调只要大多数猜测正确,丢弃部分工作是值得的。

8. 成本归一化基准重塑模型选择:GLM-5.3 与 GPT-5.6 Sol Max 领跑

Together AI 报告,在 $100 预算下,GLM-5.3 在 DeepSWE 上完成的工作量是 Fable 55 倍——约 17 个 vs 3 个已解决任务,尽管二者首次尝试的表现相近(推文)。@reach_vb 同样报告 GPT-5.6 Sol Max 在 DeepSWE v1.1 上达 72.7%、每任务 $6.47,而 Fable 5 Max69.7%、每任务 $21.63。Cline 还对比了 Ox Alpha vs Fable 的真实 bugfix:两者都能解决,但 Ox 的输出 token 少了约 3 倍,暗示其在"重新验证 vs 依赖首个结论"上有着明显不同的后训练哲学(对比)。成本正在成为与绝对分数同等重要的选型维度。

9. Liquid AI 与 Artificial Analysis 联手推出端侧基准 Pipette

@liquidai 发布 Pipette,一个开源端侧推理评估套件,在"模型 + 量化 + 运行时 + 设备"组合上度量质量、速度、延迟与内存,已积累 1 万+ 条验证结果,覆盖 35 个模型类别7 种量化、llama.cpp 运行时与四款设备。Artificial Analysis 在 iPhone 17 ProGalaxy S26 Ultra 上配以独立的手机级智能评测。在 8GB 内存 / 16K 上下文框架下,Nanbeige4.2-3BLFM2.5-2.6B 以平均分 63 领跑,其中 LFM2.5-2.6B 在 iPhone 上更高效(8.0s、2.3GB),而 Nanbeige 需 21.4s、4.0GB。MoE 设计(如 LFM2.5-8B-A1B、Ling 3.0 Tiny)因每 token 仅激活约 1B 参数,能在手机上实现 6 秒内响应。评测明确指出:许多"聪明"的推理模型与移动端的内存/延迟约束并不匹配。

10. 推理厂商转向 Agent 吞吐竞争:Groq 3 LPX 与 vLLM AgentX 1.0

推理基础设施的竞争焦点正从原始 TPS 转向 Agent 专属吞吐。NVIDIA 的 Groq 3 LPX 被描述为给 Vera Rubin 增加了专用 token 生成加速器,在 Artificial Analysis 基准中宣称 Gemma 4 31B100K 上下文下可达 3,400 output tokens/s总结);Groq 表示将成为首批生产部署者(公告)。另一侧,vLLM 发布了 AgentX 1.0 在真实多轮编码轨迹上的大量结果,强调 KV offload前缀复用prefill/decode 解耦才是高 Agentic 吞吐的关键,而非经典单轮服务指标(@vllm_project)。


其他值得关注:Meta/USC 的 Periodic Row-wise Muon 把 Muon 优化扩展到更大的扩散 transformer;Adobe 的 Latent Dynamics Reasoning 从像素学习可外推的视频世界模型;Cartwheel 报告了人体运动生成的 compute-optimal 缩放定律,主张运动可能成为第五模态。社区层面,Reddit 上"36 节点 DGX Spark 集群"、"$800 矿卡魔改成 64GB 推理服务器"、"Xiaomi AI Cube 1.2TB/s 带宽"等本地硬件帖子热度极高,反映出端侧与自托管 AI 计算的持续升温。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!