SDD规范驱动+Harness驾驭工程AI全栈开发
从科技视角看“SDD+Harness”课程:当AI编程从“调提示词”转向“建系统”
2026年AI工程领域最值得关注的技术事件,不是某个新模型的发布,而是两个工程概念的快速收敛与融合:SDD(规范驱动开发)与Harness Engineering(驾驭工程)。从命名到定义到框架,不到一个月时间,Mitchell Hashimoto、OpenAI、Martin Fowler完成了这场“从概念到共识”的建构-10。而这套课程试图传授的,正是这两个概念组合后形成的完整技术范式。
SDD的技术定位:把“意图”编译为机器可执行的契约
SDD的核心理念可以用一句话概括:规范是主要工件,代码服务于规范-12。传统开发中,PRD和设计文档服务于代码,往往在上线前就已过期;SDD颠覆了这个权力结构,将规范从“人类沟通的辅助材料”升级为“AI生成代码的唯一可靠依据”。
一套合格的SDD规范需要覆盖六个维度:功能标识与描述、输入契约、输出契约、正常流程、异常分支、以及可测试的验收标准-4。这些要素的共同特征是:它们必须是“可被机器解析的”——OpenAPI定义接口契约,Gherkin定义验收场景,JSON Schema定义数据格式。SDD的四阶段工作流——Specify→Plan→Tasks→Implement——本质上是一条“从自然语言意图到结构化规范,再到可执行代码”的编译管线-12。
从技术视角看,SDD解决的是AI编程中最根本的“意图失真”问题。当开发者只给一句模糊的需求(“加个白名单删除”),AI会基于自己的理解“自由发挥”,生成的代码与真实意图之间的偏差在集成阶段才会暴露-7。SDD通过将意图前置固化为契约,让AI“按图施工”而非“凭感觉创作”。
Harness的技术架构:Agent = Model + Harness的工程化落地
如果SDD是“图纸”,Harness就是“图纸+监理+验收+返修制度的整套工地管理系统”-
知乎。2026年2月,Mitchell Hashimoto给出的操作性定义极为精炼:“每当你发现Agent犯了一个错误,你就花时间设计一个方案,让它永远不再犯同样的错误。”-2-10这个定义把Harness Engineering从“系统设计”具体化为“持续迭代的错误处理闭环”。
Harness的技术架构在2026年迅速收敛为六层模型:上下文管理层解决“模型此刻该看到什么”,工具与执行层定义“Agent能做什么”,编排与规划层处理“多步任务如何串起来”,状态与记忆层维护“跨会话的连贯性”,评估与观测层回答“Agent如何知道自己做对了没有”,约束恢复层处理“出错时怎么办”-2-18。这六层的组合逻辑可以用一句话概括:模型决定Agent的智商上限,Harness决定Agent的交付下限-18。
一个被反复引用的实验数据印证了Harness的技术分量:LangChain的coding agent在TerminalBench 2.0上的得分从52.8%跃升至66.5%,排名从三十名开外进入全球前五——模型一行没换,改变的只是包裹模型的那套系统-1-14。同一个模型,仅改变Harness设计,编码基准测试分数可从6.7%跃升至68.3%-2。这意味着,在AI编程领域,“模型能力”正在从差异化因素退化为“商品化基础设施”,而Harness的设计质量成为决定Agent实际交付能力的核心变量。
SDD与Harness的技术关系:包含而非并列
理解这套课程技术逻辑的关键,是看清SDD与Harness的关系。它们不是二选一的对手,而是包含与被包含的关系:SDD是Harness前馈层(Feed Forward)的深度实践。Harness的“前馈”部分负责在代码生成前约束Agent的行为,SDD做的是把这个前馈约束做到“施工级精度”——Specify阶段的用户故事和验收标准,Design阶段的技术方案,Tasks阶段的任务拆解,都是对Agent“什么该做、什么不该做、做到什么程度算对”的前置定义-1。
Harness的“反馈”部分则负责在代码生成后验证和纠正:Linter检查代码规范,测试验证行为正确性,CI流水线执行“规范熔断”,可观测性系统监控生产环境的行为偏差。SDD负责“把话说清楚”,Harness的反馈层负责“把做错的事抓出来”-2-9。
这套课程的技术价值,在于它同时覆盖了“前馈”和“反馈”两端:从Spec编写、规范审查机制,到多Agent编排、质量门禁、可观测性集成。学习者需要理解的不只是“怎么写一份好的Spec”,还有“当AI生成结果偏离Spec时,系统如何自动检测、如何回退、如何重新生成”-13。
技术边界与现实约束
需要清醒认识的是,SDD+Harness目前仍是一个“实践先于理论”的领域。SDD的落地经验显示,第一个月单接口端到端耗时不降反升(比手写多30%),第三个月才降到-40%——前两个月是爬坡期,第6周是大多数人想放弃的节点-16。这个“J曲线”效应的技术含义是:SDD的前置思考成本是真实存在的,收益需要等到规范资产积累到一定规模、反馈回路稳定运行之后才会显现。
Harness的六层架构中,目前实践最成熟的是上下文管理和工具执行,而“评估与观测层”和“约束恢复层”的建设难度最高。当Agent在长链路任务中偏离规范时,如何检测偏差、如何定位原因、如何设计回退策略——这些问题的答案,目前更多来自一线团队的踩坑经验,而非标准化的工程方法论-7。
SDD+Harness课程所代表的技术范式,本质上是在回答一个根本性问题:当AI的代码生成能力已经“够用”时,如何让这种能力变得“可靠”。它的答案不是等待更强大的模型,而是在模型之外构建一套完整的约束、验证、纠正系统。这套系统能否成功,取决于学习者是否理解一个反直觉的事实:AI编程的瓶颈从来不在“写代码”本身,而在“确保写出来的代码是对的”。Harness工程化的每一个模块——上下文管理、工具沙箱、评估观测、约束恢复——都是在为这个目标服务。
本作品采用《CC 协议》,转载必须注明作者和本文链接

关于 LearnKu
推荐文章: