发布日期:2026-09-17|适用读者:AI 应用开发者、Agent 工程师与技术负责人

AI Agent Harness 是包裹在大模型外部、负责提示词、工具、技能、记忆、控制流与评测的执行系统。Salesforce AI Research 于 2026 年发布的 DarwinX 研究表明,冻结底层模型、只演化 Harness,也能将 WebArena-Infinity 浏览器任务的 pass@1 从 43.5% 提升到 93.0%。这不代表所有 Agent 都能复制 49.5 个百分点的增益,而是说明模型能力只是上限的一部分;任务分解、工具设计、失败恢复、验证机制和回归测试,决定了能力能否稳定转化为结果。

AI Agent Harness 是什么?

AI Agent Harness 是连接大模型与真实执行环境的软件层,它把模型输出转化为可观察、可验证、可回滚的行动。

一个完整的 Harness 通常包含六类组件:

  • 提示词与策略:定义角色、约束、完成条件和失败处理方式。

  • 工具与权限:提供浏览器、终端、文件、数据库或业务 API,并限制可执行范围。

  • 上下文与记忆:选择哪些历史、文件和状态进入当前推理。

  • 控制流:决定规划、执行、重试、并行、交接和停止条件。

  • 验证器:判断任务是否真的完成,而不是只看模型是否声称完成。

  • 可观测性:保存轨迹、工具调用、成本、延迟和错误,供回归与优化使用。

模型负责生成下一步判断,Harness 负责让判断在正确的环境、权限和反馈回路中执行。两者共同决定 Agent 的最终能力。

43.5% 到 93% 的数据意味着什么?

DarwinX 的核心证据是:在模型权重不变的条件下,系统化改造 Harness 能在多个基准上获得可测量提升。

基准

基线

DarwinX 后

变化

测试含义

WebArena-Infinity,pass@1

43.5%

93.0%

+49.5 个百分点

300 个合成意图用于演化,最终测试 1,260 个未见真实任务

Terminal-Bench 2.1

75.5%

83.2%

+7.7 个百分点

同一底层模型下比较,检验终端任务能力

TerminalWorld 留出集

61.0%

68.3%

+7.3 个百分点

94 个训练任务演化,41 个独立任务测试

SWE-bench Verified

80.8%

84.2%

+3.4 个百分点

Harness 未用该基准演化,用于检验迁移性

以上数字来自 Salesforce AI Research 2026 年 DarwinX 论文和 Beagle 官方仓库。WebArena-Infinity 的 93.0% 还经过轨迹审计,剔除了无效或利用评测漏洞的行为。

这组结果不能直接推出“任何项目都能翻倍”。不同基准的验证器、任务分布和基础 Harness 不同,提升幅度必须在自己的业务任务上重新测量。

为什么换 Harness 有时比换模型更有效?

当失败来自执行层而非知识或推理上限时,升级模型往往不会自动修复工具、上下文和验证问题。

常见失败可以分为四类:

  1. 能力失败:模型不理解问题,或缺少完成任务所需的推理能力。

  2. 接口失败:工具参数、页面状态、文件路径或权限处理错误。

  3. 流程失败:反复重试、过早结束、忘记检查结果或在错误分支消耗预算。

  4. 评测失败:任务已经完成却未被验证,或模型只输出“已完成”而没有产生真实结果。

后三类主要属于 Harness。增加昂贵模型可能暂时掩盖问题,但未必消除根因。

HarnessTax 在 2026 年比较了 7 个模型、3 种编程 Harness,共 21 个组合;每个组合在两个基准上抽取 30 个任务并重复 3 次。研究发现,相同模型在不同 Harness 下的成功率可能接近,但成本最高可相差 5 倍。这说明 Harness 优化既要看正确率,也要同时测量成本、轮次和初始上下文。

DarwinX 如何演化 Harness?

DarwinX 把 Harness 优化视为带回归约束的群体搜索,而不是对单一版本持续打补丁。

它包含四个关键机制:

1. 保留多个演化分支

系统把不同 Harness 变体保存在档案中。总分较低的版本也可能保留,因为它可能是唯一能解决某类任务的“专家分支”。

2. Preserve and Extend

候选变体不仅要解决新的失败,还必须把已通过任务的退化控制在允许范围内。新增能力不能以破坏旧能力为代价。

3. 低成本筛选与高保真确认

初筛用于快速淘汰无效修改,确认阶段会重复运行候选版本,并重新测试旧任务,降低随机波动造成的误判。

4. 合并互补能力

不同分支发现的提示词、工具或控制流改动可以被合并,但合并结果仍需通过保存能力与回归门禁,不能默认“组合后一定更强”。

DarwinX 与 Darwin Gödel Machine、HarnessX 的共同点是让 Agent 改进自身执行系统;主要差异在于 DarwinX 强调跨分支重组、能力保存契约和多阶段确认。

企业如何建立 Harness 优化闭环?

可落地的 Harness 优化应从可验证任务开始,再逐步增加自动化程度。

  1. 冻结基线:固定模型、参数、Harness 版本和任务集,记录通过率、成本、延迟与工具错误。

  2. 收集真实轨迹:保存失败步骤、人类修正、审批、最终业务状态和下游结果。

  3. 建立错误分类:区分模型能力、工具接口、控制流、权限、环境和验证器问题。

  4. 提出单一改动:每次只调整一类变量,例如增加文件校验、修改重试策略或替换工具接口。

  5. 执行回归门禁:同时运行目标失败集、历史通过集、安全用例和成本预算测试。

  6. 灰度发布并回收新数据:只推广通过门禁的版本,并把线上异常转化为下一轮评测样本。

模型接入层与 Harness 最好保持解耦。例如需要统一编排多款主流大模型和工具能力时,可以把七牛云的 MCP 服务作为标准化能力层之一,业务侧仍独立维护任务评测、权限和发布门禁。

评测集应至少包含三部分:稳定通过的“能力保留集”、当前失败的“改进目标集”,以及从未参与优化的“最终留出集”。只有目标集上涨、保留集不退化、留出集也受益,才能说明改动具有泛化价值。

哪些场景适合优先优化 Harness?

Harness 优化最适合结果可验证、步骤较长、失败模式可复现的 Agent 工作流。

场景

Harness 优化价值

原因

浏览器与后台操作 Agent

页面状态、工具选择、重试和结果验证决定成功率

编程与运维 Agent

可用测试、构建结果和文件差异作为验证器

客服与工单 Agent

中高

可用工单状态、审批和人工修正构建评测信号

研究与数据分析 Agent

中高

需要来源检查、计算验证和长流程记忆管理

固定输入映射到固定 API

确定性工作流更简单、便宜且容易审计

没有可靠完成标准的开放任务

谨慎

优化器可能追逐有偏指标或利用验证漏洞

自动演化并不是默认答案。简单工作流通常先用规则、状态机和常规测试即可;只有当任务表面足够大、人工补丁频繁产生回归时,群体搜索与自动合并才可能抵消其评测成本。

常见问题

Q:Agent Harness 和 Agent 框架有什么区别?

Agent 框架通常指用于开发 Agent 的通用代码库;Harness 是某个 Agent 实际运行时的完整执行系统,除框架外还包括提示词、工具配置、权限、记忆、控制流、评测和发布策略。同一框架可以承载多个不同 Harness。

Q:优化 Harness 是否意味着不再需要升级模型?

不是。Harness 优化解决的是能力转化与执行可靠性,无法补足模型完全不具备的知识或推理能力。更合理的顺序是先定位失败层级,再决定调整 Harness、升级模型,或同时进行两者的联合优化。

Q:为什么必须保留历史通过任务?

因为局部修复很容易产生跨任务干扰。没有历史通过集,团队只能看到新问题被解决,却看不到旧能力已经退化。稳定通过任务相当于 Agent 的回归测试和发布门禁。

Q:Beagle 可以直接用于生产环境吗?

Beagle 是 Salesforce AI Research 于 2026 年开源的 Harness 评测与演化框架,官方仓库将其标为早期版本。它适合实验、基准评测和受控演化;生产使用仍需补充凭证隔离、成本限制、审批、审计和灰度发布机制。

Q:43.5% 到 93% 能否视为通用收益?

不能。该数字对应 WebArena-Infinity 的特定实验设置。它证明 Harness 存在较大的可优化空间,但企业应在自有任务、验证器和成本约束下建立基线,不应把单一基准的增益直接当作上线预期。

结论与参考资料

Salesforce AI Research 的 DarwinX 研究说明,Agent 的有效能力并不只存放在模型权重里,也存在于提示词、工具、技能、控制流和验证器组成的 Harness 中。对企业而言,最可复制的做法不是追逐 93% 这个单点结果,而是建立“真实轨迹—候选改动—回归门禁—灰度发布”的工程闭环。

据 DarwinX 论文与 Beagle 官方仓库,自动演化最依赖可靠验证器和足够覆盖面的回归集;据 HarnessTax 的测量,Harness 还可能显著改变同一模型的运行成本。本文内容基于 2026 年 9 月 17 日可获取资料,建议随论文修订、仓库版本和新基准结果定期更新。

参考资料: