Harness技术栈
原文链接:https://mp.weixin.qq.com/s/ITlSrC_tQtqMnnGbfVDofw?version=5.0.9.70699&platform=mac
Harness满天飞,多少人工多少智能。
在“三类智能体Agent”里面提到智能体成为新的工程框架。 在“企业大模型数智化难点”提到Prompt, Rag,Agent技术都有局限性。2026年Harness提出,在传统Agent基础上提出,希望全面模仿人的经验行为来完成工作。
一、快速升级


有人认为,你看AI发展太快了, 一会儿Prompt和RAG全失效了。 这种看法很不对。 Prompt升级到Skills了, RAG升级到Memory和Context了。而不具备之前的经历,想一步升级, 其实没那么容易!
二、新一代软件架构初现
至此, 新的软件开发模式就全面升级到Harness之上的应用框架。 Agent应用又进入细分组装了, 模型层, 工具层, 知识数据层, 记忆存储层, 智能体调度层, 应用接口层。

7层智能体架构:

而,具体到什么是Harness就又难以对齐了, 大体Contex, Tool,Memory是在里面的。

、



知名的Claude Code / Codex, OpenClaw等这些工具都可以纳入Harness框架。


三、开发栈大爆炸
正是看到了这种细分赛道, 各种细分能力的产品会海水般涌出来, 但是正在能坚持迭代优化的成功产品,就会大浪淘沙。
- 知名基础组件

- 知名工具流程库

- 知名应用智能体

例如:




例如, 要开发一个research agent, 每层使用什么基础库, 最后的难点和卡点在哪里?

基于评价和评测的飞轮迭代该如何做?

四、应用技术能力中心迁移
Harness 时代基本回到多少人工多少智能了, 目前这些人工还不仅仅在数据准备上, 更多是快速跑起数据迭代飞轮。

前面,我们看到Harness至少有七层, 那么如果应用的工作流也是很多步骤进行拆解的, 即便每一步的准确率是80%, 经过10步以后,也只有10%的准确率。

- 谁能快速打造应用智能体?
除了前面的技术栈和各种组件, 最重要的需要了解,Harness各个层次解决的问题。 例如, 7层智能体开发框架下知名组件用的熟不熟?

2. 谁能应用智能体包括哪些设计范畴
譬如, 工具的使用需要考虑对接协议,调用准确率,工具调用准确率改进, 工具扩展性和多进程冲突等等多方面的思考范畴。

上下文需要考虑短期工具上下文, 中期对话Session上下文,长期任务上下文, 远期收益上下文, 以及上下文飘逸等概念范畴。

调度管理需要考虑是内部循环, 还是跨智能体循环, 还是端到端的任务循环。


在可见性和可靠性上, 需要任务失败可见, 成本可见, 智能体调度可见, 可靠性可见等。

在测试评价上,需要知道Benchmark如何建设, 对照实验如何做, 分段评价如何实现, 错误归因如何做, 反馈如何收集,可用性如何评价等。

在环境和安全上, 需要面向主流任务进行设计, 例如编码, 浏览器, 操作系统使用等等。

- 谁能解决具体问题?
在不同的技术栈框架下, 和不同的概念范畴下, 当出现了具体的Skill调度, 记忆失效, 工具受限, 提示词不稳定等等具体问题, 该如何定位问题, 如何切换目标,如何解决BUG?

- 谁能看清各阶段的问题?
每个阶段都存在潜在的问题, 在架构设计上,可以进行改进, 但是改进的依据得来自各阶段问题的掌握。 仅仅知道最终的效果是远远不够的, 如何进行阶段拆解, 并能在各个阶段定位问题才是真的有水平!

- 谁能建成数据飞轮?


五. 智能体工程的六大原则
- 你只知道局部地图和方向,但是不知道详细步骤
你需要建设渐进式披露来提供上下文,并在开始实现之前,要求制定一份详细的执行协议风格规范。
- 代码之前先有架构约束和规范说明
你需要知道最佳实践方向,知道哪些泥潭是不能进入的, 然后再开始代码,才能保障后续的迭代。没有方向的试错, 会让后期的迭代和修改成本无法承受。 而每次需要重新开发,就失去之前积累的丰富经验和时间成本。
- 把测试当成护栏
你需要坚定的使用 TDD(测试驱动开发)来提供验证信号,来保障你的开发是面向可交付成果的。
- 用钩子(hooks) 来保障强制执行
提示词(prompts)无法约束的规则的时候, 快速变化到使用确定性的钩子(hooks)来强制实现。 不要浪费大量时间!
- 使用LLM-as-a-Judge/Agent-as-a-Judge来审计每个步骤
尽量使用独立的模型来捕获每个重点步骤的架构错误,能够快速定位最重要的错误步骤,并做出改进
- 失败案例迭代,实现飞轮
至少保障,每一次失败都能转化为持久的测试套件技能(TDD harness skill)。
小结
Harness可能是AGI组织管理AI“AGI之路”在Agent之上的早期探索, AGI之路并非线性步骤去实现的, 而且并行在跑步前进。 但是当前的所有Harness还是围绕着多少人工多少智能的步骤在积累。 这个离AlphaGO开创的Alpha时代差距很多。 大模型在2025年互联网数据用尽之后,正是进入了Alpha Zero时代。 相信Harness也会进入这一步。

当前,很多学者在探索包括Meta-Harness, 来建设Harness的评价闭环。

也有SLM的小模型来完成任务级的微调闭环, 这个闭环可以把在线服务也融合进去。 或许可以借鉴到Harness开发闭环中去。

也有针对Code Harness来把Harness控制编程文本指令,进行任务迭代, 如果加上强化学习进行类小模型微调,也很前瞻。

参考:
1. https://www.preprints.org/manuscript/202604.0428/v1
2. https://arxiv.org/pdf/2605.23572
3. https://picrew.github.io/LLM-Harness/
4. https://arxiv.org/pdf/2604.08224
5. https://arxiv.org/pdf/2603.28052
6. https://arxiv.org/pdf/2603.25723
💬 本文评论区已开启,但暂无读者留言。
本文转载自微信公众号,如有侵权请联系删除。
- 标题: Harness技术栈
- 作者: lxiol
- 创建于 : 2026-07-10 16:26:36
- 更新于 : 2026-07-10 16:26:36
- 链接: https://blog.lxiol.cn/2026/07/10/Harness技术栈/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。