Harness技术栈

lxiol
📝
Harness满天飞,多少人工多少智能。

原文链接:https://mp.weixin.qq.com/s/ITlSrC_tQtqMnnGbfVDofw?version=5.0.9.70699&platform=mac

Harness满天飞,多少人工多少智能。

在“三类智能体Agent”里面提到智能体成为新的工程框架。 在“企业大模型数智化难点”提到Prompt, Rag,Agent技术都有局限性。2026年Harness提出,在传统Agent基础上提出,希望全面模仿人的经验行为来完成工作。

一、快速升级

有人认为,你看AI发展太快了, 一会儿Prompt和RAG全失效了。 这种看法很不对。 Prompt升级到Skills了, RAG升级到Memory和Context了。而不具备之前的经历,想一步升级, 其实没那么容易!

二、新一代软件架构初现

至此, 新的软件开发模式就全面升级到Harness之上的应用框架。 Agent应用又进入细分组装了, 模型层, 工具层, 知识数据层, 记忆存储层, 智能体调度层, 应用接口层。

7层智能体架构:

而,具体到什么是Harness就又难以对齐了, 大体Contex, Tool,Memory是在里面的。

知名的Claude Code / Codex, OpenClaw等这些工具都可以纳入Harness框架。

三、开发栈大爆炸

正是看到了这种细分赛道, 各种细分能力的产品会海水般涌出来, 但是正在能坚持迭代优化的成功产品,就会大浪淘沙。

  1. 知名基础组件

  1. 知名工具流程库

  1. 知名应用智能体

例如:

例如, 要开发一个research agent, 每层使用什么基础库, 最后的难点和卡点在哪里?

基于评价和评测的飞轮迭代该如何做?

四、应用技术能力中心迁移

Harness 时代基本回到多少人工多少智能了, 目前这些人工还不仅仅在数据准备上, 更多是快速跑起数据迭代飞轮。

前面,我们看到Harness至少有七层, 那么如果应用的工作流也是很多步骤进行拆解的, 即便每一步的准确率是80%, 经过10步以后,也只有10%的准确率。

  1. 谁能快速打造应用智能体?

除了前面的技术栈和各种组件, 最重要的需要了解,Harness各个层次解决的问题。 例如, 7层智能体开发框架下知名组件用的熟不熟?

2.  谁能应用智能体包括哪些设计范畴

譬如, 工具的使用需要考虑对接协议,调用准确率,工具调用准确率改进, 工具扩展性和多进程冲突等等多方面的思考范畴。

上下文需要考虑短期工具上下文, 中期对话Session上下文,长期任务上下文, 远期收益上下文, 以及上下文飘逸等概念范畴。

调度管理需要考虑是内部循环, 还是跨智能体循环, 还是端到端的任务循环。

在可见性和可靠性上, 需要任务失败可见, 成本可见, 智能体调度可见, 可靠性可见等。

在测试评价上,需要知道Benchmark如何建设, 对照实验如何做, 分段评价如何实现, 错误归因如何做, 反馈如何收集,可用性如何评价等。

在环境和安全上, 需要面向主流任务进行设计, 例如编码, 浏览器, 操作系统使用等等。

  1. 谁能解决具体问题?

在不同的技术栈框架下, 和不同的概念范畴下, 当出现了具体的Skill调度, 记忆失效, 工具受限, 提示词不稳定等等具体问题, 该如何定位问题, 如何切换目标,如何解决BUG?

  1. 谁能看清各阶段的问题?

每个阶段都存在潜在的问题, 在架构设计上,可以进行改进, 但是改进的依据得来自各阶段问题的掌握。  仅仅知道最终的效果是远远不够的, 如何进行阶段拆解, 并能在各个阶段定位问题才是真的有水平!

  1. 谁能建成数据飞轮?

五. 智能体工程的六大原则

  1. 你只知道局部地图和方向,但是不知道详细步骤

你需要建设渐进式披露来提供上下文,并在开始实现之前,要求制定一份详细的执行协议风格规范。

  1. 代码之前先有架构约束和规范说明

你需要知道最佳实践方向,知道哪些泥潭是不能进入的, 然后再开始代码,才能保障后续的迭代。没有方向的试错, 会让后期的迭代和修改成本无法承受。 而每次需要重新开发,就失去之前积累的丰富经验和时间成本。

  1. 把测试当成护栏

你需要坚定的使用 TDD(测试驱动开发)来提供验证信号,来保障你的开发是面向可交付成果的。

  1. 用钩子(hooks) 来保障强制执行

提示词(prompts)无法约束的规则的时候, 快速变化到使用确定性的钩子(hooks)来强制实现。 不要浪费大量时间!

  1. 使用LLM-as-a-Judge/Agent-as-a-Judge来审计每个步骤

尽量使用独立的模型来捕获每个重点步骤的架构错误,能够快速定位最重要的错误步骤,并做出改进

  1. 失败案例迭代,实现飞轮

至少保障,每一次失败都能转化为持久的测试套件技能(TDD harness skill)。

小结

Harness可能是AGI组织管理AI“AGI之路”在Agent之上的早期探索, AGI之路并非线性步骤去实现的, 而且并行在跑步前进。 但是当前的所有Harness还是围绕着多少人工多少智能的步骤在积累。  这个离AlphaGO开创的Alpha时代差距很多。 大模型在2025年互联网数据用尽之后,正是进入了Alpha Zero时代。 相信Harness也会进入这一步。

当前,很多学者在探索包括Meta-Harness, 来建设Harness的评价闭环。

也有SLM的小模型来完成任务级的微调闭环, 这个闭环可以把在线服务也融合进去。 或许可以借鉴到Harness开发闭环中去。

也有针对Code Harness来把Harness控制编程文本指令,进行任务迭代, 如果加上强化学习进行类小模型微调,也很前瞻。

参考:

1. https://www.preprints.org/manuscript/202604.0428/v1

2. https://arxiv.org/pdf/2605.23572

3. https://picrew.github.io/LLM-Harness/

4. https://arxiv.org/pdf/2604.08224

5. https://arxiv.org/pdf/2603.28052

6. https://arxiv.org/pdf/2603.25723


💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: Harness技术栈
  • 作者: lxiol
  • 创建于 : 2026-07-10 16:26:36
  • 更新于 : 2026-07-10 16:26:36
  • 链接: https://blog.lxiol.cn/2026/07/10/Harness技术栈/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
目录
Harness技术栈