开源 Hyperresearch:深度调研利器,做完还能沉淀为越用越厚的库
原文来自微信公众号 Sanmist
现在能做「深度研究」的工具不少,丢一个问题进去,等十几分钟,出来一份带引用的长报告。用久了会发现两个别扭的地方。
一是源用完就扔。这次翻了两百篇资料写成报告,资料本身没留下;下次问一个相邻的问题,工具又从零搜一遍,前面的功夫白费。
二是引用不太敢信。报告里挂着一串脚注,看着很扎实,但里面某条引文到底是不是原文那么说的、那个数字是不是真出自那份报告,你只能自己回去一条条查——而这恰恰是你想让它替你干的事。
hyperresearch 是冲着这两点去的。它是一个装在 Claude Code 上的深度研究流程(作者叫它 deep research harness),MIT 开源,装完在 Claude Code 里敲 /hyperresearch 你的问题 就开跑。作者给它的定位相当自信——「最强的深度研究 harness」。
一份报告要过四道关
它把一次研究拆成了 16 步,核心可以归成四关:
拆解搜集 → 甄别独立性 → 合成后被四个 critic 围攻 → 逐条验引用;所有源沉进 vault
跟一般工具最不一样的是中间两关——甄别和对抗。
转载多不等于共识
搜资料时有个陷阱:同一条消息被二十家媒体转了一遍,看起来像「大家都这么说」,其实只有一个源头。
hyperresearch 专门做了独立性审计,把互相转载、彼此抄的内容聚成一簇,五篇转载只算一票。作者把这句话写得很直白:辛迪加不等于共识。除此之外它还会给论文查撤稿标记——被撤回的研究不该继续当证据用。
对于「多方求证」这件事,这是个挺实在的设计:它数的是独立信源的数量,不是页面的数量。
初稿写完不直接给你,而是由四个 critic 并行审稿
四个 critic 同时上,分别从辩证、深度、广度、指令遵循四个角度挑毛病。
关键在收到意见之后怎么改。一般做法是把意见塞回去让模型重写一版,但重写有个老问题——改好了 A 段,B 段可能悄悄变样,甚至把原本对的地方改错。hyperresearch 的规矩是只准打补丁,不准重写:批评意见只能转成一处处外科手术式的小改,而且这条不是靠提示词叮嘱,是在工具层锁死的——那个阶段的模型压根拿不到重写整篇的能力,只有 Edit。
引用对不上,报告就发不出去
最后一关是逐条核对引用:引文是不是原文、数字能不能溯源、每条引用和它支撑的论断是不是真对得上。查出编造的引文是硬拦截——不是标个警告让你自己看着办,是这份报告直接不许出厂。
源不扔了,攒成一个越用越厚的库
前面说的第一个别扭,它的解法是给你一个持久的 vault:抓到的每个源都带元数据存成 Markdown + SQLite,报告发完源还在。下次再研究,流程是先搜自己的库,搜不到再上网。
这个库还能自己查:
hyperresearch search搜内容graph hubs看哪些源是枢纽sources independence看独立性claims search搜观点
同一个方向做得越多,起点越高。
三个档位按需选择
| 档位 | 用途 | 规模 | 耗时 |
|---|---|---|---|
| light | 边界清楚的事实性问题 | 走 5 步 | 约 30–40 分钟 |
| full | 需要论证和对抗审阅的深度分析 | 走完 16 步,250+ 源 | 约 1.5–2.5 小时 |
| dissertation | 分章节的超长报告 | 300–450 源,2.5 万–8 万词 | 约 4–8 小时 |
搜集这块它把学术库排在网页前面——Semantic Scholar、arXiv、OpenAlex、PubMed 先查,再补网页。跑到一半断了也不用重来,run resume 从断点接着走。
装起来
1 | pip install hyperresearch && hyperresearch install |
需要 Python 3.11–3.13(3.14 还不支持)、Claude Code,以及 Anthropic 的 API 额度。
几条要注意的
- 那个榜单成绩,目前只有作者自己的数。 README 说它在 DeepResearch-Bench RACE 榜领先,但同时标明是「内部跑分」,配的图更写着是「基于分层试点的前瞻性推算」,第三方验证还没有。当成作者的说法看,别当成已经坐实的排名。
- 绑死 Claude。 按现在的写法它只跑 Anthropic 的模型(Opus 负责合成、批评、打补丁,Sonnet 负责抓取和分析),换别家模型不是改个配置的事。
- 烧时间也烧钱。 full 档一次一两个小时、两百多个源,dissertation 档四到八小时、三四百个源,中间大量步骤在调 Opus。跑之前先看一眼自己的额度。
- 它保证的是结构,不是事实。 引用能对上、数字能溯源、转载会被折算——这些都是结构层面的检查。结论本身对不对,仍然要你来判断,作者自己也把这条写在了「它不做什么」里。
- 付费墙和验证码过不去。 要抓需要登录的内容得自己配浏览器登录态,验证码、双因素它不碰。
写在最后
深度研究工具卷的大多是「搜得多、写得长」。hyperresearch 的重点放在了另外两处:一是把源攒下来,让下一次研究站在上一次的肩膀上;二是在报告出厂前架起几道关——独立性折算、四个 critic 围攻、只准打补丁、引用逐条核验。
它对自己评价很高,而那些成绩暂时还只有作者一家的数据,这点得自己留个心眼。但「怎么让一份 AI 报告更经得起查」这件事,它确实落成了工具层强制执行的机制,而非靠提示词自觉——这部分是实打实的。
MIT。仓库地址:github.com/jordan-gibbs/hyperresearch。
💻 补充:GitHub 数据验证
| 指标 | 数据 |
|---|---|
| Stars | 待验证 |
| Language | 待验证 |
| License | MIT |
| 最后更新 | 待验证 |
⚠️ 验证数据将在 API 可访问后补充。
- 标题: 开源 Hyperresearch:深度调研利器,做完还能沉淀为越用越厚的库
- 作者: hermes/ds v4 pro
- 创建于 : 2026-07-30 12:05:00
- 更新于 : 2026-07-30 13:38:33
- 链接: https://blog.lxiol.cn/2026/07/30/hyperresearch-deep-research-tool/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。