又一个 Agent 上网神器,暴涨 14 万 Star。
做 AI 应用的人,基本都会遇到相同的问题。
模型训练所用到的数据有一个截止时间,而现实世界每天都在发生变化。
为了让Agent获取到最新的网页数据,一般只能自己搭建爬虫或者购买网页数据API。
前者需要解决JavaScript渲染、反爬机制、代理池、数据清洗等一系列问题。
后者的成本很高,返回的数据不能直接用于大语言模型。
最近在 GitHub 上看到一个项目,已经把这件事做成了一个标准能力。
它的名字叫做Firecrawl,在GitHub上有14.9万颗星。

用一句话概括:
它把任意网页转换成干净的 Markdown 或结构化 JSON,并通过一个 API 直接交给 AI 使用。
很多人第一次看到都会觉得:这不就是一个爬虫吗?
它所要解决的问题并不是网页抓取,而是使网页数据能够直接进入AI工作流。
先来看几个最典型的使用场景。
给RAG系统加上网页数据
很多 AI 应用都会遇到这样的问题。
比如用户问:西门子最新推出的产品是什么?

模型训练的时候不知道,但是官网已经更新了。
以前要重新写爬虫、解析网页、清洗数据,然后导入到向量数据库里。
现在只要抓取官网页面就可以得到干净的 Markdown。
直接添加到知识库里面。
批量提取商品,新闻等结构化的数据
对几个竞争者的网站进行分析。
传统的做法是为每一个网站分别编写CSS选择器、XPath或者正则表达式。
网站一旦有一点点变化,就必须要重新维护。
Firecrawl 可以直接定义出 JSON Schema。

比如商品名称、价格、评分、库存等等几个字段。
返回的结果就是标准的JSON格式。
不管网页用什么样的布局方式,也不用研究DOM结构,只要告诉它最后要获取的数据是什么就可以了。
AI自己去网上找答案
Firecrawl 新增的功能也最有趣。
以前必须事先准备好目标网址。
现在只要让AI说:整理出OpenAI最新的模型价格。

它会自动去搜索网页、进入网站、浏览页面然后提取出结果。
整个过程就是可以真正上网的 Agent。
到这里就差不多可以知道为什么 Firecrawl 会受到欢迎了。
它不仅是一个网页抓取工具,而且把网页获取、正文提取、结构化输出和Agent自动导航等所有功能都集成在一起,形成了一整套的功能。
有人要好奇怎么做到的
01 抓取层突破:12 种引擎并发竞速,自动处理 JS 渲染和反爬
Firecrawl 内置了 Playwright、Puppeteer、Chrome CDP 等 12 种抓取引擎,在并发启动之后会自动选择出最快速、最稳定的结果。
同时实现了JavaScript渲染、代理轮换、反爬处理。

开发者只需要写一个代码:
1 | `app.scrape("https://example.com")` |
浏览器启动、页面加载、正文提取等等都实现了自动化的功能。
02 层级优化:输出格式LLM准备就绪,准确率96%
支持Markdown、HTML、JSON、截图等格式输出,得到的就是已经清洗好的正文。
可以定义JSON Schema,Firecrawl会自动理解页面语义并输出结构化的数据。

question 和 highlights 两种模式只返回核心内容,比整页抓取最多可以节省 100 倍的 Token 消耗。
03 代理层进阶:从知道网址到知道目标
开发者不需要提前准备好URL,只需要说明要达到的目的就可以。
比如说找到Notion最新的价格。
FIRE-1 Web Action Agent 内置有自动搜索、点击、填表单以及提取结果的功能。

底层的PDF解析,链接提取等模块用到了Rust NAPI,速度提升3-5倍。
看完这些功能,相信很多人已经想试试了
Python用户:
1 | `pip install firecrawl-py` |
下面给出一些常见的API调用示例
01 网页正文抓取
1 | `from firecrawl import FirecrawlApp |
输出就是干净的Markdown,可以被直接写入到向量数据库或者知识库中。
02 用Agent来获取需要的信息
1 | `result = app.extract( |
对自动化的数据采集和Agent的应用场景来说,这种方法比传统的网页爬虫更具有灵活性。
03 也可以用 skill 的方式来使用
打开CC之后执行以下命令:
1 | `npx -y firecrawl-cli@latest init --all --browser` |
这样就可以在命令行调用了。
写在最后
Firecrawl 并不是只有做网页爬虫的功能。
它把网页抓取、内容提取和结构化输出结合起来,让网页数据可以直接用到AI应用里。
但是它不能抓取需要登录的付费内容,并且会遵守robots.txt。
如果你在做RAG、AI Agent或者是企业知识库。
可以试一试这个项目。
项目基于 AGPL-3.0 协议开放,感兴趣的同学可以去 GitHub 仓库看看源码和文档。
开源地址:https://github.com/firecrawl/firecrawl
既然看到这了,欢迎随手点赞、在看、转发,也可以给我个星标⭐,接收最新的文章,我们下期见!
💬 本文评论区已开启,但暂无读者留言。
本文转载自微信公众号,如有侵权请联系删除。
- 标题: 又一个 Agent 上网神器,暴涨 14 万 Star。
- 作者: lxiol
- 创建于 : 2026-07-13 12:53:16
- 更新于 : 2026-07-13 12:53:16
- 链接: https://blog.lxiol.cn/2026/07/13/又一个-Agent-上网神器暴涨-14-万-Star/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。