又一个 Agent 上网神器,暴涨 14 万 Star。

lxiol
📝
做 AI 应用的人,基本都会遇到相同的问题。模型训练所用到的数据有一个截止时间,而现实世界每天都在发生变化

原文链接:https://mp.weixin.qq.com/s/_icQ_h1oH4wlmR9ksZnvBw

做 AI 应用的人,基本都会遇到相同的问题。

模型训练所用到的数据有一个截止时间,而现实世界每天都在发生变化。

为了让Agent获取到最新的网页数据,一般只能自己搭建爬虫或者购买网页数据API。

前者需要解决JavaScript渲染、反爬机制、代理池、数据清洗等一系列问题。

后者的成本很高,返回的数据不能直接用于大语言模型。

最近在 GitHub 上看到一个项目,已经把这件事做成了一个标准能力。

它的名字叫做Firecrawl,在GitHub上有14.9万颗星。

用一句话概括:

它把任意网页转换成干净的 Markdown 或结构化 JSON,并通过一个 API 直接交给 AI 使用。

很多人第一次看到都会觉得:这不就是一个爬虫吗?

它所要解决的问题并不是网页抓取,而是使网页数据能够直接进入AI工作流。

先来看几个最典型的使用场景。

给RAG系统加上网页数据

很多 AI 应用都会遇到这样的问题。

比如用户问:西门子最新推出的产品是什么?

模型训练的时候不知道,但是官网已经更新了。

以前要重新写爬虫、解析网页、清洗数据,然后导入到向量数据库里。

现在只要抓取官网页面就可以得到干净的 Markdown。

直接添加到知识库里面。

批量提取商品,新闻等结构化的数据

对几个竞争者的网站进行分析。

传统的做法是为每一个网站分别编写CSS选择器、XPath或者正则表达式。

网站一旦有一点点变化,就必须要重新维护。

Firecrawl 可以直接定义出 JSON Schema。

比如商品名称、价格、评分、库存等等几个字段。

返回的结果就是标准的JSON格式。

不管网页用什么样的布局方式,也不用研究DOM结构,只要告诉它最后要获取的数据是什么就可以了。

AI自己去网上找答案

Firecrawl 新增的功能也最有趣。

以前必须事先准备好目标网址。

现在只要让AI说:整理出OpenAI最新的模型价格。

它会自动去搜索网页、进入网站、浏览页面然后提取出结果。

整个过程就是可以真正上网的 Agent。

到这里就差不多可以知道为什么 Firecrawl 会受到欢迎了。

它不仅是一个网页抓取工具,而且把网页获取、正文提取、结构化输出和Agent自动导航等所有功能都集成在一起,形成了一整套的功能。

有人要好奇怎么做到的

01 抓取层突破:12 种引擎并发竞速,自动处理 JS 渲染和反爬

Firecrawl 内置了 Playwright、Puppeteer、Chrome CDP 等 12 种抓取引擎,在并发启动之后会自动选择出最快速、最稳定的结果。

同时实现了JavaScript渲染、代理轮换、反爬处理。

开发者只需要写一个代码:

1
`app.scrape("https://example.com")`

浏览器启动、页面加载、正文提取等等都实现了自动化的功能。

02 层级优化:输出格式LLM准备就绪,准确率96%

支持Markdown、HTML、JSON、截图等格式输出,得到的就是已经清洗好的正文。

可以定义JSON Schema,Firecrawl会自动理解页面语义并输出结构化的数据。

question 和 highlights 两种模式只返回核心内容,比整页抓取最多可以节省 100 倍的 Token 消耗。

03 代理层进阶:从知道网址到知道目标

开发者不需要提前准备好URL,只需要说明要达到的目的就可以。

比如说找到Notion最新的价格。

FIRE-1 Web Action Agent 内置有自动搜索、点击、填表单以及提取结果的功能。

底层的PDF解析,链接提取等模块用到了Rust NAPI,速度提升3-5倍。

看完这些功能,相信很多人已经想试试了

Python用户:

1
`pip install firecrawl-py`

下面给出一些常见的API调用示例

01 网页正文抓取

1
2
3
4
5
6
7
`from firecrawl import FirecrawlApp

app=FirecrawlApp(api_key="your-api-key")

result = app.scrape_url("https://example.com")

print(result["markdown"])`

输出就是干净的Markdown,可以被直接写入到向量数据库或者知识库中。

02 用Agent来获取需要的信息

1
2
3
4
5
6
7
8
9
`result = app.extract(
    [
        "https://openai.com",
        "https://openai.com/pricing"
    ],
    {
        "prompt": "Extract pricing information for GPT-4 models"
    }
)`

对自动化的数据采集和Agent的应用场景来说,这种方法比传统的网页爬虫更具有灵活性。

03 也可以用 skill 的方式来使用

打开CC之后执行以下命令:

1
`npx -y firecrawl-cli@latest init --all --browser`

这样就可以在命令行调用了。

写在最后

Firecrawl 并不是只有做网页爬虫的功能。

它把网页抓取、内容提取和结构化输出结合起来,让网页数据可以直接用到AI应用里。

但是它不能抓取需要登录的付费内容,并且会遵守robots.txt。

如果你在做RAG、AI Agent或者是企业知识库。

可以试一试这个项目。

项目基于 AGPL-3.0 协议开放,感兴趣的同学可以去 GitHub 仓库看看源码和文档。

开源地址:https://github.com/firecrawl/firecrawl

既然看到这了,欢迎随手点赞、在看、转发,也可以给我个星标⭐,接收最新的文章,我们下期见!


💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 又一个 Agent 上网神器,暴涨 14 万 Star。
  • 作者: lxiol
  • 创建于 : 2026-07-13 12:53:16
  • 更新于 : 2026-07-13 12:53:16
  • 链接: https://blog.lxiol.cn/2026/07/13/又一个-Agent-上网神器暴涨-14-万-Star/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。