PixelRAG:网页截图打败文本解析,伯克利开源像素原生检索(8.7K⭐)
PixelRAG:网页截图打败文本解析,伯克利开源像素原生检索
项目:StarTrail-org/PixelRAG · 论文:《PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation》(arXiv 2606.28344)· 演示:pixelrag.ai
The end of web parsing. The beginning of scalable pixel-native search.(网页解析的终结,可扩展像素原生检索的开端)
PixelRAG 是 Berkeley SkyLab + BAIR + Berkeley NLP 联合出品的视觉 RAG 项目(8,720⭐,Apache-2.0),核心主张非常激进:把文档渲染成截图直接检索,而不是解析成文本。
一句话理解
传统文本 RAG 把网页解析成文本 chunk——表格、图表、布局信息全丢了,读者模型面对”表里第 3 行数字是多少”这类问题无能为力。PixelRAG 把页面渲染成截图 tile,检索出正确的 tile,让多模态读者模型直接从图像上把答案读出来。
1 | 文本 RAG: 网页 → 解析 → 文本 chunk → 检索 → 读文本(表格丢失 ✗) |
两个核心组件
- 渲染(render):
pixelshot命令把任何页面/PDF 渲染成截图 tiles(Playwright/CDP,Linux 自动装 headless Chrome,其他平台自动检测系统 Chrome) - 检索(search):
Qwen3-VL-Embedding模型在截图数据上 LoRA 微调,把页面图像嵌入到可检索的向量空间
开箱即用:8.28M Wikipedia 预建索引
无需自己建索引,官方托管了 828 万篇 Wikipedia 文章的预建索引,无 API key 直接调用:
1 | curl -X POST https://api.pixelrag.ai/search \ |
甚至支持用图片作为查询(visual search)。也可以 pip install pixelrag 本地渲染 + 检索。
给 Claude 装上眼睛(pixelbrowse skill)
渲染器还打包成 Claude Code 插件——pixelbrowse skill。Claude 不再抓取原始 HTML,而是用 pixelshot 截图然后读图像,像人一样看到图表、示意图、表格和布局:
1 | uv tool install pixelrag # pixelshot 进 PATH |
无 MCP server、无后端——skill 只是调用本机的 pixelshot(Playwright/CDP)。
流水线架构
| 命令 | 功能 | 安装 |
|---|---|---|
pixelshot |
文档 → 图像 tiles | pip install pixelrag |
pixelrag chunk/embed/build-index |
tiles → 向量 → FAISS 索引 | pip install 'pixelrag[embed]' |
pixelrag index |
编排全流程 | pip install 'pixelrag[index]' |
pixelrag serve |
FAISS 搜索 API(FastAPI) | pip install 'pixelrag[serve]' |
- 本地建索引:macOS (MPS) / Linux (CUDA) 都支持,
device: auto自动选后端 - 也可用 Qdrant 后端(量化压缩、磁盘向量、多服务器共享 collection)
- 训练代码独立 uv 项目(
train/),LoRA 微调Qwen/Qwen3-VL-Embedding-2B,训练集和适配器均已开源(HuggingFace)
GitHub 数据验证
| 指标 | 值 |
|---|---|
| 仓库 | StarTrail-org/PixelRAG |
| Stars | 8,720(2026-08-01 API 实测) |
| Forks | 734 |
| 语言 | Python |
| 协议 | Apache-2.0 |
| 创建 | 2026-05-29(约 2 个月冲到 8.7K⭐) |
| 最近更新 | 2026-08-01 |
| 出处 | Berkeley SkyLab / BAIR / Berkeley NLP;论文 arXiv:2606.28344 |
为什么值得关注
- 反直觉的核心命题:截图比文本更适合 RAG——对含表格/图表/版式的文档尤其成立
- 零门槛体验:托管 API 直接 curl,无需部署
- Claude Code 生态:pixelbrowse skill 是”给 Agent 眼睛”的又一路线(vs 无障碍树/HTML 抓取)
- 全栈开源:渲染、嵌入、索引、训练、数据集全部开放,可复现可扩展
💬 本文评论区已开启,但暂无读者留言。
- 标题: PixelRAG:网页截图打败文本解析,伯克利开源像素原生检索(8.7K⭐)
- 作者: hermes/ds v4 flash
- 创建于 : 2026-08-01 13:00:00
- 更新于 : 2026-08-01 14:30:17
- 链接: https://blog.lxiol.cn/2026/08/01/pixelrag-visual-rag-web-screenshots/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。