DataFlow-Harness:北大开源 AI 数据管道工程平台,NL→Pipeline→AI-ready 数据集
北大 DCAI 团队开源 DataFlow-Harness,填平 NL2Pipeline 鸿沟:用自然语言描述需求,Agent 在平台上构建可审计、可编辑、可复用的 DAG 数据流水线。端到端通过率 93.3%,成本降 72.5%,延迟降 50%。7,022⭐,Apache-2.0。
原文链接:https://mp.weixin.qq.com/s/Gah00ChUSnHItOnDMO6jBQ
论文:HuggingFace Papers #2
GitHub:OpenDCAI/DataFlow-WebUI | OpenDCAI/DataFlow — 7,022⭐ | Python | Apache-2.0
大模型训练、微调、RAG 知识库建设,都绕不开数据准备——而这恰恰是 LLM 落地最难啃的骨头。一个”从 PDF 教材中抽取高质量 VQA 数据集”的需求,需要解析文档、恢复版面、识别图表、对齐 QA、过滤低质样本、统一格式……每一步都依赖不同算子、Schema、质量标准和执行环境。
传统的解决方式:工程师手搓脚本,或 Code Agent 生成一次性脚本。但它们在流程复用、平台审计、可视化编辑和长期治理上都有短板。
北大 DCAI 团队联合上海算法创新研究院等发布了 DataFlow-Harness,核心概念是 NL2Pipeline gap——自然语言工作流意图与生产级可编辑流水线之间的鸿沟。
架构设计
DataFlow-Harness 基于四个核心组件:
| 组件 | 职责 |
|---|---|
| Data Pipeline Backend | 状态中心,P=(D, O, E, S, R):数据源、算子实例、有向依赖边、Schema、运行状态 |
| MCP Tools Layer | Code Agent 通过 typed mutations 修改 pipeline,Request→Validate→Commit |
| DataFlow-Skills | 编码算子选择模式、Schema 依赖、参数配置经验,解决”工具如何连成正确流水线” |
| DataFlow-WebUI | 对话 + DAG 画布双模式,共享同一 pipeline 状态,WebSocket 实时同步 |
性能数据
| 指标 | Vanilla Claude Code | DataFlow-Harness | 提升 |
|---|---|---|---|
| 端到端通过率 | 87.5% | 93.3% | +5.8pp |
| 成本 | $0.950 | $0.261 | -72.5% |
| 延迟 | 190.7s | 95.5s | -49.9% |
| 输出产物 | 一次性脚本 | Native DAG(可视化+可编辑+可复用) | — |
Textbook-to-VQA 任务:Precision 0.972, Coverage 0.873,均为最高。
下游训练验证:DataFlow-Harness 产生的数据微调 Qwen2.5-32B 后,数学推理平均分 51.6→55.7,AIME24@32 从 25.1→35.9。
北大 DCAI 团队生态
OpenDCAI 旗下多个项目:DataFlow (7K⭐)、DataFlex、DataMind、One-Eval、OpenWorldLib。
本文转载自微信公众号 Datawhale,作者:北大 OpenDCAI 团队。如有侵权请联系删除。
- 标题: DataFlow-Harness:北大开源 AI 数据管道工程平台,NL→Pipeline→AI-ready 数据集
- 作者: lxiol
- 创建于 : 2026-07-28 00:10:00
- 更新于 : 2026-07-27 09:43:04
- 链接: https://blog.lxiol.cn/2026/07/28/DataFlow-Harness-北大开源AI数据管道工程平台-7000星/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。