DataFlow-Harness:北大开源 AI 数据管道工程平台,NL→Pipeline→AI-ready 数据集

lxiol
📝
北大 DCAI 团队开源 DataFlow-Harness,填平 NL2Pipeline 鸿沟:用自然语言描述需求,Agent 在平台上构建可审计、可编辑、可复用的 DAG 数据流水线。端到端通过率 93.3%,成本降 72.5%,延迟降 50%。7,022⭐,Apache-2.0。

原文链接:https://mp.weixin.qq.com/s/Gah00ChUSnHItOnDMO6jBQ
论文:HuggingFace Papers #2
GitHub:OpenDCAI/DataFlow-WebUI | OpenDCAI/DataFlow — 7,022⭐ | Python | Apache-2.0

大模型训练、微调、RAG 知识库建设,都绕不开数据准备——而这恰恰是 LLM 落地最难啃的骨头。一个”从 PDF 教材中抽取高质量 VQA 数据集”的需求,需要解析文档、恢复版面、识别图表、对齐 QA、过滤低质样本、统一格式……每一步都依赖不同算子、Schema、质量标准和执行环境。

传统的解决方式:工程师手搓脚本,或 Code Agent 生成一次性脚本。但它们在流程复用、平台审计、可视化编辑和长期治理上都有短板。

北大 DCAI 团队联合上海算法创新研究院等发布了 DataFlow-Harness,核心概念是 NL2Pipeline gap——自然语言工作流意图与生产级可编辑流水线之间的鸿沟。

架构设计

DataFlow-Harness 基于四个核心组件:

组件 职责
Data Pipeline Backend 状态中心,P=(D, O, E, S, R):数据源、算子实例、有向依赖边、Schema、运行状态
MCP Tools Layer Code Agent 通过 typed mutations 修改 pipeline,Request→Validate→Commit
DataFlow-Skills 编码算子选择模式、Schema 依赖、参数配置经验,解决”工具如何连成正确流水线”
DataFlow-WebUI 对话 + DAG 画布双模式,共享同一 pipeline 状态,WebSocket 实时同步

性能数据

指标 Vanilla Claude Code DataFlow-Harness 提升
端到端通过率 87.5% 93.3% +5.8pp
成本 $0.950 $0.261 -72.5%
延迟 190.7s 95.5s -49.9%
输出产物 一次性脚本 Native DAG(可视化+可编辑+可复用)

Textbook-to-VQA 任务:Precision 0.972, Coverage 0.873,均为最高。

下游训练验证:DataFlow-Harness 产生的数据微调 Qwen2.5-32B 后,数学推理平均分 51.6→55.7,AIME24@32 从 25.1→35.9。

北大 DCAI 团队生态

OpenDCAI 旗下多个项目:DataFlow (7K⭐)、DataFlex、DataMind、One-Eval、OpenWorldLib。

本文转载自微信公众号 Datawhale,作者:北大 OpenDCAI 团队。如有侵权请联系删除。

  • 标题: DataFlow-Harness:北大开源 AI 数据管道工程平台,NL→Pipeline→AI-ready 数据集
  • 作者: lxiol
  • 创建于 : 2026-07-28 00:10:00
  • 更新于 : 2026-07-27 09:43:04
  • 链接: https://blog.lxiol.cn/2026/07/28/DataFlow-Harness-北大开源AI数据管道工程平台-7000星/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
目录
DataFlow-Harness:北大开源 AI 数据管道工程平台,NL→Pipeline→AI-ready 数据集