网易首页 > 网易号 > 正文 申请入驻

从手工作坊到工业化生产:北大开源 DataFlow-Harness 完全上手指南

0
分享至

AI 数据最难搞的 Harness 工程,被北大开源了!
一、做 LLM 的人,几乎都被数据坑过

圈内有句颠扑不破的老话:Garbage in,garbage out

不管你是做大模型微调、RAG 知识库,还是行业评测集构建,最终效果的天花板,从来不是模型本身,而是你喂进去的数据质量。但恰恰是这份“AI-ready 数据集”,成了绝大多数团队落地 LLM 最难啃的硬骨头。

举个最常见的例子:老板扔来一批教材 PDF,说“从里面抽一批高质量 VQA 数据,用来微调多模态模型”。听起来一句话的事,真做起来你会发现要走完整整一套流程:

  • 先解析 PDF 文本、还原版面层级
  • 识别插图、表格、公式,提取视觉元素
  • 做 OCR 与图文对齐
  • 生成问题、匹配答案、做跨页关联
  • 过滤低质量、重复、答错的样本
  • 统一字段格式、输出训练标准格式

每一步依赖不同的算子、不同的字段 Schema、不同的质量规则、不同的执行环境

目前行业里的做法,基本逃不出两种:

  1. 工程师手搓脚本:写一串 Python 代码跑通一次,需求一变、数据一换,又要重写。脚本是一次性的,没法审计、没法复用、没法沉淀成团队的数据资产,新人来了只能重复造轮子。
  2. 让 Code Agent 写一次性脚本:看似很酷,实则坑更多——模型很容易产生幻觉,调用不存在的算子、假设不存在的参数、基于过时知识写出“看起来合理但根本跑不通”的流程,最后还是要人兜底改。

这两种方式在流程复用、平台审计、可视化编辑、长期治理四个维度上全是短板。数据准备始终停留在“手工作坊”阶段,进不了工业化生产的生命周期。

而这,正是DataFlow-Harness要解决的核心问题。

二、什么是 DataFlow-Harness?一句话讲透

2026 年 7 月,北京大学 DCAI 团队联合上海算法创新研究院、北京中关村学院,发布了最新成果《DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines》,上线后直接冲上HuggingFace Papers 当日榜单第 2 名

论文提出了一个非常精准的概念:NL2Pipeline Gap——自然语言到生产流水线的鸿沟。

用户嘴上说的是“帮我从 PDF 里抽 VQA 数据”(自然语言意图),但生产系统真正需要的,是可检查、可编辑、可复用、可运行的平台原生流水线。这两者之间,隔着巨大的落地鸿沟。

DataFlow-Harness 做的事,就是把这条鸿沟填上:基于 DataFlow 开源生态,给 Code Agent 套上一层 Harness(工程缰绳),让 AI 不能随心所欲写脚本,只能在真实平台的算子、规则、Schema 边界内搭建数据流水线

最终输出的不是一段跑完就扔的 Python 代码,而是一条可视化、可编辑、可复用、可审计的平台原生 DAG 流水线,可以直接进入团队的数据资产库长期迭代。

简单类比:

  • 普通 Code Agent = 给你一个自由发挥的厨师,做菜全凭感觉,时好时坏
  • DataFlow-Harness = 给厨师一间标准化中央厨房+固定菜谱+操作规范,出品稳定、可复制、可管控
三、为什么非得是 Harness?三个绕不开的现实痛点

很多人会问:直接让 Claude Code 写脚本不行吗?为什么还要多一层 Harness?

真实落地场景里,纯自由脚本模式一定会卡在三个死穴上:

痛点1:脚本是一次性的,进不了平台生命周期

一次性 Python 脚本只能解决“眼前这一批数据”,没法纳入平台的长期管理:

  • 没有可视化界面,新人看不懂、改不动
  • 没有版本记录,出了问题没法回溯
  • 没有统一算子标准,换个人就换一套写法
  • 没法沉淀成可复用的数据资产

数据团队永远在“写新脚本→修旧脚本→重写脚本”里循环。

痛点2:Agent 天然有幻觉,容易“一本正经地胡说八道”

大模型擅长写代码,但不擅长记住平台里真实存在哪些算子、每个算子有哪些参数、上下游 Schema 怎么对齐。 它可能会调用一个不存在的算子、传一个不存在的参数、假设一个根本没有的功能,生成的代码“看起来天衣无缝,一跑全是报错”。

基础模型能力越强,越容易给人“它能搞定一切”的错觉。但数据工程是强约束的系统工程,需要的不是创意,是 100% 可验证的算子、依赖、Schema 和执行状态

痛点3:复杂数据处理是“流程艺术”,不是堆工具

高质量数据集从来不是“一个算子搞定”,而是多阶段的流水线工程:生成→清洗→评估→过滤→去重→格式化。

真正的难点在于:

  • 哪个步骤在前、哪个在后?
  • 字段怎么流转、怎么映射?
  • 哪些质量检查是必选项?
  • 出错了在哪一步回滚?

这就像做菜:光有锅碗瓢盆和食材没用,你还得知道先放什么、后放什么、火候多大、炖多久。这套“程序性经验”,纯自由 Agent 很难自己摸索对。

四、一图看懂架构:四层设计,把 AI 牢牢焊在平台上

DataFlow-Harness 没有搞复杂的黑科技,而是用非常工程化的四层架构,把“Agent 的创造力”和“平台的确定性”完美捏合在了一起。



下面我们一层层拆开讲,保证所有人都能看懂。

1. 核心状态层:Data Pipeline Backend——流水线的“大脑”

Backend 是整个系统的唯一真相源。DataFlow-Harness 把一条数据流水线抽象成一个五元组:P = (D, O, E, S, R)

  • D(Data):数据源配置,比如输入文件路径、格式、字段
  • O(Operator):配置好的算子实例,每个算子有明确的参数
  • E(Edge):算子之间的有向依赖边,决定执行顺序
  • S(Schema):每个节点的输入输出字段结构
  • R(Runtime):运行状态,比如模型服务地址、执行进度、报错信息

所有对流水线的修改,最终都会落到这个后端状态里。任何时候,整条流水线的结构、参数、字段、状态都是可查询、可验证的

2. 操作闸口层:MCP Tools Layer——从根源杜绝幻觉

这是 Harness 最关键的一层设计:Agent 不直接写自由脚本,只能通过“结构化操作”修改流水线

Agent 通过 MCP(Model Context Protocol)协议连接平台,只能调用有限的、类型严格的操作:

  • 添加算子
  • 删除算子
  • 更新算子参数
  • 连接两个节点
  • 查询当前流水线状态

每一次修改都走Request → Validate → Commit三步校验:

  1. 先读取当前流水线状态
  2. 提交结构化变更请求
  3. 系统校验:DAG 是否有环?上下游 Schema 是否兼容?参数是否合法?
  4. 校验通过才正式写入后端状态

这套机制相当于给 Agent 戴上了“安全手铐”——它再聪明,也只能在平台允许的范围内操作,从根源上杜绝了“编造算子、编造参数、编造流程”的幻觉问题

3. 流程知识层:DataFlow-Skills——老师傅的“操作手册”

如果说 MCP 解决了“不能乱做”,那 Skills 就解决了“怎么做才对”。

DataFlow-Skills 编码了大量数据工程的程序性经验:

  • 某类任务该选哪些算子
  • 算子之间的标准组合顺序
  • 常见场景的参数配置经验
  • 字段映射与 Schema 流转规则

比如“教材 PDF → VQA 数据集”这类复杂任务,Skills 里已经沉淀了标准装配步骤,Agent 照着框架搭就行,不会出现“先做 QA 再做 OCR”这种顺序错误。

一句话总结:算子注册表解决“有什么工具”,Skills 解决“工具怎么连成正确流水线”

4. 交互入口层:DataFlow-WebUI——人人能用的可视化面板

DataFlow-WebUI 是用户直接接触的界面,也是 Harness 的工程交互入口。它最贴心的设计是双模态操作

  • 对话模式:用大白话描述需求,比如“把这批 JSON 里的长文本切分,再过滤掉低质量的”,Agent 自动搭流水线
  • 画布模式:直接在 DAG 画布上拖拽算子、改参数、连连线,像画流程图一样简单

最关键的是:两种模式共享同一条流水线状态。 你在对话框里改了需求,画布上实时更新;你在画布上拖了节点、调了参数,对话上下文也同步感知。后端状态变更后通过 WebSocket 实时推送到前端,两边永远一致。

技术栈上,前端用 Vue,后端是 FastAPI,底层包装 DataFlow 的 Python 算子库,通过 Ray 做分布式任务调度。

五、实测说话:效果更好,还更省钱、更快

架构设计得再好,最终要看实际表现。论文在多个维度做了严格对比测试,结果非常能打。

1. 12 项数据工程基准:通过率持平顶级基线,成本砍七成

测试覆盖了数据转换、问答生成、质量过滤、长文档处理、Schema 规范化等 12 个典型任务,每种方法重复 120 次。

指标

DataFlow-Harness

Vanilla Claude Code

变化

端到端通过率

93.3%

接近最强基线 94.2%

单次成本

$0.261

$0.950

降低 72.5%

生成延迟

95.5s

190.7s

降低 49.9%

简单说:成功率几乎和最强方案一样好,但成本只剩不到 1/3,速度快了一倍

原因很直观:Agent 不用从头写自由代码,只需要调用结构化操作 + 参考 Skills 经验,Token 消耗和思考时间都大幅减少。

2. Textbook-to-VQA:复杂文档抽取双指标第一

这是最贴近真实生产的任务:从教材、解答手册、考试答案页中抽取视觉问答数据,需要串联 PDF 解析、版面恢复、OCR、图表抽取、多模态理解、QA 匹配等一整套流程。

指标

DataFlow-Harness

精确率 Precision

覆盖率 Coverage Rate

两个指标均为所有对比方案中的最高值。

  • 精确率高 → 抽出来的 QA 对质量好、错误少
  • 覆盖率高 → 能挖掘出更多可抽取的有效样本

这个任务最能体现 Harness 的价值:Agent 不是在调用某个模型,而是在组织一整条多阶段、多算子的复杂处理流水线

3. 数学推理流水线:数据质量直接转化为模型分数

数据流水线好不好,最终要看训练出来的模型行不行。 测试用 Agent 构建完整的数学数据合成流水线:题目校验→低质过滤→问题扩展→思维链生成→n-gram 去重,生成的数据用来微调 Qwen2.5-32B-Instruct。

训练设置

DataFlow-Harness

Vanilla CC

提升

1 epoch 平均分

51.6

49.9

+1.7

2 epochs 平均分

55.7

54.5

+1.2

AIME24@32(1 epoch)

35.9

25.1

AIME25@32(1 epoch)

34.5

21.6

AIME 这类高难度竞赛题直接涨了 10 分以上,足以说明:数据流水线的质量,直接决定了模型训练的上限

4. 通用 SFT 数据:代码能力提升最显著

通用指令微调场景下,Agent 从零搭建完整的数据合成链路:主题条件生成 → critique 批评 → rewrite 改写 → LLM-as-judge 评分过滤。 每条流水线生成 1 万条 instruction-response 数据,微调 Qwen2.5-7B-Base。

指标

DataFlow-Harness

Vanilla CC

提升

整体平均分

63.8

61.5

+2.3

HumanEval

80.5

78.0

+2.5

HumanEval+

72.6

70.1

+2.5

MBPP

75.4

64.6

MBPP+

58.2

51.6

+6.6

代码类 benchmark 提升最突出,MBPP 直接涨了 10.8 分。 这说明当 critique、rewrite、judge 这些环节被组织成稳定、规范的流水线后,生成样本的质量会得到系统性提升。

六、5 分钟快速上手:普通人也能搭数据流水线

讲了这么多原理,我们直接上手实操。整个过程非常简单,照着做就能跑通。

前置环境要求

  • Python 3.10 及以上
  • Node.js 20 及以上(推荐用 nvm 管理)
  • Git
  • 至少一个 Code Agent(Claude Code / Codex / Cursor 三选一)
  • 对应模型的 API Key
第一步:安装 DataFlow 主库

推荐用 uv 加速安装:

pip install uvuv pip install open-dataflow

安装完成后验证一下:

dataflow -v

输出版本号就说明安装成功了。

第二步:一键启动 WebUI

一条命令直接启动可视化界面:

dataflow webui

系统会自动从 GitHub Release 下载最新版 DataFlow-WebUI,本地解压部署并启动服务,浏览器会自动打开。 默认地址是:http://localhost:8000/

第三步:两种玩法,按需选择

启动之后,你有两种使用方式,可以随时切换:

玩法 A:对话式搭建(零代码)

在右侧聊天框直接说你的需求,比如:

“帮我构建一个文本清洗流水线,输入是 JSONL 格式,先过滤掉长度小于 50 的样本,再做去重,最后输出清洗后的文件”

Agent 会自动调用算子、连接节点、配置参数,画布上会实时生成 DAG 图。你觉得不对可以继续用自然语言修改,比如“把去重改成按 content 字段去重”。

玩法 B:画布手动拖拽(精细调整)

左侧算子库可以直接拖拽到画布上,手动连边、点节点改参数。适合有经验的用户做精细化调整。

进阶:选择你的 Code Agent

DataFlow-WebUI 支持多种 Agent,分为两类:

Agent 类型

代表工具

使用方式

WebUI 调度型

Claude Code、Codex

在 WebUI 聊天框顶部下拉选择,后端自动启动

IDE/终端型

Cursor IDE、终端 Claude Code

在 IDE 里打开项目,通过 MCP 自动同步到画布

API Key 配置示例:

# Claude Codeexport ANTHROPIC_API_KEY=sk-ant-...# Codexexport OPENAI_API_KEY=sk-...
常见问题快速排查
  • 提示命令找不到:检查 CLI 工具是否在 PATH 中,或者用环境变量指定绝对路径
  • 聊天回复为空:大概率是 API Key 没配置对,检查启动后端的终端环境变量
  • Agent 总用不存在的算子:重新运行 ./scripts/setup_agent.sh 刷新 Skills 配置
  • Cursor 里看不到 MCP 工具:确保后端已启动,并重跑 cursor 配置脚本
七、不止是 WebUI:OpenDCAI 全家桶,覆盖 AI 数据全生命周期

DataFlow-Harness 不是孤立项目,它是整个 OpenDCAI 数据生态的一环。北大 DCAI 团队围绕“数据-centric AI”做了一整套工具链,覆盖从数据准备到训练再到评测的全流程。

1. DataFlow:数据准备核心底座

整个生态的基石。提供 200+ 可复用算子,覆盖文本、数学、代码、多模态等场景,支持自定义算子扩展。把数据清洗、合成、评估、过滤这些工作,从“写脚本”变成“搭流水线”。

2. DataFlow-Harness / WebUI:Agent 化交互入口

就是本文主角。让你用自然语言就能搭建和管理 DataFlow 流水线,降低使用门槛,提升构建效率。

3. DataFlex:训练时动态数据调度

基于 LLaMA-Factory 的动态训练框架,支持数据选择、领域混合比例动态调整、样本重加权。训练过程中智能调度数据,同样的数据训出更好的模型。

4. DataMind:推理时智能检索

Agentic 检索助手,融合 RAG、图谱检索、NL2SQL、技能库、记忆系统六大能力。把做好的知识库直接变成可对话的智能应用。

5. One-Eval:自动化模型评测

基于 Agent 的 LLM 自动化评估框架,减少人工评测成本,结果更稳定可复现。

6. OpenWorldLib:世界模型统一框架

面向世界模型的统一代码库,覆盖视频生成、3D 场景、VQA、VLA 等多模态任务。

整条链路串起来就是:原始数据 → DataFlow 清洗合成 → DataFlex 训练调度 → DataMind 推理检索 → One-Eval 效果评测

从数据生产到模型落地,形成了完整的闭环。

八、最后说说:Harness 为什么是 Data-Centric AI 的关键一步

过去我们聊 Data-Centric AI,总觉得是“多关注数据、少折腾模型”的理念。但理念落地,缺的是工程工具。

DataFlow-Harness 真正把这件事往前推了一大步:

  • 它让Agent 参与数据工程,但又不脱离工程规范
  • 它让数据流水线像代码一样可版本化、可复用、可协作
  • 它让不懂算子细节的人,也能搭建高质量的数据处理流程

从前做一份 AI-ready 数据集,可能要资深数据工程师折腾好几天;现在有了 Harness,普通算法工程师甚至产品经理,用自然语言就能搭出可运行、可复用的流水线。

这不是“AI 替代人”,而是用工程化的方式,把数据生产的门槛打下来,让更多团队能做出高质量的数据资产

如果你正在做 LLM 微调、RAG 知识库、行业数据集构建,不妨去试试这个工具——也许你会发现,之前耗在数据上的大半时间,其实都可以省下来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《庆余年3》叶灵儿三季换三张脸,范思辙却被死保:资本面前,角色也分三六九等?

《庆余年3》叶灵儿三季换三张脸,范思辙却被死保:资本面前,角色也分三六九等?

乡野小珥
2026-07-27 16:34:16
多个首轮签+互换+多个次轮!!疯了疯了!

多个首轮签+互换+多个次轮!!疯了疯了!

柚子说球
2026-07-28 20:20:19
日本人评价抗美援朝:若中国不发兵,美国根本走不到鸭绿江边,中国的出战,让西方复盘了70多年都没琢磨透

日本人评价抗美援朝:若中国不发兵,美国根本走不到鸭绿江边,中国的出战,让西方复盘了70多年都没琢磨透

磊子讲史
2026-07-28 16:07:56
首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

柳絮忆史
2025-07-22 07:15:03
油价调整通知

油价调整通知

甘肃交通广播
2026-07-29 19:32:14
中国女排传来好消息,吴梦洁李盈莹都在北京,终于集齐最强阵容

中国女排传来好消息,吴梦洁李盈莹都在北京,终于集齐最强阵容

小犙拍客在北漂
2026-07-29 17:10:58
北大满分天才出家12年,同学获菲尔兹奖后说了句话,全网沉默了

北大满分天才出家12年,同学获菲尔兹奖后说了句话,全网沉默了

云舟史策
2026-07-27 19:15:27
3.23亿老人等不起!国家出手了,这次养老方式要变天

3.23亿老人等不起!国家出手了,这次养老方式要变天

职场资深秘书
2026-07-29 15:38:07
6-5!5-6,斯诺克大师赛:中国名将被绝杀,赵心童、吴宜泽出战

6-5!5-6,斯诺克大师赛:中国名将被绝杀,赵心童、吴宜泽出战

南海浪花
2026-07-29 19:15:07
71岁白冰冰发文怀念女儿,29年前女儿惨遭绑匪虐待撕票离世

71岁白冰冰发文怀念女儿,29年前女儿惨遭绑匪虐待撕票离世

韩小娱
2026-07-29 17:15:29
发视频反馈车辆缺陷被辞退?当事人:终生不再购买奇瑞汽车

发视频反馈车辆缺陷被辞退?当事人:终生不再购买奇瑞汽车

ZAKER新闻
2026-07-27 18:52:25
女儿考上事业编我去庙里还愿,政审却来电:名下600万公司做啥的

女儿考上事业编我去庙里还愿,政审却来电:名下600万公司做啥的

千秋文化
2026-07-27 19:52:24
1-5!中国足球小将无缘8强 惨败原因曝光 前国脚不服:压着对手踢

1-5!中国足球小将无缘8强 惨败原因曝光 前国脚不服:压着对手踢

念洲
2026-07-29 22:20:58
台当局没想到,蔡英文一句话点明:收台须尽早,才是对全世界负责

台当局没想到,蔡英文一句话点明:收台须尽早,才是对全世界负责

不似少年游
2026-07-29 07:06:19
神助攻!阿隆索出手帮穆里尼奥减负!切尔西瞄准皇马 4300 万弃将

神助攻!阿隆索出手帮穆里尼奥减负!切尔西瞄准皇马 4300 万弃将

奶盖熊本熊
2026-07-29 05:21:47
江苏34岁卡车司机陕西服务区去世,4名卡友千里接力护送车辆返乡

江苏34岁卡车司机陕西服务区去世,4名卡友千里接力护送车辆返乡

环球网资讯
2026-07-29 15:38:30
避坑!孩子赴美,家长如何合法留美陪娃?大部分家庭都踩了这个误区

避坑!孩子赴美,家长如何合法留美陪娃?大部分家庭都踩了这个误区

留学生日报
2026-07-28 20:39:26
河南考生差1分无缘北大,父亲找人查卷,卷上两字让他愣住

河南考生差1分无缘北大,父亲找人查卷,卷上两字让他愣住

麦子情感故事
2026-07-29 15:18:05
高市再提访华,中方该不该答应?我国率先换将,日本需满足一要求

高市再提访华,中方该不该答应?我国率先换将,日本需满足一要求

兵鉴史
2026-07-29 21:17:43
1:2!郑钦文惨遭一轮游,不得不承认5个事实,实力下滑太严重!

1:2!郑钦文惨遭一轮游,不得不承认5个事实,实力下滑太严重!

田先生篮球
2026-07-29 06:39:18
2026-07-29 22:36:49
呼呼历史论
呼呼历史论
分享有趣的历史
748文章数 17661关注度
往期回顾 全部

科技要闻

Kimi K3火爆,奥特曼:开源一定有一席之地

头条要闻

检测列车撞人致11死2伤 国铁昆明局被罚300万元

头条要闻

检测列车撞人致11死2伤 国铁昆明局被罚300万元

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

55岁影帝黄政民出轨

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

MG 07预售12.59万起 高阶版配激光雷达+CDC

态度原创

房产
游戏
健康
旅游
教育

房产要闻

来了!广州首个现房销售项目,将落地南沙!

《明末:影之刃零》上架Steam!DLC《明末黑钟馗》

做好这几件事,帮你远离中风!

旅游要闻

门票也有“盲盒”惊喜 北京这些博物馆在门票上藏尽巧思

教育要闻

暑期托管班暖心开课 丰富课程充实欢乐假期

无障碍浏览 进入关怀版