网易首页 > 网易号 > 正文 申请入驻

上交Data Whisperer:免训练数据选择法,10%数据逼近全量效果

0
分享至

本文第一作者王少博为上海交通大学博士生,现于阿里 Qwen 团队实习,此前有 CVPR 满分一作论文。通讯作者为其导师、上海交大助理教授张林峰。本文其他作者来自上交 EPIC Lab、NTU、NUS、微软、上海 AI Lab、港科大(广州)等。

从未微调目标数据集,一个预训练模型竟能自己筛选出「黄金训练样本」?

上海交通大学等团队提出Data Whisperer—— 首个免训练的注意力驱动数据选择框架。它直接利用预训练模型的上下文学习(ICL)能力,无需额外微调打分模型,仅用 10% 数据就能让微调效果逼近全量数据!

就像一位精通教学的导师,看一眼题库就知道该让学生重点练什么题。

  • 论文标题:Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
  • 论文链接:arxiv.org/pdf/2505.12212
  • GitHub 地址:gszfwsb/Data-Whisperer
  • 关键词:数据选择、上下文学习、小样本泛化、结构对齐

精调大模型,数据挑对才关键

模型说:「别给我扔几百万条数据了,你先告诉我哪些题值得看!」

传统的数据选择方法:

  • 要先训练个打分模型;
  • 要调一堆启发式参数;
  • 要花一堆时间还不一定好用;

而 Data Whisperer 就像摸鱼同学中的学霸 —— 不看全书也能稳拿高分。

方法机制:只靠模型自身,打分挑数据

Data Whisperer 是一种以大模型自身为评估器、完全免训练的数据子集选择方法。

1.ICL 少样本构建

  • 随机采样若干「示范样本」和「查询样本」,构建 ICL 提示;
  • 让待精调的大模型尝试回答这些查询任务;
  • 根据回答质量,给每个「示范样本」打一个分。

2.引入注意力感知权重

  • 为了让「题目权重」更加合理,Data Whisperer 不只看输出结果;
  • 它利用 Transformer 的注意力权重,度量每个示例对模型推理的「影响力」;
  • 最终打分由模型输出与注意力贡献共同决定,更稳定、更合理。

这种打分机制是完全无需训练、无需人工标注的!

Data Whisperer 不是「拍脑袋选题」,理论也站得住脚!

在传统精调中,模型通过梯度下降显式更新参数,比如注意力权重的关键值(Key)矩阵 W_K 和数值(Value)矩阵 W_V:

而在 ICL 过程中,虽然模型参数固定不变,但通过上下文中的示例(demonstration tokens)对注意力进行加权,使得模型在预测时行为发生了「类精调」式的变化:

也就是说,ICL 就像是在不动参数的前提下,用「语言上下文」在行为上更新了模型。

精调谁还全训?我 10% 数据照样打赢!

让我们看看 Data Whisperer 的「压轴战绩」:

  • GSM8K 数学题:10% 数据打出 72.46%,还比全量数据(71.39%)更高;
  • DialogSum 总结任务:用 Qwen 模型达到 43%,比最强 SOTA 方法高出 2.5 个点;
  • BioInstruct 任务也同样提升显著。

别人还在选题,我已经开始精调了

Data Whisperer 引入了一个新的效率指标:Selection-to-Tuning Ratio(STR),即选择过程耗时与全量精调耗时之比。

在该指标下,Data Whisperer 以 STR ≈ 0.03~0.2 的水平,大幅领先现有所有方法。相比之下,许多传统方法(如 Nuggets)STR > 1,意味着「选题还不如直接精调快」。

Data Whisperer 用极低成本完成了模型适配所需的「预判题型」工作。

小模型选题,大模型精调,谁用谁知道!

Data Whisperer 支持弱模型作为「选题器」,强模型作为「学习者」的弱选强训(weak-to-strong)机制。

例如,使用 Qwen-2.5-3B-Instruct 选题、再用 Qwen-2.5-7B-Instruct 精调,最终性能几乎不降,却带来更低计算负担。

Data Whisperer 成功实现了从小模型到大模型间的「知识前置迁移」,适用于资源受限场景下的精调任务。

演示题和查询题怎么配?精细搭配才能挑好!

Data Whisperer 进一步分析了 ICL 中示例(n_d)与查询(n_q)数量对选择效果的影响。

结果显示,n_d=10、n_q=5 是稳定优选配置。在此之后增加样本数量,效果提升趋于饱和。

这表明 Data Whisperer 对输入规模具有良好的鲁棒性,不是靠堆样本,而是真挑核心

哪层注意力最好用?

Data Whisperer 的注意力打分依赖于 Transformer 的层级结构。作者分别测试了浅层、中层、深层注意力用于打分的效果。

结果发现,中间层(如 Layer13)提供的语义信息更稳定,选题效果更佳,符合语言模型内部语义聚合的层次分布规律。

Data Whisperer 巧妙借力模型结构,使「注意力」真正发挥了「注意」的功能。

模型偏好什么题?简单好懂才是王道

进一步的分析中,作者使用 GPT-4o-mini 对被选中样本的困惑度(perplexity)进行了评估。

发现 Data Whisperer 倾向选择困惑度较低的样本,说明模型更喜欢「简单题」,也符合 Sorscher 等人在小样本学习中的「易例优先」理论。

对比分析:到底比哪些方法强?

Data Whisperer 在所有主流数据选择方法对比中均展现出领先效果:

  • GraNd:基于梯度;
  • EL2N:基于预测误差;
  • CCS:注重多样性;
  • Nuggets:需要额外精调打分器;
  • STAFF:组合打分策略。

Data Whisperer 在准确率、效率、稳定性三个维度全面领先,尤其在低预算(1%、5%、10%)场景中优势明显。

Data Whisperer 的秘诀:ICL 就是精调的「影子」

Data Whisperer 并非经验规则,而是基于理论支撑。

论文从注意力机制视角出发,分析了 ICL 过程中上下文样本对模型输出的影响,实质上等价于一种隐式的参数更新

ICL 调整注意力权重 ≈ Fine-Tuning 调整参数矩阵

两者都是为了「让模型在未来输入中表现更好」。

这一结构上的对应性解释了 Data Whisperer 能有效选出训练子集:它无需调模型参数,就能「预训」出训练效益

启示与未来方向

Data Whisperer 所倡导的是一种新范式:结构感知、推理驱动的数据选择方法,为 LLM 训练过程引入「自解释、自判断」的机制。

值得注意的是,字节 Seed 最新的工作 (https://arxiv.org/abs/2505.07293),也用了类似 few-shot 和 attention 结合的方法。

接下来值得探索的方向包括:

1. 将方法迁移至法律、医疗、工程等复杂结构任务;

2. 引入人类反馈或语言理解偏好,进一步增强「任务对齐」能力;

3. 结合 prompt 工程,控制示例顺序以提升效果;

4. 与合成数据方法融合,构建任务驱动的多源样本库。

总之,Data Whisperer 并不是简单优化效率的技巧,而是揭示了一个事实:

  • 任务对齐不必依赖人类标签、不必堆数据量。
  • 结构化的推理机制与任务映射,本身就可以引导模型学习方向

未来的大模型训练也许不再是「知道做什么」,而是「知道问什么」。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
形势有多严峻?网传2026年是分水年,2027年将全面清洗...

形势有多严峻?网传2026年是分水年,2027年将全面清洗...

慧翔百科
2026-08-12 08:30:02
赵一鸣4块牛肉干64元,复称仅17元。老板说“系统问题”,顾客说“每样都多称了”

赵一鸣4块牛肉干64元,复称仅17元。老板说“系统问题”,顾客说“每样都多称了”

听心堂
2026-08-11 21:39:10
诺奖委,是时候给黄院士颁奖了!本人首次回应来了!

诺奖委,是时候给黄院士颁奖了!本人首次回应来了!

闲侃闲侃
2026-08-12 08:08:33
高考444分考生回应被殡葬专业录取:出生于4月4日,当天还是清明节,纯属巧合,自己高一时就开始关注殡葬行业,就业前景不错

高考444分考生回应被殡葬专业录取:出生于4月4日,当天还是清明节,纯属巧合,自己高一时就开始关注殡葬行业,就业前景不错

极目新闻
2026-08-11 20:23:20
普京抵达,将亲自指挥

普京抵达,将亲自指挥

上观新闻
2026-08-12 09:08:30
男子结婚8年3个女儿都非亲生,得知结果坦言最放不下8岁的大女儿,想带她最后出去玩一次,“我可能再也见不到她了,希望她能过得更好”

男子结婚8年3个女儿都非亲生,得知结果坦言最放不下8岁的大女儿,想带她最后出去玩一次,“我可能再也见不到她了,希望她能过得更好”

鲁中晨报
2026-08-12 11:34:08
程梦圆遗体刚找到,恶心一幕发生,救援队长急了,有些人毫无底线

程梦圆遗体刚找到,恶心一幕发生,救援队长急了,有些人毫无底线

林雁飞
2026-08-11 13:12:34
缺席审判,阿萨德被判死刑!

缺席审判,阿萨德被判死刑!

每日经济新闻
2026-08-11 19:16:07
中国超市不是不想学胖东来,是不敢学,永辉超市就是例子

中国超市不是不想学胖东来,是不敢学,永辉超市就是例子

猪小艳吖
2026-08-11 23:49:34
C919国产大飞机正式执飞国际商业航线

C919国产大飞机正式执飞国际商业航线

界面新闻
2026-08-12 09:22:45
“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

“卫诗雅百花奖获最佳女主后孤独下台”引热议,本人回应:现场认识的人不多,也就梁家辉和朱一龙,并不是孤单;原本担心获零票会很尴尬

极目新闻
2026-08-12 11:29:12
普京抵达现场,亲自指挥俄太平洋舰队演练;共出动约60艘水面舰艇,超1.3万名军人参加

普京抵达现场,亲自指挥俄太平洋舰队演练;共出动约60艘水面舰艇,超1.3万名军人参加

极目新闻
2026-08-12 10:23:36
世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

叶青足球世界
2026-08-12 09:00:44
模型换个Harness就「变笨」?EverMind把自进化从研究推向产品,让AI「越用越聪明」

模型换个Harness就「变笨」?EverMind把自进化从研究推向产品,让AI「越用越聪明」

机器之心Pro
2026-08-11 10:51:39
49年军区政委返乡想报杀母之仇,毛主席大手一挥:把425团带去!

49年军区政委返乡想报杀母之仇,毛主席大手一挥:把425团带去!

芊芊子吟
2026-08-08 09:40:09
演员孙浩:58岁无妻无子,拍完戏买硬座连夜回西安,只为喊一声妈

演员孙浩:58岁无妻无子,拍完戏买硬座连夜回西安,只为喊一声妈

飘飘然的娱乐汇
2026-08-12 09:30:25
夺回藏南得一场大战?没必要,中国,正在“温水煮青蛙”

夺回藏南得一场大战?没必要,中国,正在“温水煮青蛙”

麓谷隐士
2026-08-12 08:30:08
真是没想到!8月12日凌晨中国女篮传来3大主力,李梦、韩旭、张子宇最新消息!宫鲁鸣压力大

真是没想到!8月12日凌晨中国女篮传来3大主力,李梦、韩旭、张子宇最新消息!宫鲁鸣压力大

小七说篮球
2026-08-12 09:44:04
俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

果妈聊娱乐
2026-08-12 08:32:47
刚把中企逼走,印尼矿工就怒烧大楼,局势失控,西方媒体集体哑巴

刚把中企逼走,印尼矿工就怒烧大楼,局势失控,西方媒体集体哑巴

黑鹰观军事
2026-08-11 21:15:03
2026-08-12 13:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13737文章数 142718关注度
往期回顾 全部

科技要闻

Claude又出骚操作 改个错字也要留AI水印?

头条要闻

高考444分考生被殡葬专业录取:出生于4月4日清明节

头条要闻

高考444分考生被殡葬专业录取:出生于4月4日清明节

体育要闻

乔丹鲨鱼们的合同:1996,史上最伟大夏天

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

游戏
艺术
亲子
房产
公开课

免费魂系恋爱游戏 答错秒变YOU DIED!

艺术要闻

只租20年,她在京郊为父母造养老小院:比买房值

亲子要闻

为什么聪明的孩子,都有很强的主动性?

房产要闻

突发,崖州湾又有大动作!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版