网易首页 > 网易号 > 正文 申请入驻

别再把长文切碎了,HiLight让AI直接在原文里划重点

0
分享至



在实际应用中,模型常常会忽略关键线索,这就是 “Lost in the Middle” 现象,即模型对出现在输入中间位置的信息关注度明显下降。现有的优化思路大致分为两类:

  • 硬选择:先检索或裁剪出相关片段,再送入模型,但可能会丢失对推理至关重要的上下文。
  • 软选择:通过摘要或压缩来缩短输入,但有损压缩难免引入失真。

两类方法都在 “动” 原始输入或原始权重。那么,能不能既保留完整的上下文,又能准确地告诉模型 “重点看哪里”?HiLight 提出一条 “输入侧干预” 的新路径:在原文中插入少量高亮标签,引导模型的注意力。

方法概述

在实际部署当中,大模型往往是API 付费调用、规模巨大,甚至权重不开放的黑盒服务,直接对它做 SFT 或 RL 微调往往不现实。因此,HiLight 选择了一条更实用的路径:冻结推理模型,训练一个轻量的 “助手模型” 来帮助它划重点。



  • 论文标题:Learning Evidence Highlighting for Frozen LLMs
  • 论文地址:https://arxiv.org/abs/2604.22565
  • 作者:Shaoang Li1,∗, Yanhang Shi1,∗, Yufei Li2, Mingfu Liang2, Xiaohan Wei2, Yunchen Pu2, Fei Tian2, Chonglin Sun2, Frank Shyu2, Luke Simon2, Sandeep Pandey2, Xi Liu2,†, Jian Li1,†
  • 机构:1 石溪大学(Stony Brook University),2 Meta AI
  • 说明:∗ 共同第一作者;† 共同通讯作者

流程如下:

1. 轻量模型(Emphasis Actor)阅读完整的上下文,为每个 token 打出重要性分数。

2. 轻量模型在得分最高的片段两边插入高亮标签,如 < start_important > 和 < end_important>。

3. 冻结的推理模型(Solver LLM)接收带标签的文本,完成推理并输出结果。



该训练过程只用 Solver 的任务奖励作为反馈信号,不需要任何人工标注的证据。在训练方式上,因为没有 token 级别的证据标注,研究者将高亮选择建模为强化学习问题,用下游任务指标(如 HR@10、EM、F1)作为奖励信号,通过分组策略梯度来更新 Actor。

为了防止 Actor “全部高亮” 的偷懒行为,该框架还引入了高亮预算机制:轻量语言模型最多只能标注一定比例的 token,并通过 span 合并策略将零散的 token 级选择合并为语义连贯的片段。



实验表明,HiLight 对预算取值并不敏感。这意味着,在实际部署时无需精细调参,选取一个合理的中间值即可。

实验结果

研究者在四个任务上进行了评测:Amazon-Beauty(序列推荐)、HotpotQA(多跳问答)、SQuAD 2.0(阅读理解)和 PubMedQA(生物医学分类)。对比方法涵盖了当前主流的 prompt optimization 方法,包括 PRL、BFRS、OPRO、DSPy(MIPROv2)和 APE。



提升幅度最大的是序列推荐(Amazon-Beauty),在其它任务上,虽然提升相对温和,但依然一致正向。

高亮>裁剪,保留上下文的优势

消融实验做了一个有趣的对比:把 Actor 选择的高亮片段单独裁剪出来喂给 Solver,会怎么样?



结果显示,在 Amazon-Beauty 上,裁剪也能取得不错的效果。但在 HotpotQA 上出现了相反的情况。因为多跳问答推理需要保留连接性的上下文,裁剪虽然能选出关键证据,却破坏了语义的完整性。而HiLight 在标注重点的同时保留了完整语境。

一个高亮模型,服务多个大模型

Actor 学习到的高亮策略具有很强的迁移能力。研究者用 Qwen3-14B 作为 Solver 训练 Actor,直接将其应用到五个从未见过的 Solver 上。与之相对比的做法是让目标 Solver 自己先高亮证据再作答。



结果显示,HiLight 的 Actor 高亮在五个 Solver 上的效果都明显优于自我高亮。原因也很简单,专门训练的轻量模型,比大模型自己猜 “哪里重要” 更靠谱。HiLight 的 Actor 是通过任务奖励显式训练出来的,知道什么样的证据能真正提升下游指标。

没有人工标注,却与人工高度重合

尽管训练过程中没有任何 token 级别的证据标注,但Actor 的高亮区域与 HotpotQA 数据集中人工标注的支持事实高度重合,最高达到 0.78 F1。随着 Actor 规模从 0.6B 增大到 8B,F1 从 0.68 单调上升到 0.78。



如图所示,Precision、Recall、F1 三项指标都随 Actor 规模单调提升,Precision 甚至达到 0.84,说明Actor 高亮的 token 中,绝大多数都是人工判定的关键证据。



上图展示了一个 HotpotQA 样本上的 token 级分数分布:蓝色曲线是 Actor 打出的重要性分数,红色阴影区是人工标注的支持事实所在区间。在一个包含 1200 多个 token 的长上下文中,Actor 只在两个狭窄的区域打出高分,而这两个区域正是数据集标注的 ground-truth 证据所在。

低部署成本

  • Solver 端 token 开销:< 1.01 倍(仅插入少量标签 token)。
  • Actor 推理延迟:0.6B 模型约 0.05 秒,4B 模型约 0.23 秒(p50),相比 Solver 的 8 至 18 秒可忽略不计。
  • 训练成本:仅需约 12K 次 Solver 调用,而 PRL 需要 120K 次,APE 需要 60K 次。

一个直观案例:序列推荐优化

在 Amazon-Beauty 的一个典型案例中,模型需要通过给定的用户历史购买摘要和一批候选商品,依据用户下一个可能感兴趣的商品,对候选商品进行重排序。Actor 精准地高亮标记了两个关键内容。这两个信号帮助 Solver 将真实目标商品(一款主打 “Grips Makeup To Last” 的底妆产品)的推荐排序从第 14 名提升到第 5 名,是一个显著的排序改进。



与黑盒注意力机制不同,HiLight 直接告诉用户:模型之所以提升该商品的排名,是因为看到了这两段高亮文本。这大大提升了模型推荐结果的可信度。

结语

HiLight 的思路非常简单,用一个轻量模型划重点,让大模型集中精力推理。这种方式带来了几个好处:

  • 性能提升:推荐任务性能提升可达 27%,问答任务也正向提升。
  • 不用改模型:Solver 冻结,API 友好。
  • 可解释:高亮标签能够直接告诉人类 “模型在看哪里”,以及模型决策的依据。
  • 可迁移:一个 Actor 可以服务于多个不同的大模型。
  • 低成本:训练成本低,额外延迟和推理成本小。

随着越来越多系统通过 API 调用大模型,HiLight 提供了一种不必改动 Solver 也能实现性能提升的办法。

值得一提的是,本文作者名单与 Meta 的 GR2(Generative Reasoning Re-ranker,arXiv:2602.07774)团队有相当程度的重叠,HiLight 这套做法很可能在不远的将来被用进 GR2 这样的生产级 re-ranking 系统里。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
那英开演唱会半个娱乐圈都来了,网友却在问:他们是花钱买的票吗

那英开演唱会半个娱乐圈都来了,网友却在问:他们是花钱买的票吗

草莓解说体育
2026-08-24 00:01:06
追到校草3个月,我突然没了兴致,打算提分手,无意间刷到他小号发文:我和她恋爱只是玩乐。我舒了口气,顺手点赞,他却慌了

追到校草3个月,我突然没了兴致,打算提分手,无意间刷到他小号发文:我和她恋爱只是玩乐。我舒了口气,顺手点赞,他却慌了

晓艾故事汇
2026-08-23 16:04:55
300亿被冻结!曾经吊打沃尔沃的国产神车,彻底宣告落幕!

300亿被冻结!曾经吊打沃尔沃的国产神车,彻底宣告落幕!

青眼财经
2026-08-05 23:51:12
北京这一晚,内娱的人情冷暖江湖地位,在那英身上体现的淋漓尽致

北京这一晚,内娱的人情冷暖江湖地位,在那英身上体现的淋漓尽致

草莓解说体育
2026-08-23 04:45:05
伤得很深!男子打赏女主播近300万,想结婚时才知对方女儿都20岁了:我只顾为爱冲锋,结果她全是假话

伤得很深!男子打赏女主播近300万,想结婚时才知对方女儿都20岁了:我只顾为爱冲锋,结果她全是假话

极目新闻
2026-04-10 15:54:54
雷竞技资讯:BLG干碎AL后圣枪哥笑嘻!语音公开BLG全队都帮他出气

雷竞技资讯:BLG干碎AL后圣枪哥笑嘻!语音公开BLG全队都帮他出气

LPL夺冠了吗
2026-08-24 00:20:22
他从朝鲜回来无职务,授衔时得知自己是海南军区司令,怀疑听错了

他从朝鲜回来无职务,授衔时得知自己是海南军区司令,怀疑听错了

史之韵
2026-06-14 00:48:49
伊朗总统表示:伊朗应摆脱“既非战争、也非和平”状态 该国法尔斯省南部发现7.5万亿立方英尺天然气

伊朗总统表示:伊朗应摆脱“既非战争、也非和平”状态 该国法尔斯省南部发现7.5万亿立方英尺天然气

每日经济新闻
2026-08-23 23:25:44
许家印第二!又一“大佬”跑路被抓,诈骗989亿,超5万人血本无归

许家印第二!又一“大佬”跑路被抓,诈骗989亿,超5万人血本无归

牛牛叨史
2025-02-10 18:02:09
从年头富到年尾! 2027年最不缺钱的三大生肖,看看你上榜没?

从年头富到年尾! 2027年最不缺钱的三大生肖,看看你上榜没?

毅谈生肖
2026-08-23 11:58:10
伊劳拉时代首球!加克波无解世界波,利物浦14年英超首轮均破门

伊劳拉时代首球!加克波无解世界波,利物浦14年英超首轮均破门

奥拜尔
2026-08-24 00:51:58
逆转!武磊王者归来:梅开二度,上海海港4轮不败:超越上海申花

逆转!武磊王者归来:梅开二度,上海海港4轮不败:超越上海申花

足球狗说
2026-08-23 21:33:07
两性心理学:女人尝过床上这两种滋味后,再清醒也会沦陷

两性心理学:女人尝过床上这两种滋味后,再清醒也会沦陷

心理观察局
2026-08-22 06:28:17
咳了三年,肺都“瘪”了,瑞金医生却让她一天就出了院

咳了三年,肺都“瘪”了,瑞金医生却让她一天就出了院

上海交通大学医学院附属瑞金医院
2026-08-21 15:18:04
比缅北凶险100倍!曾经的旅游胜地,如今黄赌毒俱全,乱象随处可见

比缅北凶险100倍!曾经的旅游胜地,如今黄赌毒俱全,乱象随处可见

琅琊财经
2026-07-31 22:02:18
要变天!新首相上台就掀桌,直接废除前任计划!先打给了泽连斯基

要变天!新首相上台就掀桌,直接废除前任计划!先打给了泽连斯基

普览
2026-07-24 05:08:24
2亿多灵活就业人员怒了!原来北大张丹丹才是福利的受益者

2亿多灵活就业人员怒了!原来北大张丹丹才是福利的受益者

财话连篇
2026-08-22 18:44:09
官宣:嫦娥七号错过今年窗口,一场台风为什么可能要让它等近一年?

官宣:嫦娥七号错过今年窗口,一场台风为什么可能要让它等近一年?

翔说航天
2026-08-23 21:22:26
埃尔切vs巴萨:维克托-丘斯特、尼尼奥首发,亚马尔、拉菲尼亚出战

埃尔切vs巴萨:维克托-丘斯特、尼尼奥首发,亚马尔、拉菲尼亚出战

懂球帝
2026-08-24 02:43:30
台湾最新民调出炉,接近70%拒绝两岸统一,赖清德当局自欺欺人?

台湾最新民调出炉,接近70%拒绝两岸统一,赖清德当局自欺欺人?

小玡说故事
2026-08-22 13:55:15
2026-08-24 04:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13828文章数 142724关注度
往期回顾 全部

科技要闻

“英伟达发通知:涨价15%以上”

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

头条要闻

男子凌晨浏览黄色网站深陷"约炮"骗局 21.8万没了

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

王传君的舞台,藏着与乔任梁的过往

财经要闻

加拿大宣布“全额对等报复”美国新关税

汽车要闻

刘苗苗:极狐不押注单一爆款,增长进入体系化阶段

态度原创

游戏
亲子
教育
手机
公开课

《GTA6》泄露视频现实早有原型!老头往车厢里加油

亲子要闻

32岁的全职妈妈的重生之路终篇

教育要闻

南师附中家长会内部数据流出!

手机要闻

vivo X500系列未发先火,2nm天玑9600+索尼大底,周杰伦也来了!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版