网易首页 > 网易号 > 正文 申请入驻

带你读论文丨 8 篇论文梳理 BERT 相关模型

0
分享至

新智元报道 来源:微软研究院 AI 头条 【新智元导读】BERT 自从在 arXiv 上发表以来获得了很大的成功和关注,打开了 NLP 中 2-Stage 的潘多拉魔盒,随后涌现了一大批类似于 “BERT” 的预训练模型。本文通过8篇论文梳理了BERT相关论文,并分析了BERT在各种任务中的效用。

BERT 自从在 arXiv 上发表以来获得了很大的成功和关注,打开了 NLP 中 2-Stage 的潘多拉魔盒。
随后涌现了一大批类似于 “BERT” 的预训练(pre-trained)模型,有引入 BERT 中双向上下文信息的广义自回归模型 XLNet,也有改进 BERT 训练方式和目标的 RoBERTa 和 SpanBERT,还有结合多任务以及知识蒸馏(Knowledge Distillation)强化 BERT 的 MT-DNN 等。
除 此之外,还有人试图探究 BERT 的原理以及其在某些任务中表现出众的真正原因。以上种种,被戏称为 BERTology。本文中,微软亚洲研究院知识计算组实习生陈永强尝试汇总上述内容,作抛砖引玉。

目录

近期 BERT 相关模型一览

  1. XLNet 及其与 BERT 的对比
  2. RoBERTa
  3. SpanBERT
  4. MT-DNN 与知识蒸馏

对 BERT 在部分 NLP 任务中表现的深入分析

  1. BERT 在 Argument Reasoning Comprehension 任务中的表现
  2. BERT 在 Natural Language Inference 任务中的表现

近期 BERT 相关模型一览
1. XLNet 及其与 BERT 的对比

我们的讨论从 XLNet 团队的一篇博文开始,他们想通过一个公平的比较证明最新预训练模型 XLNet 的优越性。但什么是 XLNet 呢?

  • Segment-Pair+NSP Loss:输入完整的一对包含多个句子的片段,这些片段可以来自同一个文档,也可以来自不同的文档;

  • Full-Sentences:输入是一系列完整的句子,可以是来自同一个文档也可以是不同的文档;

  • Doc-Sentences:输入是一系列完整的句子,来自同一个文档;

  • 结果发现完整句子会更好,来自同一个文档的会比来自不同文档的好一些,最终选用 Doc-Sentences 策略。
    表 4:RoBERTa 在更多训练数据和更久训练时间下的实验结果
    作者还尝试了更多的训练数据以及更久的训练时间,发现都能提升模型的表现。 这种思路一定程度上与 OpenAI 前段时间放出的 GPT2.0 暴力扩充数据方法有点类似,但是需要消耗大量的计算资源。
    3. SpanBERT: Improving Pre-training by Representing and Predicting Spans 图 6:SpanBER 模型框架以及在 GLUE 中的实验结果
    不同于 RoBERTa,SpanBERT 通过修改模型的预训练任务和目标使模型达到更好的效果。其修改主要是三个方面:
    • Span Masking:这个方法与之前 BERT 团队放出 WWM(Whole Word Masking)类似,即在 mask 时 mask 一整个单词的 token 而非原来单个 token。每次 mask 前,从一个几何分布中采样得到需要 mask 的 span 的长度,并等概率地对输入中为该长度的 span 进行 mask,直到 mask 完 15% 的输入。

    • Span Boundary Object:使用 span 前一个 token 和末尾后一个 token 以及 token 位置的 fixed-representation 表示 span 内部的一个 token。并以此来预测该 token,使用交叉熵作为新的 loss 加入到最终的 loss 函数中。该机制使得模型在 Span-Level 的任务种能获得更好的表现。
    • Single-Sequence Training:直接输入一整段连续的 sequence,这样可以使得模型获得更长的上下文信息。

    在这三个机制下,SpanBERT 使用与 BERT 相同的语料进行训练,最终在 GLUE 中获得 82.8 的表现,高于原版 Google BERT 2.4%,高于他们调参后的 BERT 1%,同时在 Coreference Resolution 上将最好结果提高了 6.6%。
    4. MT-DNN 与知识蒸馏
    Multi-Task Deep Neural Networks for Natural Language Understanding
    这篇论文旨在将 Multi-Task 与 BERT 结合起来,使得模型能在更多的数据上进行训练的同时还能获得更好的迁移能力(Transfer Ability)。
    图 7:MT-DNN 模型框架以及训练算法
    模型架构如上图所示,在输入以及 Transformer 层,采用与 BERT 相同的机制,但是在后续处理不同任务数据时使用不同的任务参数与输出的表示做点积(Dot Production),用不同的激活函数(Activation Function)和损失函数(Loss Function)进行训练。
    图 8:MT-DNN 在不同任务之间的迁移能力
    MT-DNN 具有不错的迁移能力。如上图所示,MT-DNN 只需要 23 个任务样本就可以在 SNLI 中获得 82% 的准确率!尤其是 BERT 在一些小数据集上微调可能存在无法收敛表现很差的情况,MT-DNN 就可以比较好地解决这一问题,同时节省了新任务上标注数据以及长时间微调的成本。
    Improving Multi-Task Deep Neural Networks via Knowledge Distillation for Natural Language Understanding

    对 BERT 在部分 NLP 任务中表现的深入分析

    上文的 BERT 在 NLP 许多任务中都取得了耀眼的成绩,甚至有人认为 BERT 几乎解决了 NLP 领域的问题,但接下来的两篇文章则给人们浇了一盆冷水。
    1. BERT 在 Argument Reasoning Comprehension 任务中的表现 Probing Neural Network Comprehension of Natural Language Arguments 表 5:BERT 在 Argument Reasoning Comprehension 任务中的表现
    该文主要探究 BERT 在 ARCT(Argument Reasoning Comprehension)任务中取得惊人表现的真正原因。
    首先,ARCT 任务是 Habernal 等人在 NACCL 2018 中提出的,即在给定的前提(premise)下,对于某个陈述(claim),相反的两个依据(warrant0,warrant1)哪个能支持前提到陈述的推理。
    他们还在 SemEval-2018 中指出,这个任务不仅需要模型理解推理的结构,还需要一定的外部知识。在本例中,这个外部知识可以是 “Sport Leagues 是一个和 Sport 相关的某组织”。
    该任务中表现最好的模型是 GIST,这里不详细展开,有兴趣的读者可以关注该论文。 图 10:模型框架与实验结果
    作者尝试使用 BERT 处理该任务,调整输入为 [CLS,Claim,Reason,SEP,Warrant],通过共用的 linear layer 获得一个 logit(类似于逻辑回归),分别用 warrant0 和 warrant1 做一次,通过 softmax 归一化成两个概率,优化目标是使得答案对应的概率最大。
    最终该模型在测试集中获得最高 77% 的准确率。需要说明的是,因为 ARCT 数据集过小,仅有 1210 条训练样本,使得 BERT 在微调时容易产生不稳定的表现。因此作者进行了 20 次实验,去掉了退化(Degeneration,即在训练集上的结果非常差)的实验结果,统计得到上述表格。
    表 6:作者的探索性实验(Probing Experiments)
    虽然实验结果非常好,但作者怀疑:这究竟是 BERT 学到了需要的语义信息,还是只是过度利用了数据中的统计信息,因此作者提出了关于 cue 的一些概念:

    • A Cue's Applicability:在某个数据点 i,label 为 j 的 warrant 中出现但在另一个 warrant 中不出现的 cue 的个数。
    • A Cue's Productivity:在某个数据点 i,label 为 j 的 warrant 中出现但在另一个 warrant 中不出现,且这个数据点的正确 label 是 j,占所有上一种 cue 的比例。直观来说就是这个 cue 能被模型利用的价值,只要这个数据大于 50%,那么我们就可以认为模型使用这个 cue 是有价值的。
    • A Cue's Coverage:这个 cue 在所有数据点中出现的次数。

    这样的 cue 有很多,如 not、are 等。如上图表一所示是 not 的出现情况,可以看出 not 在 64% 的数据点中都有出现,并且模型只要选择有 not 出现的 warrant,正确的概率是 61%。
    作者怀疑模型学到的是这样的信息。如果推论成立,只需输入 warrant,模型就能获得很好的表现。因此作者也做了上图表二所示的实验。
    可以看出,只输入 w 模型就获得了 71% 的峰值表现,而输入(R,W)则能增加 4%,输入(C,W)则能增加 2%,正好 71%+4%+2%=77%,这是一个很强的证据。 图 11:对抗数据集以及在对抗数据集上的实验结果
    为了充分证明推论的正确性,作者构造了对抗数据集(Adversarial Dataset),如上图例子所示,对于原来的结构:R and W -> C,变换成:Rand !W -> !C(这里为了方便,用!表示取反)
    作者首先让模型在原 ARCT 数据集微调并在对抗数据集评测(Evaluation),结果比随机还要糟糕。后来又在对抗数据集微调并在对抗数据集评测,获得表现如上图第二个表所示。
    从实验结果来看,对抗数据集基本上消除了 cue 带来的影响,让 BERT 真实地展现了其在该任务上的能力,与作者的猜想一致。
    虽然实验稍显不足(如未充分说明模型是否收敛,其他模型在对抗数据集中的表现如何等),但本文给 BERT 的火热浇了一盆冷水,充分说明了 BERT 并不是万能的,我们必须冷静思考 BERT 如今取得惊人表现的真正原因。
    2. BERT 在 Natural Language Inference 任务中的表现
    Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language
    这是另一篇对 BERT 等模型在自然语言推理(Natural Language Inference,NLI)任务中表现的探讨。
    图 12:NLI 任务中 Heuristic 示意图
    作者首先假设在 NLI 中表现好的模型可能利用了三种 Heuristic,而所谓的 Heuristic 即在 Premise 中就给了模型一些提示,有如下三种:
    • Lexical Overlap:对应的 Hypothesis 是 Premise 的子序列
    • Subsequence:对应的 Hypothesis 是 Premise 的子串
    • Constituent:Premise 的语法树会覆盖所有的 Hypothesis

    基于这个假设,作者也做了实验并观察到,MNLI 训练集中许多数据点都存在这样的 Heuristic,且对应的选项是正确的数量远多于不正确。针对这种情况,作者构造了 HANS 数据集,均衡两种类型样本的分布,并且标记了 premise 是否 entail 上述几种 Heuristic。
    实验时模型在 MNLI 数据集微调,在 HANS 数据集评测,结果 entailment 类型的数据点中模型都表现不错,而在 non-entailment 类型中模型表现欠佳。这一实验结果支持了作者的假设:模型过度利用了 Heuristic 信息。
    图 13:模型在 HANS 数据集上的结果分析
    但是作者并不十分确定这种实验结果是什么原因导致的,并提出如下猜想:
    • HANS 数据集太难了?不。作者让人类进行测试,发现人类在两种类型的数据中准确率分别为 77% 和 75%,远高于模型。

    • 是模型缺乏足够的表示能力吗?不。ICLR 2019《RNNs implicitly implement tensor-product representations》给出了一定的证据,表示 RNN 足够在 SNLI 任务中已经学到一定的关于结构的信息。
    • 那就是 MNLI 数据集并不好,缺乏足够的信号让模型学会 NLI。

    因此作者在训练集中加入了一定的 HANS 数据,构造了 MNL + 数据集,让模型在该数据集微调,最终获得了如上图所示的结果。为了证明 HANS 对模型学到 NLI 的贡献,作者还让在 MNL + 上微调的模型在另一个数据集中做了评测,模型表现都有提升。
    总结

    本文总结了 BERT 提出以来一些最新的发展。
    BERT 是一个优秀的预训练模型,它的预训练思想可以用来改进其他模型。BERT 可以更好,我们可以设置新的训练方式和目标,让其发挥更大的潜能。
    但 BERT 并没有想象中的那么好,我们必须冷静对待 BERT 在一些任务中取得不错表现的原因 —— 究竟是因为 BERT 真正学到了对应的语义信息,还是因为数据集中数据的不平衡导致 BERT 过度使用了这样的信号。
    点击阅读原文,即可下载本文内容相关 PPT。
    参考文献: [1] XLNet: Generalized Autoregressive Pretraining for Language Understanding. Yang et al.CoRR abs/1906.08237. [2] A Fair Comparison Study of XLNet and BERT. XLNet Team. https://medium.com/@xlnet.team/a-fair-comparison-study-of-xlnet-and-bert-with-large-models-5a4257f59dc0 [3] Probing Neural Network Comprehension of Natural Language Arguments. Niven et al. ACL2019. [4] Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference. McCoy el al. Corr abs/1902.01007. [5] RoBERTa: A Robustly Optimized BERT Pretraining Approach. Liu et al. CoRR abs/190.11692. [6] SpanBERT: Improving Pre-training by Representing and Predicting Spans. Joshi et al. CoRRabs/1907.10529. [7] Multi-Task Deep Neural Networks for Natural Language Understanding. Liu et al. CoRR abs/1901.11504. [8] Improving Multi-Task Deep Neural Networks via Knowledge Distillation for Natural Language Understanding. Liu et al. CoRR abs/1904.09482.

    特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

    Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

    相关推荐
    热点推荐
    收入暴跌生活拮据,前曼城后卫门迪拍卖世界杯冠军奖杯复制品

    收入暴跌生活拮据,前曼城后卫门迪拍卖世界杯冠军奖杯复制品

    星耀国际足坛
    2026-07-31 23:33:17
    “只顾自己纹眉,不管女儿死活?”14岁女孩生日照,脸上全是槽点

    “只顾自己纹眉,不管女儿死活?”14岁女孩生日照,脸上全是槽点

    泽泽先生
    2026-04-18 22:17:16
    陪玩陪睡只是皮毛!继手伸进裤子后,又一女星自曝,50多都不放过

    陪玩陪睡只是皮毛!继手伸进裤子后,又一女星自曝,50多都不放过

    不似少年游
    2026-06-22 19:32:51
    国家发改委:近期,正在会同有关部门抓紧研究制定扩大内需战略实施方案(2026-2030年)

    国家发改委:近期,正在会同有关部门抓紧研究制定扩大内需战略实施方案(2026-2030年)

    政知新媒体
    2026-07-31 11:59:46
    以媒:以色列一军事基地超百名士兵“抗命”离营

    以媒:以色列一军事基地超百名士兵“抗命”离营

    新华社
    2026-07-31 06:53:01
    美股存储芯片股跳水,闪迪从涨超10%到跌超6%

    美股存储芯片股跳水,闪迪从涨超10%到跌超6%

    21世纪经济报道
    2026-07-31 23:11:19
    员工卡点下班被领导在大群通报批评罚500,当场转1000反问敢不敢收,领导瞬间哑火!

    员工卡点下班被领导在大群通报批评罚500,当场转1000反问敢不敢收,领导瞬间哑火!

    一丝不苟的法律人
    2026-07-29 12:35:47
    皇马20岁21场16球前锋放弃假期,提前归队,想给穆帅留下深刻印象

    皇马20岁21场16球前锋放弃假期,提前归队,想给穆帅留下深刻印象

    福酱的小时光
    2026-07-31 07:48:04
    防暑预警:从8月1日晚上开始,今年夏天不一样,早做准备少遭罪

    防暑预警:从8月1日晚上开始,今年夏天不一样,早做准备少遭罪

    叙说医疗健康
    2026-08-01 05:00:15
    董宇辉称《大话西游》观看不下500遍?知名编剧怒骂:要么学者,要么带货的

    董宇辉称《大话西游》观看不下500遍?知名编剧怒骂:要么学者,要么带货的

    火山詩话
    2026-07-31 08:21:06
    日本熊本地震 便利店杯面扫光但一款无人问津 网民:震灾下更不敢试

    日本熊本地震 便利店杯面扫光但一款无人问津 网民:震灾下更不敢试

    环球趣闻分享
    2026-07-31 14:40:10
    中日关系已逼近危险临界点,东海局势升温,战争不再只是纸上谈兵

    中日关系已逼近危险临界点,东海局势升温,战争不再只是纸上谈兵

    安安说
    2026-06-07 10:57:28
    美国制造的“光鱼”(Lightfish)无人艇抵近“偷拍”我们的052D型驱逐舰

    美国制造的“光鱼”(Lightfish)无人艇抵近“偷拍”我们的052D型驱逐舰

    健身狂人
    2026-08-01 06:41:09
    24小时内连炸三座“野莓”仓库,乌克兰要干什么?

    24小时内连炸三座“野莓”仓库,乌克兰要干什么?

    山河路口
    2026-07-30 20:43:50
    局势失控,外资纷纷撤离,正副总统同台断交,印尼政坛迎来大清洗

    局势失控,外资纷纷撤离,正副总统同台断交,印尼政坛迎来大清洗

    凡知
    2026-07-30 23:12:05
    里奇·保罗谈勒布朗·詹姆斯,未能与文班亚马合作加盟马刺的原因

    里奇·保罗谈勒布朗·詹姆斯,未能与文班亚马合作加盟马刺的原因

    好火子
    2026-07-31 23:02:03
    已致36人死亡6人重伤,日本熊本“黄金72小时”已过:余震300次,近万人仍避难

    已致36人死亡6人重伤,日本熊本“黄金72小时”已过:余震300次,近万人仍避难

    上观新闻
    2026-08-01 06:37:01
    小龙虾,迎来最冷的夏天

    小龙虾,迎来最冷的夏天

    餐饮老板内参
    2026-07-31 15:26:51
    孙颖莎舅舅接机火了!一个动作看哭网友,这才是顶级宠爱!

    孙颖莎舅舅接机火了!一个动作看哭网友,这才是顶级宠爱!

    手工制作阿歼
    2026-08-01 07:27:34
    “莫氏鸡煲”上综艺首轮被淘汰,录节目几天出场仅3分钟!谢霆锋点评:“鸡很好,汤很好喝”

    “莫氏鸡煲”上综艺首轮被淘汰,录节目几天出场仅3分钟!谢霆锋点评:“鸡很好,汤很好喝”

    每日经济新闻
    2026-07-30 18:23:31
    2026-08-01 07:56:49
    新智元 incentive-icons
    新智元
    AI产业主平台领航智能+时代
    15833文章数 66988关注度
    往期回顾 全部

    教育要闻

    初中竞赛题:高频填空

    头条要闻

    国家电网原董事长辛保安被官宣落马 行业会议后被带走

    头条要闻

    国家电网原董事长辛保安被官宣落马 行业会议后被带走

    体育要闻

    欧足联掀桌!因凡蒂诺这次真玩大了?

    娱乐要闻

    百花奖影帝影后即将决出

    财经要闻

    华强北显卡涨价潮 有显卡一周暴涨4000元

    科技要闻

    DeepSeek又更新了,这次梁文锋没放大招

    汽车要闻

    听劝!换回机械门把手,这才是碳基生物该开的车!

    态度原创

    教育
    亲子
    手机
    公开课
    军事航空

    教育要闻

    好好爱自己,才是对教育最长久的坚守

    亲子要闻

    境界压制之生活费,太逗了

    手机要闻

    REDMI K100 Pro系列定档!真机正式亮相

    公开课

    李玫瑾:为什么性格比能力更重要?

    军事要闻

    特朗普否认允许乌克兰生产爱国者拦截弹

    无障碍浏览 进入关怀版