![]()
这项由台湾大学与台湾大学人工智能卓越研究中心联合完成的研究,以预印本形式于2026年7月20日发布在arXiv平台,论文编号为arXiv:2607.18529。感兴趣的读者可以通过该编号在arXiv上查阅完整原文。
**一堂好课,到底好在哪里?**
每个人都有过这样的体验:网上找到一段讲解某个知识点的视频,有人看完豁然开朗,有人却一头雾水。同样一段视频,对一个高中生可能刚刚好,对一个完全没接触过相关背景知识的初中生来说却可能像天书。这恰恰说明,一段教学视频的"好坏",从来不是一个绝对的判断——它取决于看视频的人是谁。
随着AI技术的发展,制作教学视频的门槛越来越低,未来会有海量的教学内容涌现出来。如何快速、可靠地判断一段视频"对某类学生是否有效",就成了一个急迫的问题。人工审核既昂贵又耗时,每段视频都要让专家反复观看、对照教学标准打分,这显然无法扩展到大规模场景。
台湾大学的研究团队为此设计了一套名为**EduPanel**的自动评审系统。它不只是一个给视频"打分"的工具,而是一个能根据"目标学生是谁"来灵活调整评价标准的智能审核员。换句话说,同一段视频,EduPanel可以分别评估它对初学者是否合适,对进阶学者是否合适,给出不同的判断。
研究团队还追问了一个更深刻的问题:这套系统如果辅助真人专家打分,会发生什么?专家会因此打得更准,还是会被机器误导?当机器给出错误判断时,专家能识别出来吗?这些问题的答案,对于未来如何在教育评估中部署AI系统,具有非常直接的参考意义。
**一、为什么以前的AI评审系统不够用?**
现有的AI评审工具大多被设计来判断文字质量,比如一篇作文写得好不好、一段回答是否准确。但教学视频的评估要复杂得多,原因主要有两个。
其一,教学视频是"多感官"的内容。一段视频讲得对不对、图示清不清晰、旁白和画面是否配合、节奏快不快,这些都需要同时听、看才能判断。光靠读文字稿,就像只闻到菜香却没吃到菜,无法得出完整判断。现有的AI评审系统大多只处理文字,对视觉内容几乎无能为力。
其二,也是这项研究最核心的洞察——教学质量天然是"因人而异"的。美国斯威勒等学者早在上世纪就发现,同一套教学内容对专家和新手的效果可能截然相反,这被称为"专业度反转效应"。对一个已经有一定基础的高中生来说,详细推导神经网络的数学原理可能是很好的加深理解;但对一个从未接触过相关概念的初中生来说,这段内容很可能造成信息过载,让他对这门学科彻底失去兴趣。现有的评审系统不区分观众,统一打一个分数,显然无法捕捉这种差异。
EduPanel正是为了填补这两个空白而生——它既能"看"视频,又能根据"目标学生画像"来调整评分标准。
**二、EduPanel是怎么工作的?——三个专家协作审核一段视频**
理解EduPanel的工作方式,可以把它想象成一个评审委员会,由三位各司其职的专家组成,共同完成对一段视频的评估。
第一位专家叫"内容分析师"。他负责完整地看完视频,然后整理出一份详细的"内容地图",包括视频的每个时间段讲了什么、屏幕上显示了哪些图表、有没有发现可疑的事实错误或图示错误。比如,他会记录"第2分30秒,黑板上出现了一张细胞分裂示意图,但图中的箭头方向似乎有误"。这份报告是整个评审流程的基础材料。
第二位专家叫"客观评分员"。他不需要亲自看视频,而是基于第一位专家的书面报告,专门评估那些相对客观的指标,比如视频讲授的内容是否事实准确、是否覆盖了教学目标要求的所有知识点。这有点像一位负责核查事实的编辑,不需要亲眼目睹现场,只需要根据记录来判断内容的完整性和正确性。
第三位专家叫"学生模拟器"。他是这三人中最特别的一位。他会同时拿到视频和"目标学生画像",然后以这位学生的视角"亲身"体验这段视频,并打出体验性分数。比如,这段视频的专业词汇对这位学生来说是否太难?前置知识的要求有没有超出这位学生的现有水平?视频节奏对于这位学生的注意力持续时间来说合不合适?这些评估都高度依赖"学生是谁",所以由模拟特定学生身份的第三位专家来完成。
三位专家各司其职、各自输出,最终汇总成一份完整的评估报告。整个评审对同一段视频重复进行三轮,最后取平均分,以减少偶然误差。三位专家都使用谷歌开发的Gemini语言模型作为"大脑",但被赋予了不同的角色和任务。
**三、打分用什么标准?——一份扎根教育学的评分表**
EduPanel并不是随意打分,而是依据一套精心设计的教育学评分标准。这套评分表最初包含24个维度,覆盖了学习科学领域的多个核心理论,包括"逆向设计"(先确定学习目标再设计教学内容)、布鲁姆教育目标分类法(知识、理解、应用、分析等层次)、多媒体学习理论(如何让视觉和语言配合以降低认知负担)、认知学徒制(通过示范和引导让学生逐步掌握复杂技能),以及生成性学习和主动学习(让学生在学习过程中主动加工信息)。
不过,研究团队在正式实验前做了一轮预测试,发现其中有几个维度存在"天花板效应"——无论什么视频,系统几乎总给最高分,根本无法区分好坏,比如"逻辑结构连贯性""与布鲁姆目标的对齐程度""内容脚手架设计"等。这就像用一把只能量到20厘米的尺子去量身高,所有成年人都超出量程,这把尺子自然就没用了。于是,研究团队把这些"失效"的维度排除在外,最终保留了10个有效区分力的维度,用于正式实验。
这10个维度分别是:事实准确性、主题覆盖度、举例与类比的质量、视觉解释效果、视觉设计质量、是否内嵌了检测性问题、是否引导学生主动生成思考、词汇难度是否匹配目标学生、前置知识的要求是否符合学生现有水平,以及节奏是否适合目标学生的注意力时长。
其中,前三个与后三个(即词汇难度、前置知识匹配度、节奏适配)有一个重要区别:词汇、前置知识和节奏这三项是专门针对特定学生来打分的,也就是"对这位学生来说,这段视频合适吗",而不是普遍意义上的好坏。这正是EduPanel最核心的"学生导向评估"理念的体现。
**四、实验是怎么做的?——真人专家与AI的双轮较量**
为了检验EduPanel的实际表现,研究团队选取了12段教学视频,涵盖物理(圆周运动与开普勒第三定律)、生物(有丝分裂与减数分裂)、数学(三角形的各种心)和计算机科学(过拟合与欠拟合)四个学科,每个学科主题各有三段独立制作的视频。每段视频都配有详细的"课程要求文件"和"目标学生画像"。
课程要求文件包含核心大概念、教学主题、目标的布鲁姆思维层次、学习目标和关键知识点。学生画像则详细描述了目标学生的年级、注意力持续时间、已有知识和尚未掌握的知识。比如减数分裂视频的目标学生被设定为七年级学生,注意力持续时间15分钟,已知"生物由细胞组成、细胞会分裂"的日常概念,但尚未接触过染色体结构的专业词汇,也不了解有丝分裂和减数分裂的区别。这种高度具体的画像,让EduPanel能有针对性地判断视频是否适合这位学生。
参与评估的12位真人专家均来自台湾各大学,都至少持有学士学位,并有教学经验,以报酬方式参与研究。整个实验分为两轮。
第一轮叫"盲评"。专家们独立观看视频,按照10个维度各自打分,完全不知道AI系统的评分结果。这是为了获取未受AI影响的纯人类判断。
第二轮叫"AI辅助评估"。同样的专家再次面对同样的视频,但这次每个评分格子里都会显示AI给出的分数和详细理由。专家需要先表态"我同意/不同意AI的判断"(用1到5分表示同意程度),然后可以选择修改或保留自己原来的分数。研究团队特别告知专家:"AI可能会出错,请核实,不要照抄。"
这里藏着一个暗中设置的陷阱:研究团队在第二轮展示给专家的AI评分中,悄悄混入了26个"人工植入错误"。这些错误有的是"过誉"(把一个实际上不太好的维度评得很高),有的是"过贬"(把一个实际上做得不错的维度评得很低),每段视频最多被篡改三个维度的分数,且每个被篡改的分数与AI真实分数相差至少两分。被篡改的评分在外观上与正常AI输出完全一致,专家无法从形式上区分哪些是真实AI输出、哪些是被人工篡改的。研究团队告诉专家有些AI输出可能不准确,但没有说明有多少,也没有标记出哪些是"陷阱"。
这个设计的目的,是测试专家在使用AI辅助工具时是否会盲目相信AI——当AI给出错误答案时,专家能发现吗?
**五、EduPanel的表现如何?——像一个水平中等的人类专家**
研究结果显示,EduPanel的整体评分准确性与一位水平中等的真人专家相当。以"与人类共识的平均偏差"(MAE,可以理解为平均错了多少分)为指标,EduPanel的偏差是0.85分,而12位人类专家的中位偏差是0.87分,两者非常接近。换句话说,在排除AI影响的纯人类判断参照下,EduPanel的表现基本处于人类专家的正常水平区间内。
但细看不同维度的表现,差异相当明显。EduPanel在那些主要依赖"听"(分析旁白文字内容)来判断的维度上表现较好,比如主题覆盖度、举例质量、是否引导学生主动思考、节奏是否适合学生等。而在那些必须"看"才能判断的视觉维度上,比如视觉解释效果、视觉设计质量、事实准确性(因为事实准确性有时需要核查屏幕上的图示),EduPanel的误差明显更大。
更有趣的是,EduPanel在"看"视频的时候倾向于给高分——它打出的分数系统性地偏高,尤其在视觉相关维度上平均高估了0.67分,而文字相关维度上的高估只有0.24分。这种"慷慨偏差"在使用GPT模型重做同一套评估时并不出现,提示这可能是Gemini模型的特有偏向,而非所有AI评审工具的通病。
另外,研究团队还发现了一个令人印象深刻的"互补"现象:EduPanel有时候能发现连所有真人专家都没注意到的错误。比如,在一段讲解减数分裂的视频中,旁白把"DNA复制发生在减数第一次分裂前期"这个说法当作正确的,但实际上DNA复制发生在分裂间期的S期,而非减数第一次分裂前期。12位专家在盲评阶段全部接受了这个说法,其中一位专家甚至在评语中坦承自己没有足够的专业知识来判断这个说法是否正确。EduPanel却准确指出了这个错误。研究团队还系统性地统计,在所有未被篡改的评分格子中,有16个案例中AI的判断比全体专家的平均判断更接近最终权威答案,表明AI确实可以捕捉到人类专家集体忽视的问题。
**六、换一个不同的AI大脑,结果还一样吗?——跨模型稳健性检验**
为了确认这些发现不是某个特定AI模型的偶然表现,研究团队用GPT模型(OpenAI开发的语言模型)重跑了整套评估流程,用抽取视频帧的方式替代Gemini原生视频输入能力,保持其他设置完全一致。
结果显示,两个模型在"整体准确性"上相当接近——与人类共识的偏差分别是0.85和0.87,差距微小。这说明EduPanel的整体评估框架在不同AI大脑下都能稳健运作,不是对某个特定模型的过度依赖。
但"慷慨偏差"的模式完全不同。Gemini模型在视觉维度上高估+0.64分,在文字维度上高估+0.34分,两者之间有明显的差距梯度。GPT模型则几乎没有系统性偏差(视觉维度+0.06,文字维度+0.02),也没有明显的"看视觉内容时更宽松"的现象。唯一一个在两个模型上都稳定出现的偏差,是"事实准确性"(A1维度)上的高估,两个模型都偏高约0.7分左右。
这一发现的含义是:EduPanel这套框架是可迁移的,但具体模型的偏差特征因模型而异,使用者需要了解自己所用模型的偏向,不能完全照单全收。
**七、改变目标学生,评分真的会不一样吗?——学生画像敏感性测试**
EduPanel号称能根据"目标学生是谁"来调整评分,但这个说法是否真的成立?研究团队专门做了一个测试来检验这一点。他们在另外32段教学视频上,分别用"中学生"和"大一学生"两种不同的学生画像来运行EduPanel,然后比较同一段视频在两种画像下的得分变化。同时,一批非专业参与者也在同样两种假设下对这些视频打分,作为人类对照。
结果非常清晰:当把目标学生从中学生换成大一学生时,EduPanel在"词汇难度匹配"维度上的得分平均上升了1.43分,在"前置知识匹配"维度上平均上升了1.47分。方向上,词汇维度有25/32段视频、前置知识维度有23/32段视频的分数变动符合预期方向——大学生基础更好,所以同一段视频对他们来说词汇和前置知识要求就更合适,得分理应更高。
人类参与者的方向判断与AI一致,但变化幅度小得多,两个维度上都只有+0.57分。AI的反应更"敏感",但方向是对的。两者在视频层面的相关性为0.37,其中词汇维度上的一致性最高(相关系数0.41)。
不过,有一个维度的表现让研究团队明确表态"不能声称已解决":节奏适配。当目标学生改变时,节奏维度的得分变化只有+0.36分,而且有一半的视频(15/32)得分变动方向与预期不符,这说明EduPanel在节奏判断上的学生敏感性还很有限,无法可靠地捕捉"这段视频对这位学生来说节奏合不合适"的差异。
这一发现进一步验证了架构消融实验的结论:当把学生画像替换为一个中性的、没有特定学生特征的通用描述时,那三个"学生适配"维度的误差会从0.42分急剧上升到0.90分,而那些客观内容维度几乎不受影响。这说明学生画像确实在这三个维度上起到了关键作用,不是装饰性存在。
**八、拆掉哪个零件影响最大?——系统架构消融实验**
研究团队还做了四组"破坏性实验",每次拆掉系统的一个零件,观察整体表现如何变化。这四种"残缺版"分别是:把三个专家合并成一个(单体模型)、去掉内容分析专家、把学生画像换成通用画像(无学生条件),以及只给文字稿不给视频(仅文字版)。
去掉视频输入,是影响最大的改动。仅凭文字稿,系统的平均误差从0.55分暴增到1.07分,"在1分误差内"的比例从92%跌到72%,整体表现接近乱猜。更有趣的是,之前视觉维度上的高估偏差(+0.67分)彻底翻转变成了低估(-0.45分)——没有视觉内容可以"看",系统就倾向于给视觉维度打低分。这说明,视频内容对于评估是不可替代的,文字稿无法弥补这个信息缺口。
去掉学生画像,影响高度集中在那三个学生适配维度。前置知识匹配的误差从0.75分跳到1.17分,其他学生维度也全面变差,而客观内容维度几乎没变。这完全符合预期:学生画像对客观内容的评估没有影响,但对判断"这段内容适不适合这位学生"至关重要。
把三个专家合并成一个,表面上的平均误差几乎不变(都是0.55分),但有一个问题很明显:单体模型给出的分数"缩在中间",很少打出最高分或最低分,评分分布的标准差只有0.77,而三专家架构的标准差是1.44,更接近真人评审的标准差(1.22)。简单来说,三专家的打分更能拉开好视频和差视频之间的差距,判断力更强。
去掉内容分析专家,对整体平均误差影响很小,但代价是失去了那份详细的"内容地图"——时间戳、知识点列表、可疑的事实或图示问题。这份记录是整个评估过程透明可查的核心证据,没有它,评分依然存在,但无从核实来源。
**九、专家用了AI辅助之后,打分变准了吗?**
在第二轮AI辅助评估中,研究团队剔除了26个被人工篡改的评分格子,只看AI给出真实评分的86个格子。结果发现,专家在看了AI的分数和理由后,整体评分准确性有所提升:平均误差从0.87分下降到0.73分,改善幅度为0.14分,12位专家中有8位明显变准,没有一位变差。
更重要的是,专家之间的分歧也缩小了。衡量评分者一致性的指标(Krippendorff's α,可以理解为"大家判断有多协调")从0.38上升到0.50。同时,每个评分格子上专家间的标准差也从0.98降到0.85。这意味着,专家们在看了AI的分析之后,更容易得出相近的判断,不再那么各执一词。
不过,研究团队特别指出,由于这个实验没有设置"不看AI但再打一次分"的对照组,无法完全排除"第二次打分本来就会更准"这个可能性。改善是真实的,但其中有多少归功于AI辅助、有多少是自然的反复阅读效应,还无法精确分离。AI辅助带来的"一致性提升"则不依赖于参照分数的构建方式,是更稳健的正面证据。
**十、专家能识破AI的错误吗?——植入错误检测实验**
这是整个研究中设计最精巧的部分。当AI给出错误评分时,使用AI辅助工具的专家会不会因此被误导,把正确分数改成错误的?
结果相当乐观。当面对被篡改的AI评分时,专家表示"同意"的平均分只有2.73分(5分满分),而面对真实AI评分时平均同意分是3.85分。这种差异被转换为一个统计指标(ROC AUC),得到0.77的值,意味着在任意一对"一个真实AI评分、一个被篡改评分"的比较中,专家表示更低同意度的77%的情况指向那个被篡改的评分。换句话说,大多数时候专家确实能感知到"这个AI的判断有点可疑"。
具体到不同类型的错误,26%的过誉型错误和40%的过贬型错误被专家明确识别(给出2分或以下的同意度),总体识别率为44%。被篡改程度越大,专家越容易发现:篡改幅度为2分时被发现概率29%,3分时为41%,4分时跳升到55%。
更有意思的是,发现了AI错误的专家,并不一定会修改自己的分数。在整个实验中,专家修改原始打分的比例相当低:面对真实AI评分时只有19%的格子被修改,面对错误AI评分时也只有21%。这两个数字非常接近,说明专家并没有因为遇到错误AI评分就更频繁地改分数。而被AI错误评分"带跑偏"的概率(也就是把自己的正确判断改成AI的错误方向)只有17%,与被正确AI评分"带着走"的有效更新率(16%)基本持平。
这种行为模式揭示了专家的真实反应策略:他们把AI的评分和理由当作一种"参考意见",用心甄别,当觉得AI说得有道理就接受,当觉得有疑问就维持自己的判断——而不是机械地更新或机械地拒绝。这正是研究团队所希望看到的人机协作姿态。
**这一切意味着什么?**
归根结底,这项研究试图回答的不只是"AI能评教学视频吗",而是"AI和人类专家如何分工合作,才能让教育评估又快又准又可靠"。
EduPanel在部分维度上的准确性已经接近人类专家水平,而且它能发现人类专家集体遗漏的错误,这说明它在某些方面确实能补充人类判断的不足。但它在视觉内容判断上系统性地偏宽松,在节奏敏感性上尚不可靠,这说明它还无法单独承担全部评审职责。
更关键的是,专家们在使用EduPanel辅助后打分更准了,而且面对它的错误时,大部分人能识别出来而不是盲目接受。这种人机协作的"最佳使用姿态"——把AI当参考、不当裁判——正是研究团队认为目前最合理的部署模式。
研究团队也坦率地指出了这项研究的局限:实验只用了12段视频和10个评分维度,规模较小,所有结论都是描述性的而非可以大规模推广的统计估计;学生敏感性测试只用了两种学生画像;评分的"黄金标准"是由一位了解AI评分结果的研究员裁定的,这不可避免地引入了一定程度的AI影响。未来的研究需要更大规模的视频库、更严格的盲态裁定流程,以及受控实验来确认AI辅助对专家表现的因果效应。
随着AI生成教学内容的规模持续扩大,"判断这段视频对谁合适"可能会成为和"生成这段视频"同等重要的能力。EduPanel提供了一个可行的方向:让机器承担初步评估,让人类专家聚焦于需要深度判断的地方,同时保持对机器判断的批判性审视。
如果你对这套系统的技术细节感兴趣,完整论文可以通过arXiv编号2607.18529查阅,研究团队也已在GitHub上开源了EduPanel的代码、评分量表、学生画像模板和原始数据。
Q&A
Q1:EduPanel的三个AI专家分别负责什么?
A:三位专家各有分工。第一位"内容分析师"负责完整看完视频,整理每段内容的时间戳和可能的事实错误;第二位"客观评分员"只读第一位的书面报告,专门评估事实准确性和知识点覆盖度;第三位"学生模拟器"同时接收视频和目标学生画像,以那位学生的视角判断词汇难度、前置知识要求和节奏是否合适。三者合作完成一份完整评估报告。
Q2:EduPanel会不会让专家盲目信任AI的错误判断?
A:实验结果显示不会。研究团队故意在26个评分格子里植入了错误的AI评分,结果专家对这些错误给出的"同意分"明显低于对正确AI评分的同意分,区分准确率(AUC)达到0.77,说明大多数时候专家能感知到AI判断有问题。不过专家即使发现错误,也很少主动改分,更多是维持自己的原始判断不接受AI的误导。
Q3:EduPanel在哪些类型的评分维度上表现比较差?
A:EduPanel在需要"看视觉内容"才能判断的维度上表现较差,比如视觉解释效果、视觉设计质量和事实准确性(涉及屏幕图示核查)。在这些维度上,EduPanel系统性地倾向于给高分,平均高估约0.67分。另外,在判断视频节奏是否适合特定学生时,EduPanel的学生敏感性也较弱,方向判断不够稳定,研究团队明确表示不能对这一维度的可靠性作出主张。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.