![]()
这项由俄罗斯SaluteDevices研究团队完成的研究,以预印本形式于2026年7月11日发布在arXiv平台,论文编号为arXiv:2607.10387。该工作聚焦于如何让人工智能在处理长达两小时的音频时,不仅能理解内容,还能精准告诉你"那件事发生在第几分第几秒"。
**一、先聊一个你可能遇到过的烦恼**
假设你开完了一场两小时的线上会议,事后有人问:"刚才大家讨论出行计划是在什么时候?"你得重新拖动进度条,一段一段地找。或者你听了一集一小时的播客,想把某个精彩片段分享给朋友,却完全不记得那段话出现在哪儿。
这种痛苦,现有的AI语音助手其实也没解决好。绝大多数能理解音频内容的AI,顶多告诉你"他们讨论了出行计划",却说不清楚这段对话究竟发生在录音的哪个位置。更尴尬的是,一旦录音超过几分钟,这类AI就开始乱报时间——要么给出根本无法解析的奇怪时间格式,要么笼统地说"大概在后半段",毫无精确性可言。
SaluteDevices的研究团队正是盯着这个问题下手的。他们开发了一个名为GigaChat Audio的模型,核心能力可以用一句话概括:听最长120分钟的录音,然后带着精准时间戳回答你的问题。
**二、时间感对AI为什么这么难**
要理解这项研究的价值,得先明白AI在处理音频时面临的一个根本性困境。
当AI"听"一段录音时,它实际上接收到的是一串连续的声音特征片段,就像一卷没有任何标记的胶卷。这卷胶卷本身不会告诉AI"这张照片是第几分钟拍的"——位置信息完全不在胶卷上。所以,当你问AI"第三十分钟发生了什么",它其实需要自己去数数,而数的方式既不直观,也容易出错。
录音越长,这个问题越严重。人类在听一小时的录音时,可以随时瞥一眼播放器上的时间轴,脑子里始终有个时钟在滴答。但AI没有这块表——除非你明确给它装上一块。
研究团队把这个问题比作一个侦探在黑暗中调查一栋大楼。大楼越大,走廊越长,侦探就越容易在没有路标的情况下迷失方向,搞不清楚自己到底在哪个房间。而这项研究的核心思路,就是沿着走廊每隔一段距离放上一块发光的路牌——这就是他们所说的"时间锚点"。
**三、给AI戴上一块"表":时间锚点的设计**
研究团队的解法听起来朴素,但效果显著。他们在把音频喂给AI之前,先把音频切成连续的小段,然后在每一段之间插入一个文字标记,写明当前是录音的第几小时第几分第几秒。这样,AI接收到的不再是一卷无标记的胶卷,而是一叠贴了时间标签的照片。
这些插入的时间标记,研究团队称之为"时间间隔标注"(inter-timing)。默认情况下,每60秒插入一次,格式类似于"00:01:00"这样的小时-分钟-秒写法。到了音频末尾,还会再追加一个最终标注。
这个设计产生了一个意想不到的好效果:即便两个相邻路牌之间隔了一分钟,AI依然能够通过在路牌之间"插值"的方式,推算出中间某个时刻发生了什么。实验结果表明,在默认60秒一个锚点的情况下,AI预测时间点的误差中位数仅为3秒。把锚点密度提高到每7秒一个,误差中位数进一步压缩到1.5秒——精确度已经接近人工标注的水准。
验证这个设计价值的最直接方法,是把路牌全拆了看看会发生什么。研究团队做了一组"去掉所有时间锚点"的对照实验。结果,在20到40分钟长度的录音上,模型的时间定位准确率(用一个叫mIoU的指标衡量,可以理解为预测区间和正确区间的重叠程度)从53.8分直接崩塌到14.2分——跌幅超过七成。在更长的录音上,总结的质量也急剧恶化,时间戳的错误率飙升了近三倍。由此可见,这些"路牌"对AI的时间感来说是不可或缺的基础设施。
**四、路牌要怎么写:时间格式的讲究**
既然路牌这么重要,路牌上的字怎么写,自然也值得研究一番。
研究团队测试了几种不同的时间格式。最标准的是"00:01:00"这种带小时的完整写法。此外还有几种简化版本:只写分钟序号(如"m:0")、只写分钟(如"m:")、或者直接写秒数(如"60 sec")。
结果显示,直接用秒数来表示时间是最差的选择,模型的准确率明显下降。原因可以这样理解:秒数是一个单调递增的大数字,随着录音时间增长,这个数字会越来越大,携带的信息对模型来说变得越来越"抽象"。而"00:01:00"这种分层结构(小时、分钟、秒三层嵌套),反而让模型更容易建立空间感,就像门牌号"3栋2单元501室"比"第8921号房间"更容易让人定位一样。
在所有格式中,完整的"hh:mm:ss"表现最好,达到50.9分的时间定位准确率。而只写分钟序号的格式(如"m:0")也能达到47.1分,在牺牲少量精度的同时节省了大量的文字符号,是一个值得考虑的轻量化替代方案。
**五、路牌多密才算合适:频率与计算量的权衡**
放路牌是要花成本的。每多一个时间标注,AI就要多处理几个文字符号,计算量随之增加。研究团队系统测试了从每7秒一个到每240秒一个的六档密度,看看在精度和开销之间应该怎么取舍。
每7秒一个锚点时,额外增加的符号量占到音频总符号量的16%,但时间定位准确率高达63分,误差中位数仅1.5秒。每60秒一个锚点时,额外符号量只占约1.9%,准确率50.9分,误差3秒。每240秒一个时,额外符号量微乎其微,但准确率跌至31分,误差8.5秒。
这组数据揭示了一条清晰的规律:路牌越密,AI的时间感越好,但每增加一倍密度,收益是递减的。对于大多数实际应用场景,每分钟一个锚点是一个性价比较高的平衡点——既不消耗太多计算资源,又能维持相当可靠的定位精度。
**六、训练数据的配方:长短音频必须混着炖**
模型的设计只解决了"给AI装表"的问题,接下来还要解决"教AI学会看表"的问题。这需要大量的训练数据。
研究团队从一个叫YODAS2的YouTube音频数据集出发,拿到了约24000小时的原始音频。经过英语语言筛选,剩下约16000小时;再经过静音比例过滤,最终保留14000小时的有效录音。这些录音按时长被分成三组:20分钟以内的短录音、20到40分钟的中等录音、40分钟以上的长录音。
有了录音,还需要标注——要告诉AI"这段话说的是什么,发生在哪个时间点"。人工标注14000小时的音频,代价太过高昂。研究团队因此设计了一套全自动的合成数据流水线。
这套流水线的工作方式可以用炖汤来理解。第一步是备料:用WhisperX这个工具把所有音频转成带时间戳的逐字稿,就像把食材切好备用。第二步是切段提问:从每段录音中随机截取约10分钟的逐字稿片段,然后让一个文字生成AI(具体用的是参数量达1200亿的GPT-OSS-120B模型)根据这段文字生成一对"问题-答案",答案中包含事件发生的具体时间区间。第三步是质检:让另一个"验证器"AI把全篇逐字稿拿来核对,检查刚才生成的答案是否在逻辑上自洽、时间上准确,把那些前后矛盾或时间错误的样本剔除掉。
为什么要"切段"而不是直接用全篇?这里有个微妙的偏差问题:如果直接把整段录音的逐字稿喂给AI让它出题,AI天然倾向于对开头部分的内容多出题,因为开头总是最先被"读到"的。这样训练出来的模型,对录音开头的时间定位特别准,对后半段则明显变差。切成10分钟的片段再处理,就能让训练数据在时间轴上均匀分布,消除这种"前置偏差"。
在评估阶段,团队还设计了一个额外的鲁棒性机制:对同一个问题生成五个不同的答案,通过统计这五个答案的时间区间重叠程度来判断问题本身的质量——重叠度低说明这道题本身模糊或有歧义,应当剔除;重叠度高说明答案稳定可靠,保留用于测试。
**七、关键发现:只练短跑的选手跑不了马拉松**
数据配方中还有一个至关重要的发现,研究团队用一个实验清晰地展示了出来(对应论文中的图3)。
他们分别训练了只在短录音、中等录音、长录音上的模型,以及在所有时长上混合训练的模型,然后测试每个模型在各种时长录音上的时间定位能力。结果呈现出一种明显的不对称性。
只在短录音(0到5分钟)上训练的模型,在短录音上表现尚可,但一旦录音超过10分钟,准确率急剧下滑,到了20分钟以上几乎完全失效。只在长录音(40到60分钟)上训练的模型,情况反了过来:在长录音上能维持一定准确率,但对短录音的表现反而比混合训练的模型差。
这个现象可以用运动员的训练来理解。一个专门练百米短跑的运动员,速度训练让他习惯了爆发式奔跑,到了马拉松赛道上完全不适应。反过来,一个长期跑马拉松的运动员,去参加百米比赛也未必跑赢一个全面训练的选手。只有那个在各种距离都做过系统训练的运动员,才能在任意赛道上都保持竞争力。
混合了所有时长数据的模型,在从不到1分钟到120分钟的所有测试长度上,几乎都是表现最好的那一个。这意味着,要想构建一个真正实用的长音频AI,训练数据的时长多样性是不可绕过的前提。
**八、一个小细节:专用时间符号的尝试与代价**
研究团队还做了一个颇为有趣的技术实验:与其用普通文字来写"00:01:00",能不能引入一组专门表示时间的特殊符号,让AI更"高效"地理解时间信息?
他们保留了"hh:mm:ss"的外在格式,但把每个字符替换成专用的时间符号,这些符号的初始含义从对应数字和冒号的文字表示中继承而来。直觉上,这种设计似乎很合理——专用工具应该比通用工具更趁手。
然而实验结果给出了相反的答案。使用专用时间符号的模型,需要在训练数据中加入远比普通文字写法更高比例的时间相关样本,才能达到相同的准确率。具体来说,在训练数据中时间任务样本占比为4.8%时,普通文字写法已经能达到50.9分的准确率,而专用符号在同样比例下只有13.1分;直到训练比例提高到50%,专用符号才勉强追上普通文字在约17%比例时的水准。
这意味着,为了让AI认识这些"新字符",需要付出大量额外的训练代价。而普通的"00:01:00"写法,借助AI在预训练阶段对数字和时间表达已有的丰富理解,反而能够更快被模型掌握。这个发现提示我们,在AI系统设计中,利用好模型已经掌握的知识,往往比引入全新符号系统更高效。
**九、和同行比一比:这块"表"走得有多准**
研究团队在四个测试集上对GigaChat Audio的能力进行了系统评估,并与几个业内知名的竞争对手做了对比。
第一个测试集叫AudioGrounding,包含约980段7到10秒的短音频,主要测试模型能否在一小段声音中精准定位某个声音事件的时间区间。第二个是AMI会议语料库,包含15到50分钟的会议录音,从中抽取了150个问题,测试"这句话是在什么时候说的"——用预测时间区间和正确时间区间的误差来打分,单位是秒。第三个是DCASE音频问答数据集的时间相关子集,包含144道关于"某个声音开始于第几秒"的选择题。第四个是研究团队自己构建的测试集,分别覆盖时间定位、片段描述和带时间戳摘要三种任务,音频时长从不足1分钟到20至40分钟不等。
与Qwen3-Omni这个参数量达300亿的竞争对手相比,GigaChat Audio在长音频上的优势尤为突出。Qwen3-Omni在20到40分钟的录音上,时间定位准确率仅有3.6分(满分100分),而GigaChat Audio达到了53.8分;在AMI会议测试中,Qwen3-Omni的时间误差高达290秒(将近五分钟),GigaChat Audio则是3.5秒。与Gemini 3 Flash这个谷歌的商业模型相比,两者在长音频上的准确率相近(53.8对56.1),但GigaChat Audio是开源的,而且提供了完整的训练数据和代码。
在短音频上,GigaChat Audio的表现稍弱于一些专门为短音频设计的模型,这是合理的——本身就是为长音频优化的系统,把资源更多地分配给了长录音场景。研究团队坦承了这一取舍,并将其纳入后续改进的方向。
**十、除了"几分几秒",还能做什么**
时间定位只是GigaChat Audio能力版图的一部分。研究团队还测试了另外两类与时间紧密相关的任务。
一类叫"片段描述":给AI一个时间区间(比如"从第12分30秒到第15分20秒"),让它描述这段时间内发生了什么。这类任务要求模型不仅知道那个时间段发生了什么,还不能编造不存在的内容。评估方式是让另一个AI充当"评委",对比模型的描述和参考答案,检查事实覆盖率和错误率,给出1到5分的综合评价。在0到1分钟、2到5分钟、20到40分钟三个时长档次上,GigaChat Audio的得分分别为3.63、3.76、3.83,且随录音时间增长不降反升,说明模型对长录音内容的描述能力相当稳定。
另一类叫"带时间戳的摘要":给AI一段长录音,让它自己决定如何分段,然后为每个段落写一份带时间戳的摘要,就像为一本书自动生成目录。这项任务的挑战在于,AI不仅要理解内容,还要做出合理的章节划分决策。评估维度包括时间结构的合理性、内容事实的准确率、错误和矛盾的比率,以及摘要的结构风格。
有一个专门用来衡量"摘要分段是否够精细"的指标值得一提:研究团队计算了摘要中有多少段落的起止时间恰好是整分钟的倍数(比如从12:23到14:23这种正好两分钟的段落)。这类"整点段落"比例越高,说明模型越懒——倾向于偷懒地以整分钟为界限粗略分段,而不是根据内容的自然语义来划分。GigaChat Audio在这项指标上得到16.9%的比率,比起没有时间锚点时的48.4%大幅改善,说明时间锚点的引入确实让模型更愿意做细粒度的时间判断,而不是凑整数。
归根结底,这项研究解决的是一个非常实际的问题:AI怎么才能成为一个真正靠谱的"录音助理",不只是告诉你录音里说了什么,还能精确地告诉你是在第几分钟说的。研究团队找到的答案是:给AI的输入里加上定期出现的时间路牌,同时用覆盖各种录音时长的训练数据让AI熟悉不同场景,这两点缺一不可。
这个方向对日常生活的潜在影响是相当具体的。会议纪要自动生成时,每条记录都能精确标注时间戳,方便与会者事后复盘。播客或课程录音可以自动生成带时间跳转链接的目录。客服电话录音中,问题发生的精确时刻可以被自动捕捉,方便复查。这些场景今天大多需要人工完成,或者依赖精度很差的自动化工具。
研究团队已经将模型权重和训练数据集完整开放,任何人都可以在此基础上继续探索改进。可以思考的方向很多,比如如何把这套时间锚点机制扩展到多语言场景,或者如何在保持准确率的同时进一步减少计算成本。感兴趣的读者可以通过arXiv编号2607.10387查阅完整论文。
Q&A
Q1:GigaChat Audio是如何实现在长录音中精准定位时间的?
A:GigaChat Audio的核心方法是在音频输入中定期插入时间标注(称为"时间锚点"),默认每60秒插入一次,格式类似"00:01:00"。这样AI在处理音频时始终知道当前大致处于录音的哪个位置,从而能够在两个相邻锚点之间进行精确插值,推算出特定事件发生的具体时刻。在60秒一个锚点的配置下,时间预测的误差中位数约为3秒。
Q2:GigaChat Audio为什么必须用长短混合的音频数据来训练?
A:实验发现,只在短音频上训练的模型无法处理长录音,只在长音频上训练的模型在短录音上表现也会变差。只有将各种时长的录音混合训练,模型才能在从几秒到120分钟的所有长度上保持稳定的时间定位能力。这类似于运动员需要系统训练不同距离,而非只专注于某一固定项目。
Q3:GigaChat Audio和Gemini、Qwen等知名大模型相比表现如何?
A:在长录音(20到40分钟)的时间定位任务上,GigaChat Audio的准确率约为53.8分,与商业模型Gemini 3 Flash的56.1分相当,而Qwen3-Omni在同一任务上仅有3.6分。在会议录音的时间误差测试中,GigaChat Audio的误差约为3.5秒,Qwen3-Omni则高达约290秒。不过在短音频任务上,GigaChat Audio略弱于部分专为短音频优化的模型。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.