本文来源于海潮天下(Marine Biodiversity)
https://mp.weixin.qq.com/s/KbJwZkixDIheGL-uBt_NPA
▲2006年6月拍摄到的一头南方定居型虎鲸。图源:NOAA
海潮天下·导读
一个最新研究梳理了东北太平洋超过30年的公开水下声学数据,建成了目前规模最大的南方定居型虎鲸及多类海洋哺乳动物声学数据集。面对海量且噪声极大的未标记音频,该研究团队采用了正无标签主动学习策略,在降低人工成本的同时保证了罕见发声事件的召回率。由此训练出的微调模型在准确率、能源效率上均超越了传统工具,为后续的濒危鲸豚保护和动物语言学研究提供了数据支持。
本文约5900字,阅读约12分钟
文 | 王海诗
出品 | 海潮天下
在加拿大不列颠哥伦比亚省和美国华盛顿州之间的萨利什海(Salish Sea),海底水听器已经连续运行多年。它们记录着这片海域的一切声音:船舶经过时产生的低频噪声、海浪运动形成的背景声,以及南方定居型虎鲸(Southern Resident Killer Whale, SRKW)群体之间复杂的交流信号。
这些声音档案数量庞大,其中隐藏着大量有关虎鲸行为、活动规律和社会交流的信息。但长期以来,科学家面临一个现实困难:录音太多了,可惜人工分析能力又很有限。几十年的连续声学监测数据堪称汗牛充栋,即使由专业人员逐段检查,也几乎不可能完成全面筛查。
![]()
▲萨利什海(Salish Sea)位于东北太平洋,是跨越加拿大不列颠哥伦比亚省西南部与美国华盛顿州西北部的一片边缘海。它的水域范围由温哥华岛和奥林匹克半岛与太平洋外海部分隔绝,是北美最大的河口生态系统之一。上图是萨利什海在地球上的大概位置。
海潮天下(Marine Biodiversity)小编注意到,一项最新研究利用人工智能技术重新整理了这些“沉睡”的声学档案。研究人员提出了一套结合“正无标签学习”(Positive-Unlabelled Learning)和主动学习(Active Learning)的分析方法,从超过30年的公开水听器记录中筛选出了大量的海洋哺乳动物声音,并建立了目前规模最大的南方定居型虎鲸声学数据集之一。
这项研究题为《正无标签主动学习构建用于南方定居型虎鲸解析的数据集》2026年发布在arXiv预印本平台(目前正接受KDD 2026审稿),作者包括Benjamin Nestor、Bing Yao、Jeffrey Moore和Jasper Kanes。研究形成的数据集被命名为DORI(Dataset for Orca Resident Interpretation),共包含5298小时海洋哺乳动物声音,其中919小时来自南方定居型虎鲸。
![]()
(图文无关)▲东北太平洋的南方定居型虎鲸主要以鱼类为食,尤其是偏好大型的奇努克鲑鱼(即春王鲑)。不过这与同区域内以哺乳动物为食的Bigg's虎鲸(过客型虎鲸)形成了鲜明对比。上图是2013年8月17日,华盛顿州圣胡安岛以西的哈罗海峡中,一头来自L群的雄性虎鲸正跃向鲑鱼进行捕食。摄影:Kevin Nichols
01
从数十年水听器记录中
寻找虎鲸声音
南方定居型虎鲸生活在东北太平洋沿岸,是北美最受关注的濒危鲸类种群之一。它们长期活动于美国华盛顿州和加拿大不列颠哥伦比亚省附近海域,社会结构高度复杂、声音交流方式非常独特。
研究团队此次分析的数据主要来自萨利什海及周边东北太平洋海域,空间范围覆盖北纬40°~51°、西经132°~120°之间。研究人员整合了多个长期运行的被动声学监测项目,包括加拿大海洋网络(Ocean Networks Canada)、SanctSound项目、海洋观测计划(Ocean Observatories Initiative)以及OrcaSound社区声学网络等。
其中,Ocean Networks Canada提供了大量长期水听器记录,仅部署时间累计就超过60000个水听器日。由于原始数据规模巨大,研究人员并未直接处理全部档案。他们从中筛选出3143天高价值数据,用于主动学习模型训练。SanctSound项目则贡献了2018~2022年间美国华盛顿外海1788天的声学记录。
为了提高声音识别的可靠性,研究团队还结合了野外观测资料。他们整理了92745条鲸类目击记录,其中855次目击事件发生在距离水听器1公里范围内,为判断声音来源提供了辅助信息。
![]()
收集数据的水听器部署位点。论文出处:Nestor, B., Yao, B., Moore, J., & Kanes, J. (2026).
02
人工标注难以应对海量录音
主动学习寻找有效样本
长期以来,鲸豚声学研究依赖专家人工识别。研究人员需要从声谱图中判断是否存在鲸类声音,并进一步区分物种、生态型甚至不同族群。
对于短时间监测数据,这种方式仍然有效。但随着全球水听器网络不断扩展,海洋声学档案规模已经达到人工难以处理的程度。
此次研究采用的正无标签主动学习方法,针对的正是这一问题。
传统机器学习通常需要大量已经人工标注的数据进行训练,但在海洋声学数据中,研究人员面对的是另一种情况:大量录音没有经过确认,既不能简单认为“没有动物”,也不能直接作为训练样本使用。
研究人员将已经确认包含虎鲸声音的片段作为“正样本”,同时保留大量未标记数据。算法根据当前模型表现,不断筛选最有价值、最需要人工确认的新样本,再利用这些反馈优化识别能力。
研究团队比较了不同主动学习策略,包括选择模型最有把握的样本,以及选择模型最不确定的样本。结果显示,将两种策略结合的混合方法,在提高数据发现效率方面表现更好。实验过程中,每轮人工标注500个5分钟音频片段,用于持续优化模型。这种方法减少了研究人员在大量无效录音中的筛查时间,使长期声学档案具备了进一步开发利用的可能。
▼ 海潮天下·往期相关报道:
仅存数十头!科学家通过声音追踪“消失”的北太平洋露脊鲸
深海中的“狼来了”!当声呐成为鲸鱼的梦魇
深海观测设备开始“自己思考”?低功耗AI让水下监测摆脱通信和能源束缚
![]()
(图文无关) ▲2020年6月15日,由无人六旋翼飞行器拍摄的南方定居型虎鲸群体在捕食、分享鲑鱼的场景。图源:NOAA
03
用AI语音模型来识别虎鲸声学特征
这个研究中的另一项技术探索,是利用人工智能语音模型处理鲸类声音。
研究人员先是对原始录音进行标准化处理,将音频转换为无损FLAC格式,并切分为5分钟片段,再重新采样至32kHz。随后,他们利用Whisper语音模型的编码器提取声音特征,将复杂的声波信号转换为计算机可以识别的特征表示。
Whisper模型最初用于人类语音识别,但研究人员发现,大规模声音模型学习到的声学特征,同样可以帮助分析非人类动物的声音。
研究团队进一步比较了多种现有海洋哺乳动物声音分析工具,包括PAMGuard、ROCCA和Animal-Spot等。测试结果显示,经过训练后的Whisper模型在多个独立数据集上具有较好的识别性能。
在计算效率方面,研究人员发现,使用单个消费级GPU,在一天计算时间内即可处理接近一年规模的32kHz被动声学监测数据。这就为未来处理更大规模海洋声音档案提供了技术基础。
最终形成的DORI数据集中,包含5298小时海洋哺乳动物声音,其中919小时来自南方定居型虎鲸。此外,研究团队还整理了2484小时虎鲸声学数据,用于不同生态型之间的识别分析。
这个研究覆盖的虎鲸生态型包括南方定居型虎鲸、北方定居型虎鲸、Bigg’s过客型虎鲸、以及远洋型虎鲸。
不同群体的虎鲸,有着各自独特的声音传统。南方定居型虎鲸的识别主要依据特定脉冲叫声类型,而Bigg’s过客型虎鲸则具有不同的声音特征。研究人员利用这些声学差异,建立了自动化分类模型。
利用新的数据集,研究人员还发现,部分南方定居型虎鲸活动此前并未被传统调查记录。这个研究估计,在研究区域和时间范围内,至少有20.8%的南方定居型虎鲸活动日未被现有记录捕捉,其中超过60%的遗漏事件发生在7~9月。这些结果说明,长期被动声学监测数据中可能隐藏着大量尚未被发现的生态信息。
▼ 海潮天下·往期相关报道:
AI能否成为BBNJ协定信息交换机制的“助手”?新研究给出了谨慎答案
效率提升132倍!AI自动识别野生动物,科研人员终于不用熬夜数斑点了
野外相机拍了上百万张照片后,AI开始接管生态学家最耗时间的工作
![]()
(图文无关)▲2015年9月11日,飞行器拍摄的航拍画面显示,9个月大的南方定居型虎鲸J50正与母亲J16在水中游动。这类跨代个体的行为与社群声学特征是评估濒危种群生态健康的重要样本。摄影:John Durban (美国国家海洋渔业局)
04
海洋声音档案
成为新的生态研究资源
鲸类高度依赖声音进行交流、导航和社会互动,因此声学监测一直是研究其行为的重要手段。但过去,数据规模始终限制着研究深度。
DORI数据集的价值,在于它将长期积累的水下声音记录转化为可以进一步分析的开放数据资源。研究人员未来可以利用这些数据研究虎鲸不同族群之间的声音差异、长期声学变化趋势,以及声音交流与社会结构之间的关系。
研究团队也指出,这一方法仍存在局限。水听器布设位置受到成本和环境条件限制,因此数据并不能完全覆盖虎鲸活动范围。同时,32 kHz采样率适合分析虎鲸脉冲叫声和哨声,但对于部分低频鲸类声音可能不足。将这一技术应用于其他鲸类,还需要根据目标物种的声音特点进行调整。
随着全球海洋观测网络持续积累数据,越来越多这类长期保存的声学档案正在等着拿出来重新分析。人工智能带来了一种新的数据处理方式,使科学家能够从过去几十年的海洋声音中发现更多有关鲸类行为和生态变化的信息。
![]()
01
南方定居型虎鲸
南方定居型虎鲸(Southern Resident Killer Whale, SRKW)是生活在东北太平洋沿岸的一类虎鲸生态型,主要分布于美国华盛顿州、加拿大不列颠哥伦比亚省附近的萨利什海及周边海域。该群体具有高度社会化结构,声音交流方式独特、家族关系稳定。与过客型虎鲸(Bigg’s/transient killer whale)不同,南方定居型虎鲸主要以鱼类为食,尤其依赖鲑鱼资源。由于猎物减少、船舶噪声增加、污染等因素影响,该种群长期面临保护压力,是北美海洋哺乳动物保护的重要研究对象。
南方定居型虎鲸长期生活在东北太平洋沿岸,是全球受到高度关注的濒危鲸类群体。根据鲸鱼研究中心的年度统计数据,这个珍稀族群目前仅存76个个体(分布于J、K、L三个家族群中)。它们严重依赖特定的鲑鱼作为食物来源,加上人类活动带来的海洋噪声和环境污染等多重威胁,该族群的生存状况极其严峻。
细心的朋友可能注意到,近年很多重磅研究是关于南方定居型虎鲸的。它们之所以在鲸类研究中占据极为特殊的地位,关键在于其无与伦比的科学研究密度、详尽程度。作为全球受关注度最高、研究最透彻的海洋哺乳动物群体之一,科学界针对这一族群开展了长达数十年的持续追踪。例如,自1970年代初期起,相关机构对该族群展开了长达50多年的年度全口径普查与个体照片识别研究,积累了覆盖全部核心成员的详尽谱系与生活史档案。在学术文献与数字化监测方面,研究人员依托长达30多年、总量超过26万小时的海量历史水听器档案,以及数万条目击记录,产出了数百项关于其行为、声学方言、捕食生态及人类干扰影响的专业研究成果。这种以整个野生族群为单位、精确到每一头个体生命轨迹的高强度科学追踪,在全球野生动物保护史上是极为罕见的。
02
正无标签主动学习
正无标签主动学习(Positive-Unlabelled Active Learning, PU Active Learning)是一种机器学习方法,用于解决训练数据缺少人工标注的问题。作为一种机器学习范式,其理论根基与核心框架最早可追溯至计算统计学和半监督分类领域。在现代机器学习中,该方向的奠基性工作之一是加州大学圣迭戈分校(UCSD)的学者查尔斯·埃尔坎(Charles Elkan)和基思·诺托(Keith Noto)于2008年发表的经典论文《Learning Classifiers from Only Positive and Unlabeled Data》,诞生的初衷是为了解决现实世界中“负样本极难获取、不可靠或成本过高”的痛点。例如在医学诊断、欺诈检测、基因预测以及本文涉及的海洋声学监测中,研究人员往往只能确凿地收集到一部分目标对象(正样本),而面对海量的未知数据(未标记数据)时,无法直接判定其中是否包含未被发现的正样本或纯粹的负样本。
具体到这个鲸豚案例中,在传统人工智能训练中,模型通常需要大量明确标记的数据,例如“这是虎鲸声音”、“这不是虎鲸声音”。但在长期海洋声学监测中,大部分录音没有经过人工确认,属于未知数据。该方法将少量已经确认的目标样本作为“正样本”,同时保留大量未标记数据,让算法主动选择最有价值的样本交给研究人员确认,再不断优化模型。在本研究中,该方法帮助研究人员从数十年的水听器档案中筛选南方定居型虎鲸声音,大幅降低人工标注压力。
03
被动声学监测
被动声学监测(Passive Acoustic Monitoring, PAM)是一种在目标区域内部署记录设备并不加干预地持续收集声音数据的技术。在海洋生物学研究中,该技术能够避免研究船只对野生动物自然行为的干扰,从而长周期、大范围地记录海洋哺乳动物的声学活动。
与传统视觉调查依赖船只搜索不同,被动声学监测可以在较长时间尺度上连续收集数据,特别适用于研究深潜鲸类、夜间活动动物以及难以直接观察的海洋生物。在鲸豚研究中,水听器记录的声音信息可以用于判断物种是否出现、分析不同鲸群的声音特征、研究迁徙、觅食和社会交流行为,等等。
![]()
读而时思之~
过去几十年,全球水听器网络积累了大量连续海洋声音记录,但由于人工分析成本极高,其中相当部分数据长期处于未开发状态。这项研究探索了一条解决海洋生物声学“大数据困境”的新路径,它一个比较有价值的地方,在于把人工智能、大规模生态观测、动物交流研究和保护决策连接起来。。为拓展思路,让我们一起来探索一下,思考几个问题。没有标准答案,仅供启发思考用。
【Q1】长期以来,鲸豚种群评估主要依赖船基调查、航空调查和有限的被动声学监测。这个研究显示,过去几十年积累的大量声音数据中,可能隐藏着未被发现的动物出现记录。所以一个基础性问题是,你觉得未来种群评估是否还应主要依赖“当下采集的新数据”,还是应重新系统分析全球已有的历史观测档案?如果人工智能能够从沉睡的数据中恢复过去几十年的生态信息,那么许多关于种群下降、分布变化和栖息地利用的判断,是否需要重新审视其数据基础?换句话说,是否得重新定义一下野生动物种群监测的证据体系?
【Q2】目前,机器学习在鲸豚研究中的主要应用仍集中于声音检测和物种分类,但这可能只是第一步。鲸类声音包含个体身份、社会关系、环境适应以及群体文化传递等复杂信息。你觉得,未来AI有没有可能会从大规模声学数据中发现人类尚未认识的鲸类交流规律?比如说,不同鲸群之间的声音差异是否类似于“文化方言”?声音结构变化是否能够反映社会压力、资源变化或种群健康状态?
【Q3】过去几十年,海洋保护科学最大的限制之一是数据稀缺,研究人员往往因为缺少长期、连续、大尺度观测而无法准确判断生态变化。但随着水听器网络、遥感、环境DNA和人工智能的发展,以后科学家面对的可能不再是没有数据,而是怎样去从海量数据中提取真正具有生态意义的信息。这意味着保护生物学的方法论可能得有所调整——未来的核心竞争力可能会变成建立能够解释复杂生态信号的理论框架。你觉得在生态数据的获取能力被AI大幅提升之后,将来海洋保护科学是否需要从“数据不足时代”进入“数据解释时代”?
【Q4】这些年我们中国学者在鲸豚声学识别和深度学习这些方向上确实做得很亮眼,成果不少。但若往深里看,在应对水下低频、高噪和复杂混响环境时,手里好像还缺一个量身定制的原生基础大模型。从长远发展来看,你觉得,未来有没有必要咬咬牙,去搞一个完全自主知识产权的海洋声学大模型?还是说,更好的策略是,把精力放在算力优化和主动学习的配合上,在现有的轻量化架构里把效率和实用性压榨到极致?
【Q5】声学档案的大规模沉淀为生态研究提供了基础,但传统模式下海量音频中有效信号占比极低,导致人工筛查成本高昂。海潮天下(Marine Biodiversity)小编注意到这个研究里面,在实验过程中,每轮人工标注500个5分钟音频片段,用于持续优化模型。这种方法减少了研究人员在大量无效录音中的筛查时间,使长期声学档案具备了进一步开发利用的可能。其实,这种技术路径对中国科研界具有现实参考价值。中国在海洋生物多样性保护、江豚、及大型鲸类监测等领域积累了大量水下被动声学监测数据,但同样面临标注人力短缺、数据利用率偏低的问题。你觉得有没有可能,引入智能算法与主动学习框架,盘活海量历史监测数据,并且避免闭门造车、一次分析之后束之高阁、在中国科研领域中推动更大范围的数据共享与协同分析?
本文参考资料
感兴趣的海潮天下(Marine Biodiversity)读者可以参看该研究的全文:
Nestor, B., Yao, B., Moore, J., & Kanes, J. (2026). Positive-Unlabelled Active Learning to Curate a Dataset for Orca Resident Interpretation. arXiv:2602.06734.
https://arxiv.org/abs/2602.09295
![]()
声明:1)本文仅代表资讯、以及作者本人的观点;仅供读者参考,不代表平台观点。2)本文已经开启“快捷转载”,欢迎微信公众平台转发;3)欢迎专家、读者不吝指正、留言、赐稿!欢迎有理有据的不同意见,激发思考、百家争鸣。
资讯源 | Nestor, B., Yao, B., Moore, J., & Kanes, J. (2026)
文 | 王海诗
排版 | 卢晓雨
时间 | 2026年8月
联系小编 | editor@oceanbiodiversity.cn
![]()
▼海潮天下·往期推荐
❀首个全球“毒地图”发布!虎鲸、海豚体内永久化学物正在飙升,太平洋最严重
❀保持1000米距离!加拿大为虎鲸划下的生存“警戒线”,观鲸请注意
❀鲸类病毒多样性再拓展,首次在短肢领航鲸和虎鲸中发现2种新的环状病毒
❀“鲨鱼出没”!西澳海滩七头伪虎鲸搁浅,游客被警告要小心
❀“恐惧生态学”?捕食者压力导致大规模的海豚搁浅
❀虎鲸捕鱼时为何“喋喋不休”?科学家破解声音密码
❀首次记录!智利北部虎鲸成功猎杀海豚,还慷慨分享战利品
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.