网易首页 > 网易号 > 正文 申请入驻

阶跃发布StepAudio 3系列语音大模型,拿下多个全球第一

0
分享至

IT之家 9 月 15 日消息,今日阶跃正式发布 StepAudio3 系列模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型,目前均已上线阶跃星辰开放平台。

官方称,StepAudio 3 系列分别面向几类核心场景:真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。

IT之家附模型官方详细介绍如下:

StepAudio 3 Realtime:不仅“能打断”,更能理解、思考和行动

今天,越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的,不只是“能不能同时听和说”,而是模型能否在一场持续发生的对话中,边听边理解、判断何时接话,同时完成推理和任务执行。

StepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力,支持原生全双工实时对话。

在 Artificial Analysis Conversational Dynamics 榜单中,StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一,展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”,更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待,以及如何处理用户的临时打断和连续反馈。


与此同时,StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力,是业内评估“原生语音模型”最权威的第三方基准之一。


模型还可以同时理解语义、语气、情绪、副语言和环境声音,让实时交互不只依赖文字内容,而是利用更完整的音频信息理解用户意图。

面对复杂问题,StepAudio 3 Realtime 支持推理与语音生成并行,在快速回应的同时继续组织和深化后续答案。

不仅如此,Tool Call 和长任务可以异步执行,不阻塞当前语音会话。任务运行期间,用户仍然可以继续交流,结果完成后再自然回到当前上下文。

这让 Realtime 语音模型不只是“更自然地聊天”,而是能够在同一场持续对话中完成听、说、想、做。

StepAudio 3 ASR:从听清,到听懂

传统语音识别主要解决“听到了什么”,但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型,不仅需要准确转写声音,也需要理解说话者表达的含义。

StepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合,让语音识别从“辨认声音”进一步走向“理解语境”。

它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别,能够适应不同语言环境和表达方式。同时,依托大语言模型带来的知识理解能力,StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容,在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。

模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入,让真实声音环境下的语音被更准确地识别和使用。

这意味着,ASR 模型不再只是个声音转写工具,而是能够更准确地理解、检索和使用每一段语音内容。在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景,都能精准地完成任务。

StepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中,WER(词错误率) 仅为 1.7%,并列全球第一。


StepAudio 3 TTS:不止朗读,更像真人表达

声音不仅承载文字信息,也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流,一直是语音生成模型的重要方向。

StepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型,致力于让 AI 语音从“准确发声”走向“自然表达”。

模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式,不仅能够生成文字对应的语音,还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现,让合成语音更接近真人说话。

同时,StepAudio 3 TTS 能够结合语义内容理解表达意图,自主调整情绪与语气变化,使声音表达更加符合具体场景。在实时交互方面,模型基于流式生成架构,实现生成与播放同步进行,可满足实时语音应用需求。

StepAudio 3 Gen:人声、音效、环境、音乐,一次生成

传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作,再经过剪辑、对齐和混音,才能形成最终作品。

StepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。

它可以基于自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐。用户只需要描述角色、场景和剧情,无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。

更重要的是,这些声音并不是简单叠加。

StepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音,以及笑声、喘息、停顿等副语言特征进行精细控制,也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。

这意味着,模型不仅在“生成声音”,也开始参与整段内容的声音设计和时序编排。

对于影视、动画、游戏、广播剧、有声书和短视频创作者而言,原本需要素材搜集、多工具协作和大量后期处理的声音制作流程,有机会被压缩到一次生成和持续迭代中。

StepAudio 3 Music:不止生成,更参与创作

音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作,并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo,希望 AI 接着往下完成编曲、改编和制作。

StepAudio 3 Music 因此不仅支持从零生成,也支持基于 ABC 记谱法控制的多轮交互创作。

模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入,让模型围绕已有创作继续生成和完善作品。

与此同时,用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。

模型还对主歌、副歌、桥段、间奏等歌曲结构,以及跨段落的旋律发展、能量变化和演唱表达进行建模,让生成目标不只是“一段好听的音乐”,而是一首结构完整、表达连贯的作品。

尤其在清唱配乐场景中,用户只需要提供一段清唱,模型就可以理解其中的旋律、节奏和情绪,并进一步补充和声、节奏、乐器和完整编曲。

一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫。

这让音乐大模型开始更深入地进入真实音乐生产流程,而不仅仅是一个“一键生成歌曲”的工具。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

抽象派大师
2026-09-30 04:53:56
国足1-2惜败韩国!无缘亚运会决赛,输球原因曝光,1人表现太拉胯

国足1-2惜败韩国!无缘亚运会决赛,输球原因曝光,1人表现太拉胯

侃球熊弟
2026-09-30 14:29:45
53岁患癌农妇烧1平米杂草被罚500元,没钱想用500斤稻谷抵扣被拒

53岁患癌农妇烧1平米杂草被罚500元,没钱想用500斤稻谷抵扣被拒

四海神君
2026-09-27 10:00:10
1979年那场仗,中国人叫"自卫反击",可越南人把这口气憋了47年,憋到近年才有人敢说实话:那28天,高平、谅山两座省城被炸成了月球表面

1979年那场仗,中国人叫"自卫反击",可越南人把这口气憋了47年,憋到近年才有人敢说实话:那28天,高平、谅山两座省城被炸成了月球表面

扶苏聊历史
2026-09-29 17:20:48
特朗普穷疯了吧?异想天开求中国买武器,中方冷眼:你交得出货?

特朗普穷疯了吧?异想天开求中国买武器,中方冷眼:你交得出货?

近史博览
2026-09-29 14:16:08
不上班的人到底靠什么赚钱?

不上班的人到底靠什么赚钱?

康富贵碎碎念
2026-09-30 12:32:10
菲律宾胆子太大,划走中国马欢岛,中方不惯着,海上移动堡垒亮相

菲律宾胆子太大,划走中国马欢岛,中方不惯着,海上移动堡垒亮相

风信子的花
2026-09-30 15:09:30
韩媒xports:裁判容忍少林足球,中国用粗野犯规折磨韩国球员

韩媒xports:裁判容忍少林足球,中国用粗野犯规折磨韩国球员

懂球帝
2026-09-30 17:46:21
白衫黑裤,都市街头的熟女氛围感穿搭

白衫黑裤,都市街头的熟女氛围感穿搭

只要高兴就好
2026-09-30 08:19:07
辽宁女老板徐子婷去世,仅26岁,有6家店,喜欢熬夜重油喝奶茶

辽宁女老板徐子婷去世,仅26岁,有6家店,喜欢熬夜重油喝奶茶

丁隗解说
2026-09-30 10:59:19
信号很明确:楼市不稳绝不退出

信号很明确:楼市不稳绝不退出

余奕阳
2026-09-30 15:22:50
13年前《非诚勿扰》,34岁北京小伙牵手51岁单亲妈妈,如今怎样了?

13年前《非诚勿扰》,34岁北京小伙牵手51岁单亲妈妈,如今怎样了?

代军哥哥谈娱乐
2026-09-30 13:23:24
阴和俊:我国已建成全世界规模最大的教育体系,拥有总量位居世界第一的研发人员队伍

阴和俊:我国已建成全世界规模最大的教育体系,拥有总量位居世界第一的研发人员队伍

政知新媒体
2026-09-29 15:46:44
“就插了几下,没流血,应该没事吧?”一次几十秒的无套插入,感染艾滋的风险到底有多大?

“就插了几下,没流血,应该没事吧?”一次几十秒的无套插入,感染艾滋的风险到底有多大?

天同防艾
2026-08-19 12:27:44
惨烈! 9.14-9.20周销量 比亚迪5.5万 方程豹1.7万 理想1.6万

惨烈! 9.14-9.20周销量 比亚迪5.5万 方程豹1.7万 理想1.6万

音乐时光的娱乐
2026-09-29 06:00:03
1439天,苹果最长迭代产品即将上新了

1439天,苹果最长迭代产品即将上新了

放毒
2026-09-28 18:23:32
仅2小时微塑料就可入侵大脑!医生:家里有这几种物品,赶紧丢掉

仅2小时微塑料就可入侵大脑!医生:家里有这几种物品,赶紧丢掉

白宸侃片
2026-09-30 14:26:08
暴雨、降温!超强厄尔尼诺事件要来了

暴雨、降温!超强厄尔尼诺事件要来了

环球网资讯
2026-09-30 13:31:09
原国家房改课题组长孟晓苏:房价未来肯定会涨,已有牛市抬头迹象

原国家房改课题组长孟晓苏:房价未来肯定会涨,已有牛市抬头迹象

职场资深秘书
2026-09-29 17:49:06
高市早苗再惹事!日本访华团还没走,高市转头就要同对抗中俄朝

高市早苗再惹事!日本访华团还没走,高市转头就要同对抗中俄朝

军情观察家
2026-09-30 14:42:54
2026-09-30 18:28:49
IT之家
IT之家
爱科技,爱这里 - 前沿科技人气平台
370277文章数 607581关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

国足主教练回应不敌韩国:我们被在欧洲踢球的对手压制

头条要闻

国足主教练回应不敌韩国:我们被在欧洲踢球的对手压制

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

华为乾崑ADS 5上车 纵横G700限时权益价30.49万起

态度原创

本地
家居
游戏
亲子
艺术

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

巫师3RE联动2077!有点丑但免费的还要啥自行车

亲子要闻

爸爸去接4岁女儿放学,女儿开心坏了,让爸爸以后天天去接她

艺术要闻

八闽丹青奖 入选油画作品选

无障碍浏览 进入关怀版