作者:快思慢想研究院 田丰,每日经济新闻 李宇彤
开篇
![]()
2026年7月20日,世界人工智能大会盛况空前的同时,中国AI产业却上演了一场罕见的"声波对撞"——字节跳动Seed团队发布音频创作模型Seed Audio 1.0,阿里千问同日推出语音合成大模型Qwen-Audio-3.0-TTS。加上此前阶跃星辰主打语境感知的StepAudio 2.5,三条截然不同的技术路线在同一个夏天短兵相接。
这场竞赛的赌注,远超一条语音的音色优劣。语音能力已成为大模型厂商的必争之地——一方面,语音是人机交互最自然的入口;另一方面,它也是内容生产的核心基础设施,更是多模态大模型闭环中不可或缺的一环。竞争的维度,正在从声音质量转向体系化的作战能力。正如Jack Clark反复强调的判断:AI的战略竞争最终会收敛到基础设施层面。语音,正是多模态基础设施版图上最后一块拼图。
一、四个工种的"合并报表":一次推理替代一条流水线
![]()
过去,一段影视级音频的诞生要走完一条漫长的流水线:配音演员录对白,音乐团队出配乐,音效师做拟音,混音师做最终合成——四个工种,四套工具链,四笔预算。
Seed Audio 1.0试图把这条流水线压缩进一次模型推理。
技术上,字节跳动训练了一个通用声学编码器,将人声、音效、环境声视为同一声音场景的组成部分,映射到统一的声学表征中,在Transformer框架下联合建模。模型支持文本与参考音频双模式输入,一条prompt即可编排带有特定情绪的对白、关键音效和环境声,按时间线控制进场节奏,单次可生成约两分钟音频,并支持在此基础上继续延长,同时保持角色音色与表达方式的一致。模型还支持20余个语种的零样本生成,使声音在重音、停顿与情绪等细节上贴合目标语言的表达习惯。
![]()
快思慢想研究院院长、特邀评论员田丰将这种模式形容为音频生产流水线的"合并报表"。在他看来,这和英国AI公司ElevenLabs的路径有本质区别——ElevenLabs的Studio走的是"分别生成、手动组合"的思路,TTS、音乐、音效是三个独立API,用户需要在时间轴上逐轨对齐;Seed Audio 1.0试图用一次推理替代这条链路的前几个环节。
技术上的核心难点有两个:
1.长时音色一致性,即同一角色在跨章节生成中音色不漂移;
2.以及音色与风格的解耦控制,即允许情绪和语速独立变化而不影响角色辨识度。
田丰指出,这两点决定了模型能否从Demo级走向生产级。
字节跳动将其定义为"音频创作模型"而非语音合成模型,名称本身就暗示了野心的边界——交付物从一条语音变成一段完整的声音作品。
二、字节的真正动机:补全内容工厂的"最后一公里"
![]()
Seed Audio 1.0的发布有一条清晰的伏线。
回溯字节跳动的模型发布节奏:2025年1月,豆包实时语音大模型上线,主打端到端语音对话;同年6月,语音播客模型发布,可将文本自动转成双人播客;同年10月,语音合成模型2.0和声音复刻模型2.0推出,重点提升情感表达和复刻精度。进入2026年,节奏骤然加速——2月发布Seedance 2.0(视频生成),4月开放API,6月同时发布Seedance 2.5和Seedream 5.0 Pro,紧接着7月Seed Audio 1.0面世。四个月内,图像、视频、音频的全模态覆盖一气呵成。
组合逻辑清晰得近乎透明:Seedream出图,Seedance出视频,Seed Audio为纯音频场景(有声书、播客、广播剧)独立服务。与此同时,豆包大模型系列的迭代也始终围绕推理能力和多模态理解持续升级。这种全栈布局的优势在于协同——视频生成需要配音,图文内容可以转语音,智能体需要语音交互接口,当所有模态的模型都掌握在手中,跨模态应用的打通效率自然提升。对字节来说,这是TikTok、抖音、番茄小说内容生态的基础设施——番茄畅听2026年第二季度新增"AI主播"入口,AI有声书日产量已突破10万部。
![]()
经济账更直观。一本10万字有声书的AI配音成本不到50元,对比传统真人配音100至300元每千字的行情,成本降到1/20以下。这才是真正的商业驱动力:字节需要的是低成本、规模化的内容填充能力。
但田丰提醒,成本优势的边界需要实测验证。2026年中国声音经济规模约120亿元,AI配音占比约30%,集中在短视频旁白、有声书、课件等对质量容忍度较高的场景。70%的甲方在影视、广告、纪录片等高端场景仍明确优先选择真人声音。Seed Audio 1.0单次生成上限120秒,API定价约0.1875美元/分钟,对于长篇有声书这类长音频场景,按分钟计费的成本结构能否低于传统配音叠加音乐授权、音效库的组合成本,还有待检验。
正如ElevenLabs创始人Mati Staniszewski对红杉资本坦言的判断:企业客户要的是“不犯错”,而不是“有感情”。Seed Audio 1.0的真实商业价值,锚定在中低端内容的规模化生产,高端影视配音短期内仍是真人的领地。
三、3条路线、3种哲学:音频工厂,配音演员,聊天伙伴
![]()
同一天发布产品的阿里千问,瞄准的是完全不同的靶心。
Qwen-Audio-3.0-TTS包含两个版本:面向实时交互的Flash版本,首包延时压到300毫秒级别;面向高质量生成的Plus版本,音频采样率从24kHz提升到48kHz,达到录音棚级别。模型通过细粒度标签(如[gasp]、[giggles]、[angry])和"freestyle"自然语言指令控制语气、情绪和呼吸感,在细粒度标签控制、指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。发布后,阿里千问TTS的Plus版在Artificial Analysis全球语音合成榜单上以Elo评分1237登顶第一。
阶跃星辰则走了第三条路。2026年4月发布的StepAudio 2.5 TTS主打语境感知能力,首次把语境理解引入语音生成全流程——通过全局语境控制定义整段语音的情绪基调、角色状态和场景氛围,能捕捉语调、语速、停顿甚至叹息中的情绪信号并动态调整回应策略。副语言感知是其核心能力,主观评测得分80.41,远超GPT-Realtime-1.5的68.01。发布约一个月后即跻身Artificial Analysis榜单前三。
![]()
田丰用一句话概括了三家的分野:字节做"音频工厂",阿里做"配音演员",阶跃做"聊天伙伴"。
更精确地说,三家的建模粒度和优化目标截然不同。
1.字节Seed Audio的建模对象是"场景",优化目标是多要素编排的协调性,解决批量生产音频内容的问题;
2.阿里千问TTS的建模对象是"单人语音表演",优化目标是单条语音的表现力,解决如何让合成语音更像专业配音演员的问题;
3.阶跃StepAudio 2.5的建模对象是"实时对话中的人",核心是副语言感知,解决AI在实时对话中如何更像真人的问题。
三个不同层级的问题,三条分叉的技术路线,指向的却是同一个产业命题——语音合成的竞争已经进入精细化比拼阶段。
四、为什么所有人都在抢"耳朵":语音是AI从工具变成角色的临界模态
![]()
头部厂商集体加码语音能力,根本原因在于交互入口的争夺。当下,智能助手、车载系统、智能家居都离不开高质量语音交互。
但田丰指出了一个更深层的逻辑:文本交互的AI是一个工具,语音交互的AI才有可能成为一个"角色"。2024年5月GPT-4o发布时展示的实时语音对话能力——0.3秒延迟、自然的语调和情绪反应——第一次让公众直观感受到AI可以像人一样交流。这件事的战略含义远大于技术含义:当AI有了声音,用户对它的心理定位从"搜索框"变成"对话伙伴",使用频率和使用时长会出现阶跃式增长。
![]()
阶跃星辰押注"活人感"、MiniMax做"AI阿祖"英语陪练,本质上都是在赌语音是用户黏性的最大杠杆。田丰的判断是:语音模态对用户留存率的影响,比模型智商提升10分更大。
与此同时,语音也是多模态矩阵中技术链条最长、成本结构最苛刻的一环。在"文本—图像—视频—音频"的完整链路中,语音同时涉及ASR(语音识别)、NLU(自然语言理解)、Reasoning(推理)、TTS(语音合成)四个环节,每个环节的延迟叠加直接决定用户体验。阿里千问TTS的Flash版本将首包延时压到300毫秒级别,StepAudio 2.5将ASR推理速度提升400%、定价骤减90%——这些数字背后映射的是同一个瓶颈:语音模态的推理成本和延迟仍是规模化部署的最大障碍。
五、从云端到耳畔:战场正在向端侧设备迁移
![]()
2026年7月15日,阿里千问宣布将集成至Apple智能设备,为iOS、iPadOS、macOS和visionOS的中国用户提供服务。田丰认为,这一信号意味着语音大模型的竞争正从云端API向端侧设备渗透,对延迟和功耗的要求会更加极端。谁能在端侧做到流畅的实时语音交互,谁就拿到下一代AI入口的门票。
![]()
中国厂商在这场竞赛中有独特的结构性优势。在中文和方言支持上,阿里千问支持20种方言,科大讯飞覆盖粤语、闽南语等20余种方言。但更关键的竞争力来自应用闭环:字节有抖音和番茄小说,阿里有千问接入苹果iOS,MiniMax有海螺AI和全球开发者生态。
ElevenLabs的Mati Staniszewski说得精准:保持专注,始终聚焦在音频上。中国厂商的路线恰恰相反——语音是多模态大模型的一个模块,天然嵌入更大的产品体系。这既是优势(有应用场景兜底),也是风险(语音模块的迭代优先级可能低于文本和视频模型)。
六、资格赛门票:没有声音的AI公司可能出局
![]()
从产业经济视角看,2026年头部厂商密集发布语音模型有一个容易被忽略的背景:AI公司的估值逻辑正在从模型能力转向多模态覆盖度。ElevenLabs估值460亿元人民币,本质上是投资人在为"语音入口"定价。字节在四个月内完成“图—视频—音频”全模态覆盖,阿里用Qwen-Audio-3.0-TTS登顶全球TTS榜单,MiniMax用Speech-02通过Learnable Speaker Encoder实现零样本音色复刻,以1/4的ElevenLabs价格拿下Artificial Analysis双榜第一——这些动作共同指向一个结论:没有语音能力的大模型公司,在下一轮融资中会处于结构性劣势。语音已经从锦上添花变成"资格赛"门槛。
田丰进一步指出,当前格局中有一个被忽视的结构性问题:大多数语音模型仍然是"语言模型+语音编解码器"的级联架构,语音只是文本推理结果的一层"皮肤"。OpenAI免费的Advanced Voice Mode用的还是GPT-4o时代的底模,会在最基本的问题上犯错,与同期付费的Codex模型形成巨大的能力落差。这说明语音模态的模型迭代严重滞后于文本模态。
![]()
阶跃星辰的StepAudio 2.5技术报告明确提出了"共享思维底座"的技术路线——让同一个模型通过不同工作模式完成ASR、TTS和实时对话,押注的正是语音理解与语义推理在同一个神经网络内端到端联合训练的方向。
语音大模型的竞赛还远没到终局,技术路线仍在分化,应用场景也在持续探索。但有一件事已经清晰:单纯比音质的窗口期结束了,价格和融合深度才是下一轮淘汰赛的筛子。
真正的竞争转折点,在于谁能率先实现语音理解和语义推理在同一个神经网络内端到端联合训练——让AI真正"边想边说",而非"先想清楚再说出来"。先跨过这道门槛的竞争者,就握住了多模态时代最稀缺的那张入场券。
![]()
参考文章:《字节跳动Seed Audio、阿里千问TTS同日“亮剑”,语音大模型的竞争从云端API向端侧设备迁移》,每日经济新闻记者 李宇彤
畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》
出版社:人民邮电出版社
作者:田丰
帮助你定位AI当下发展坐标的指南针
帮助你洞察AI未来演进趋势的航海图
通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.