![]()
作者|樊雅婷
微信 |FFF111f__
最近,你大概率听过 papi酱的《Oh My God》,也可能在网约车上被动听了一路低沉男声的激情翻唱。
又或许,你还刷到过这样的抽象视频:用一种很魔性的调子唱出聊天记录。
AI 音乐,已无处不在。
尽管之前,短视频平台上就已经充斥着 AI 音乐,但它们仍然属于“音乐”的范畴,目标是用情绪化和洗脑的词曲,搭配视频扩大传播,且不希望让人听出来是 AI 做的。
但现在不一样了,AI 音乐成了人人可套用、可二创、可传播的内容玩法。换句话说,普通人把 AI 音乐玩成了“特效模板”。
这也让 AI 音乐成为一个很“奇怪”的创业赛道。一方面,竞争不如通用模型和 Agent 那么激烈,由此带来的市场关注度有限;另一方面,用户正真金白银地参与共创。
ACE 就是其中的一个特殊样本。
当不少 AI 应用还在盈亏线上仰卧起坐时,ACE 已有 10 万付费用户、月收入 200 万美元,并完成 Pre-B 轮融资。Hans Zimmer、Teddy Riley、Martin Garrix 以及多位格莱美获奖制作人,都在使用它的产品。
据悉,ACE 近日完成新一轮近 4000 万美元融资,本轮由头部战投、CCV、顺为资本、Alphaist 等机构投资,多个老股东超额跟投。至此,ACE 成为 AI 音乐赛道融资额最高的华人创业团队。
这家长期服务专业音乐人、深耕 AI 原生音乐生产工具的公司,正计划在原有业务之外新增一款“玩音乐”的产品,miya.fm,一个主打 AI 音乐新玩法的 Agent。
想了解 ACE,我们先看它的第一个产品——ACE Studio。它究竟凭什么吸引一众知名创作者?
1
ACE Studio,专业音乐人的“高精度武器”
先上成品。
可以听出,这首弦乐声部分工明确,主旋律突出,乐器之间配合得很克制,最终效果很能打。
如此宏大的音乐,和我第一次打开 ACE 的感受完全相反。产品简洁朴素,没有 readme,说明文档藏在右下角小图标里。扑面而来的是一个直接创作的音频分轨界面。
![]()
你可以点击下方中间的按钮使用产品内置的 160 多种免版税 AI 声线和40 多种 AI 乐器,还可以使用声线克隆、随机灵感等 AI 功能。
除此之外,似乎和传统的音乐编辑器没什么太大区别。CEO 郭靖自己也说,这不是一个“不言自明”的产品。
![]()
不过,这套产品思路对专业创作者而言完全成立。他们不需要花哨的页面和冗余功能,只在乎顶级的可控性。所谓可控,是指产品能否在功能层面让创作者完全掌控创作,并精准呈现细粒度表达。
AI 功能在这里的价值,是替代传统音乐制作中高成本、重复性的步骤。
比如开头那段弦乐成品,就是直接把 MIDI 或 MusicXML 文件拖进 ACE Studio,为轨道选择“小提琴”“大提琴”等 AI 音色,它就会按照写好的音符自动演奏。此外,还能开启乐器的 Unison 模式,按需调节每件乐器的音量、时间偏移和立体声宽度。
又或者,只需在钢琴卷帘中输入旋律和歌词,就能立刻听到 AI 演唱。如果某个音或某句歌词听起来不对,可以马上修改,调整后的结果也会即时反馈。
下面这个视频是更全面的功能展示。除一句话生成外,还可以根据任意片段 AI 生成匹配的人声或乐器、对局部音频进行 AI 改编、支持接入 Codex、Claude Code 等 Agent 直接操作工程......
和过去使用“一句话生成一首歌”产品不同,在 ACE 里,创作不再是一种差不多的感觉,而是真正可以做到随心可控、即时反馈。
正是这种对专业创作可控性的追求,让 ACE 在帮助创作者完成细颗粒度表达的同时,积累了高质量的创作数据。反过来,这些用户数据又被用于训练和迭代其音乐模型 ACEx。
互联网并不缺音乐。流媒体、视频网站和公开数据中已有海量完成时作品,模型可以从中学习曲风、结构、音色和演唱方式。但一首最终导出的 MP3,本质上只提供了结果。
在用户授权的前提下,ACE 可以从专业用户的实际创作过程中提取带反馈的 trajectory data:模型生成了什么,用户保留了什么、删除了什么、修改了什么,最终又选择了什么。
另一类数据则关乎 preference ,即同一任务下,用户在不同结果之间的偏好选择。当用户在产品中使用【给我灵感】时,ACE Studio 会提供两首成品。ACE 则会通过一套严苛规则判断这些数据最终能否被保留,例如试听和播放时长、操作步骤数量、最终是否发布、like 数等。
![]()
对模型而言,相比 C 端用户模糊的需求和目的性不强的操作,这类数据能显著提升模型能力。CEO 郭靖也将 ACE Studio 称为“天然的高质量数据工厂”。目前,ACE 已积累约 300 万条轨迹数据和约 50 万组偏好数据。
成效也很直观。ACEx 在部分主流音乐 benchmark 上已处于领先水平,单张 A100 生成一首约 4 分钟的歌曲仅需约 30 秒,单位生成成本约为 Suno v5.5 的五分之一。
对 ACE 来说,由于核心音乐模型自研,ACE Studio 当前毛利率约为 90%。
![]()
1
Miya 把音乐从“作品”变成“嘴替”
前面是阳春白雪,接下来看看下里巴人。老规矩,先上作品。提一句,目前 miya 还处于内测阶段。
这里,我直接用官方最热门的玩法——生成一首 diss 歌曲。
在 miya.fm 官网主页输入你想 diss 的人或帖子,或复制其 X 用户名,点击【cook it】,即可生成一首歌曲。
还记得文章开头的“唱出聊天记录”吗,大部分旋律都很生硬,歌词和曲调之间基本看不出关系,属于生搬硬套。
但这首《搬运工》的主题是讽刺这个博主只会搬运内容,miya 自动生成的歌词和主题十分贴切,高潮部分选择用重复旋律呈现,非常洗脑。最重要的是,它在视觉呈现上和音乐也十分配合,特效字幕更是手拿把掐,属于是生成完就可以直接发社交媒体了。
又或者,你可以使用官方自带的 skill:rap battle。用法是输入两个阵营、两个观点,或者两个人,就能自动生成一首他们 battle 的 rap 歌曲。官方就有一个【京爷 vs 沪爷】的示例。
歌词犀利且“真实”,咬字清晰。这个调性让人忍不住想到《狂飙》里的高启强和安欣。
有意思的是,ACE 专业做音乐出身,如今却选择做普通人的音乐“玩具”,而且切入点选在了 Roast(吐槽),一个高情绪浓度、又天然适合社交传播的切口。
过去,一个人在 X 上看到一条想吐槽的帖子,可能选择在评论区吐槽、做一张 Meme,或转发评论。现在,用户只需输入一个 X 用户名,或直接丢进一条帖子链接,miya 就能根据这些上下文生成一首带吐槽意味的歌。
![]()
Miya 并非 ACE 首次尝试 C 端。
ACE 早期做过虚拟歌姬产品,累计用户超 100 万,峰值日活约 20 万。规模起来之后,团队却发现,更明确的需求来自专业音乐人:他们希望将技术用于真实生产,降低制作时间和成本。
ACE Studio 也由此成型。
对 CEO 郭靖来说,miya 依然处在他的舒适区里。郭靖在创业前曾在水果忍者、神庙逃亡、愤怒的小鸟等全民级休闲游戏做产品增长,是一个很擅长“搞活”的人。这也反映了 miya 和 suno 等“一句话生成音乐”产品最开始就不在一个完全相同的赛道上。
从始至终,从 ACE Studio 到 miya,ACE 要做的路线很明确,就是降低音乐创作的门槛,让音乐成为日常表达方式之一。
如果抖音的 slogan 是用视频记录生活,那 miya 就是用音乐表达生活。
1
押注音乐成为下一种表达方式
很多新内容形态进入大众市场,都不是从“人人突然学会创作”开始。用户不必先成为创作者,再决定使用新媒介。往往是先有足够简单、有趣的玩法,才逐渐习惯用它表达自己。
miya 从 roast 切入是个好选择,但最终要验证的,不是模型能否生成一首好歌,而是普通人是否真的有用音乐表达自己的需求,音乐能否像文字、图片、视频一样,进入日常创作与社交互动。
面向普通用户的 AI 音乐产品已经非常拥挤,除了 Suno、Udio,还有音潮、阿里的 HappyShrimp、网易天音等一批产品。ACE 曾经的优势不会自动转化为胜利。
miya 能否活下来,取决于它能否让用户形成音乐表达习惯,并持续找到新玩法。毕竟,roast 本身并没有太高的壁垒。
不过,即使失败,ACE 依然是不错的专业 AI 音乐公司。如果成功,ACE Studio 就从专业工具变成更大的音乐平台——通过 AI 重塑音乐的生产与消费,成为 AI 时代的 Spotify。
以下是硅星人和 ACE CEO 郭靖的更多对话信息,供大家参考。
硅星人: ACE 一开始做的是专业音乐工具,为什么现在又开始做面向普通用户的 Miya?
CEO 郭靖: 从大的战略方向来说,我们和其他公司没有本质区别,只是路径不同。Udio 也会往 Pro C 走,Suno 也在做 Suno Studio。最后大家会殊途同归。当一个赛道最后大家的产品形态越来越接近,往往意味着行业已经逐渐找到一个 Best Practice。我认为 AI 音乐今天的最优解就是:自己做模型、自己做 Pro C、自己做 C 端。
硅星人: Miya 也是 C 端产品,但看起来和 Suno 的“一句话生成一首歌”不太一样。你们想做的到底是什么?
CEO 郭靖: Suno 的门槛已经非常低了,但它依然是面向“创作者”的。你打开 Suno,它问的是:“今天你想写什么歌?”比如“一首嘻哈混合摇滚的歌”。这仍然是在描述一个创作音乐的需求。
但我们认为,当音乐创作门槛下降得足够低以后,人们最终会发现,音乐可以成为普通人的一种自我表达。比如我的需求可能根本不是“我要创作一首歌”,而是“我今天心情很沮丧”,或者“我想吐槽一个人”。过去普通人不会想到,我可以用音乐表达这些东西。Miya 想做的是这件事情。
硅星人: 为什么你认为音乐比视频更可能诞生下一代 AI-native 内容平台?
CEO 郭靖: 人类历史上,音乐从来没有真正实现过创作门槛的大规模下降。图片、文字、视频都发生了。唯独音乐,在 AI 之前依然主要是专业人士创作的内容形态。但它又和 3D 模型不一样,音乐是每一个普通人每天都在消费、都能够理解、都会被打动的东西。所以这里存在一个巨大的不对称:每个人都听音乐,但历史上只有极少数人在创作音乐。
如果 AI 第一次让所有人都能够创作音乐,为什么不会出现人类历史上第一次真正的“音乐表达爆发”?为什么不会出现音乐的“抖音时刻”?我觉得这个逻辑非常明确。所以我认为 AI 音乐是一个巨大的事情,它未来创造的价值可能是 Spotify 的十倍,甚至可能达到万亿美元级别。
![]()
点个“爱心”,再走 吧
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.