![]()
2026年世界杯结束了,但有件事可能很多人没注意到,这是世界杯历史上,中国云厂商第一次大规模、成体系地承包了全球范围的赛事直播技术服务。
四大洲、17个国家和地区,亚太地区三分之二的官方授权直播平台,背后跑的都是腾讯云。决赛那天晚上,全球各平台加起来最高在线突破5000万人,最高带宽峰值比上届还涨了20%。
上届世界杯的时候候,海外OTT市场基本是AWS、Akamai这些老牌厂商的天下。
但是在这届世界杯上,从孟加拉国的Rockstreamer,到马来西亚的Unifi,再到拉美的哥伦比亚、阿根廷、智利 ,这些国家的球迷打开手机看世界杯,画面从信号采集、转码、分发到最终播放,整条链路跑的都是腾讯云的技术。
同时,这届世界杯也采用了大量的AI技术,以实现4K超分画质、毫秒级延迟、秒级切片、多语种AI同传、智能横转竖、个性化广告等等。
把这一切串起来的,是腾讯云今年6月刚发布的一个新品牌——腾讯云WAND。
根据腾讯云的官方说法,WAND相当于音视频多模态领域的“Harness”。
腾讯云副总裁、腾讯云国际产品技术负责人李郁韬表示,今天生成式人工智能发展很快,但多媒体领域的应用面临很多挑战。
![]()
图注:李郁韬
很多产品和应用用单一的大模型很难解决所有问题,特别是在直播、点播、媒体创作以及多媒体互动这些领域,受限于网络传输、视频画质、用户体验以及各种特性的叠加,单一模型只能解决部分问题。
李郁韬认为,不管是最终用户的体验还是企业客户,最终需要的是一整套由 AI 大模型赋能的生产流程和用户交互流程,来解决原来满足不了的体验和质量问题。
所以腾讯云提出,在多媒体领域同样需要用 Harness 的思想,把所有模型串起来。
这中间不仅包括大语言模型,也包括多模态模型,甚至还包括一些小参数量的画质提升模型、小参数量的应用模型。
WAND下面串了6大自研媒体专用模型:用于编解码的WAND-Codec+、用于画质增强的WAND-Enhance+、用于无痕擦除的WAND-EraseVibe+、用于内容生成的WAND-Create、用于理解内容的WAND-Sense、以及专门用于音频的WAND-Sonic,再加上60多项AI能力,从生成、理解、处理到编码,全链路覆盖。
李郁韬表示,多模态Harness要解决的核心问题有两个:第一,今天有了大模型的思想和应用落地案例之后,很多音视频场景的体验都值得重新做一遍;第二,大模型还在一步步发展,未来会有更多更强的模型出来,怎么快速把这些模型应用到企业级的生产服务里,让最终用户感受到最新的大模型体验。
李郁韬表示,腾讯云做这件事的第一个优势,是团队和这条产品线一直在音视频领域深耕,产品线已经孵化接近十年,里面有很多直播云服务、点播云服务、媒体处理云服务,甚至一些音视频实时通信的云服务,都已经服务了非常多的企业客户和最终用户。
第二个优势是对音视频生产领域以及用户互动的需求有比较长时间的积累和洞察。
团队知道用户需求背后到底代表什么本质要求、里面存在什么挑战,以及今天市场上通用的大语言模型、多模态模型存在哪些优势和短板。
腾讯云音视频总经理李志成回顾了三届世界杯的历程。
他表示,2018 年那届,当时国内互联网赛事版权还没完全开放,客户不太相信一个互联网公司能把世界杯直播做好。大概提前一周,腾讯云团队从拉网线、搭服务器开始,一周之内全部搞定。
![]()
图注:李志成
那天晚上直播一开,全网都在说这届画面怎么这么好,腾讯云就在国内赛事直播圈站住了脚。
到了2022年,央视频先把版权开放到互联网,腾讯云提供了端到端的解决方案。那一届首创了行业超低延时快直播,从拉信号到用户观看,延迟不到800毫秒。
李志成表示,今年这届最大的变化在海外。
以前中国云厂商做海外音视频,最大的痛点是媒体协议不对齐。
海外OTT行业发展了几十年,有一大堆媒体协议、传统设备,你不支持,客户就切不过来。李志成称,腾讯云出海七八年,干了一件很笨但很重要的事,把海外OTT行业里的媒体协议基本上全部支持了。
前文提到的孟加拉国Rockstreamer正是如此,原来用的是别家方案,用户体验很差,开播也卡。找到腾讯云之后,5天时间就全部切过来了,跑起来非常流畅。
因为协议是对齐的,迁移成本几乎为零。
李志成随后说到,不管是短剧、漫剧还是电商、工具类,只要是出海就都有一个共性。前期可能关注效果、关注影响力,但到中后期都很关注ROI。
李郁韬认为,现在市面上所有的多模态模型,没有哪一家是很稳定的,很多模型都会出现bad case,比如生成的视频里有乱码,做转场的时候有异常。
另外,很多片段拼出来的时候,听起来语音不连贯,声音也不统一。
李郁韬介绍,腾讯云的Harness工程,本质上就是在不断重复运行—规划—检查—修复。
比如做翻译时,有一个模型可以做翻译;翻译出来结果之后,其他平台就直接给你一个翻译结果,但腾讯云会再用大模型的多模态去做理解,判断这个翻译在这个场景下对不对、有哪些不对,如果不对就再去做修复。
这样翻译场景的效果稳定性,从客户来看能提升大约20%。
李郁韬表示,国内头部短漫剧客户现在应该90%都用了腾讯云的方案。
“客户选择腾讯云,是因为针对这种场景做了很多Harness工程,效率相对更高、ROI成本更低。不用腾讯云也有别的解决方案,但用那种独立方案,整个生产成本会很高;腾讯云给的,从成本和效果综合看是一个最优选择。”李郁韬说到。
李郁韬认为,云厂商在多模态领域的竞争,未来会围绕三个关键方向展开。
第一个方向是多模态的训练和算力。
他表示,今天多模态领域挺大比例还投在多模态的理解和生成上,在很短暂的未来,会有大量端到端的语音交互、端到端的视频生成。
一句话或多个参数去生成更长的视频,这些都会进一步发展,对算力的要求、对云厂商本身基建的投入都很大。
第二个方向是存储和数据积累。
多媒体相对于文字,存储量要求更高,对存储稳定性、数据清洗和获取的要求也不一样。
大量视频需要在预训练之前做数据清洗和处理,不同模态的数据要放在一起、训练前要做的处理都跟语言文字类不一样。
第三个方向是应用生产端。
云服务商提供更面向最终客户的推理服务、综合处理的应用能力,是未来影响云厂商能否被客户选择的重要因素。
李郁韬说,“这一点对腾讯云来说非常重要。腾讯云在全球已经有大量音视频客户基础,在国内也有大量生产和直播客户,对于创新趋势中产生的需求,怎么在运营端用很好的方式帮客户满足,是未来要进一步加强的地方。”
李郁韬还提到了边缘推理的想象空间。
他表示,未来大家自己面向具体场景的多模态模型,能方便地部署在离用户最近的边缘端,以低时延方式提供端到端交互、实时视频生成、实时视频直播的服务,在里面加上足够成熟的智能化——这可能是未来腾讯云跟着整个产业发展,能贡献给市场的一个重要机会。
李郁韬表示,从QQ时代的实时视频到今天WAND的AI,一脉相承的是用户对音视频体验的追求。
他回忆说,“QQ时代做音视频,大家天天纠结怎么支持 480p、720p,怎么把分辨率往上提,怎么在成本和码率之间取平衡,怎么让卡顿率哪怕降低0.1个百分点。今天做 WAND,出发点和关注点其实是一样的——还是在追求更好的用户体验、更高的成本效率。”
李郁韬表示,只是工具变了。以前靠编解码算法、靠网络优化,现在多了 AI、多了大模型、多了 Harness。但底层的逻辑没变:谁能让用户看得更清楚、更流畅、更便宜,谁就赢。
采访原文:
李郁韬:这次世界杯我们自己也是亲历者,中间有很多音视频云服务的话题可以交流。今天我们处在 AI 大模型的时代,很多音视频云服务和业务都围绕这个展开,所以主要想聊两个话题。
一个是整个世界杯直播在全球范围内,我们第一次看到海内外的客户开始大规模使用中国的技术、中国的云服务,来承办世界杯背后的产品和服务;第二个是这次世界杯直播中,很多音视频体验和质量的提升,都依赖于 AI 智能的提升,很多云服务得益于生成式大模型、多模态大模型的技术和应用,在这次世界杯中崭露头角。所以今天我们也会围绕腾讯云音视频最新的解决方案品牌 WAND 做一些交流。
我先花点时间介绍一下腾讯云音视频以及腾讯云国际,方便大家了解背景。腾讯云在过去十年一直比较强调我们在 PaaS 产品解决方案和 SaaS 产品上的独特优势。就像今天我们在用的腾讯会议,如今已是国民级的 SaaS 应用,背后也用到很多音视频技术。
我们在音视频 PaaS 服务上投入非常大,孵化了全球的云直播服务、云点播服务,也包括大家日常在体验但可能不知道的、背后用到的很多音视频转码服务。
最近五年,腾讯云把国际化作为非常重要的战略方向,投入了很多业务资源和基础设施建设,在海外做储备和布局。特别是最近三年,腾讯云国际在海外的增速非常快,都是两位数的增长,在亚太地区取得了非常领先的市场份额。腾讯云音视频在海外同样是腾讯云增速最快的产品线之一。
过去三年我们一直在做 PaaS 服务的国际化,一直在做 AI 的叠加应用。所以在这次四年一次的世界杯直播中,我们刚好经受住了全球的考验,中间也有非常多的惊喜和收获。
志成是这次世界杯直播幕后团队的带头人,整个承接了这次世界杯直播、很多海内外客户云服务保障以及产品化、技术化的工作,同时他也是我们最近三届世界杯直播幕后的技术总负责人。
提问:我看到腾讯云要做多模态领域的 Harness。我想知道,我们是打算做一个开放的平台,比如和外界的一些视频生成模型进行合作,还是主要倾向于打造自己的生态?
李郁韬:这两个我理解应该是一样的,就是合作和生态。因为我们是做 To B 的产品和解决方案,所以生态合作肯定是摆在第一位的战略选择。
其次,我们为什么今天要提出多模态领域的 Harness?我们观察到,在今天生成式人工智能的发展情况下,多媒体领域的应用其实面临蛮多挑战。很多产品和应用,用单一的大模型很难解决所有问题。特别是在直播、点播、媒体创作以及多媒体互动这些领域,它受限于网络传输、视频画质、用户体验以及各种特性的叠加,单一模型只能解决部分问题。所以我们认为,不管是最终用户的体验,还是企业客户,最终需要的是一整套由 AI 大模型赋能的生产流程和用户交互流程,来解决原来满足不了的体验和质量问题。
所以我们提出,在多媒体领域同样需要用 Harness 的思想,把所有模型串起来。这中间不仅包括大语言模型,也包括多模态模型,甚至还包括一些小参数量的画质提升模型、小参数量的应用模型,都会串在里面。这中间存在很多开放性的空间和挑战点。
最大的机会我觉得是:今天有了大模型的思想和应用落地案例之后,很多音视频场景的体验都值得我们重新做一遍。第二个机会点是,今天的大模型还在一步步发展,未来会有更多、更强、更全面的模型出来,那我们怎么快速把这些模型应用到企业级的生产服务里,让最终用户感受到最新的大模型体验——这也是多模态 Harness 要解决的问题。它要不断把最新的模型应用到客户的最前端,那么整套生产流程和工具链条就显得非常重要。中间的挑战点在于:我们如何识别用户的需求,找到能解决需求的模型,修补这些模型天然的一些缺陷,再把最终的服务提供给用户。这是我们作为云服务厂商,特别是音视频 PaaS 云服务厂商,所要追求和解决的挑战。
提问:那您觉得做这种多模态 Harness,腾讯云的优势在哪里?哪些能力很难被复制?
李郁韬:第一个优势点是,我们团队和这条产品线一直在音视频领域深耕。我们的产品线不是今天才有的,已经孵化接近十年,里面有很多直播云服务、点播云服务、媒体处理云服务,甚至一些音视频实时通信的云服务,都已经服务了非常多的企业客户和最终用户。所以我们有非常多的场景去挖掘和应用多模态的模型服务,这是最大的优势点。
其次,我们对于音视频生产领域以及用户互动的需求,有比较长时间的积累和洞察。所以我们知道用户这些需求背后到底代表着什么本质要求、里面存在什么挑战,以及今天市场上通用的大语言模型、多模态模型存在哪些优势和短板——这是我们团队天天都在思考的问题。中间这个 gap,就是我们要去缝合的地方,最终变成一个云服务提供给客户,再由他们变成创新的产品体验提供给最终用户。所以在整个生产链条里,我们是一个不可或缺的角色。
大家可能会想到,今天大语言模型有 Chatbot 这种产品形态,用户天然下载一个元宝就能用。但在多媒体领域,这个链条会变得非常长:比如你做影视剧制作,需要一个编辑工具,在编辑工具里再去用大模型;你用了一个模型,它可能只能生成 10 秒或 1 分钟的视频,那你要生成多个视频、最后拼接起来、形成叙事,它就不是一个通用大模型一句 prompt 对话就能生成最终结果的,跟语言模型的应用存在蛮大差异。里面的链条更长、技术细节更面向生产环境。
所以我们团队找准了这个方向,去年其实就已经开始做这个领域的 Harness 工程。刚好今年生成式视频模型开始变多,大家对 Harness 的概念和理解也变得更加一致,所以我们觉得,我们在做的事情刚好就是多媒体领域的 Harness——跟 vibe coding 其实是同一类型的东西。
所以我们推出了 WAND 这一套解决方案。老师们可以看到,它不仅包括我们自己提出的一些多模态模型,也包括中间用到的一些传统编解码算法所需的转码服务、视频增强等应用,最后呈现给客户的是一个完整的直播服务和视频创作服务。
提问:之前听同事讲,腾讯云成为官方赛事直播支持商背后的云厂商,中间有什么故事?像这种规模的赛事,需要云有哪些比较突出的能力和要求?
李郁韬:其实我们已经支撑了至少三届世界杯了,以前那些故事和心路历程李志成可以再多讲讲。首先我觉得今年世界杯是特别不同的一年。从我作为一个观众的视角看,包括大家热议的佛得角,包括大家追的新晋网红哈兰德,大家在小红书上看直播——它是一个非常好的社交氛围,这跟过去两年特别大的不一样。
我还记得 18 年的时候,世界杯更多还是延续了电视媒体那套运营方式,大家还是以观赛、线上线下一起看球为主;上一届在另一个平台上分发,也是类似的运营模式。但今年一个特别大的不一样,很多赛后的话题作为平台内部社交运营的东西,不断滚动,给大家带来了不少话题感和热度。
第二个特别大的不一样,是我们团队不仅服务了国内最头部的几家世界杯转播方,同时也在海外服务了很多客户,今天我们服务了 17 个国家和地区,作为背后的云直播服务商。这带给我们的感受又不一样:有的国家地区像中国前两三届世界杯一样,是由传统电视媒体或传统运营商做了一个新的 OTT 业务来承办,他们更关注画质、传输稳定性,所以选用了我们;有一些也确实在海外运营一些话题,跟他们自己的球队非常有关系。最大的一个反差感是,在韩国队淘汰之前,韩国市场的服务消耗量挺大的,但他们的队伍止步之后,那边的观众突然就都不看了,这也非常有意思。
李志成:我补充一下以前的故事。我们大概做了三届,从 18 年开始。那个时候中国赛事的版权还没有开放到互联网,当时不太相信一个互联网公司、不太相信腾讯云能把这件事情做好。大概提前一周,我们说去试一下,客户说"我给你一周时间,你去搞"。我们从腾讯云的服务器、拉网线开始,把所有东西全部弄好,最后跑出来了。那天晚上跑出来之后,当时国内互联网上都在说:今天晚上这一届的画面怎么这么好?网上的评价基本上全部定下来了。当时大家就觉得,我们还是可以做到这件事情的。这是 18 年我们开始做,我觉得我们还是有一些差异化竞争力的。
到 22 年,国内的央视频率先把版权开放到互联网,我们其实也是互联网平台在直播、点播这两部分的一个合作伙伴,给他们提供了端到端的解决方案。所以你看 22 年整体的画质是比较好的。今年包括小红书、央视频以及央媒的很多平台,我们也提供了专业的端到端方案。国内的解决方案我们很清楚了。
在这个领域里,我觉得腾讯云是最先提供确定超低延时直播服务和超高清画质支持的。你看今年央视频,它从拉信号到用户观看的延迟不到 800 毫秒;而且不管小红书、央视频,现在基本上都是 4K 画质了,以前只能是 720p、1080p。这个我们基本上都做了。所以在国内,不管从技术还是从客户满意度来说,我们相对还是比较有信心的。
在中国互联网史上流量最大的是去年国家级直播大型直播,那次基本上把国内的互联网带宽资源全部打满了,如果我们不做一些措施——比如在画质、码率、升级等方面做了很多措施——那次大型直播,所有平台,不管视频号等网络平台,还是央视频、CCTV 的频道,观看直播基本上是不卡顿的,比较流畅。今年世界杯的流量还达不到去年那个规模。所以在国内,我们其实不担心会不会有什么问题。
我们最担心的其实在海外。中国的互联网在音视频技术上是比较领先的,海外在音视频方面的技术栈迭代相对较慢。这就带来一个问题:如果我们要接这些海外企业的直播方案,就要把原来那些比较老的设备、老的协议全部支持,不支持的话他就切不过来。海外有这么多传统厂商,包括在 OTT 领域的这些协议,以及广告——他们拿了这么多版权以后,最关注的是怎么把广告的钱收回来。
所以我们花了很多时间。腾讯云出海从 18 年到现在有七八年时间,做了一件很大的事情,就是把海外 OTT 行业里的传统协议基本上全部支持了。所以今天来看,我们跟海外厂商的传统协议基本对齐,这也是腾讯云在海外音视频领域一个比较大的差异化能力:其他厂商要全部支持这些协议,就得把我们前面六七年走的路全部走一遍。所以对客户来说迁移就很简单了。
举个例子,我们最近切了一个孟加拉国的客户,一个叫 Rockstreamer的 App。他原来用别的方案,上线后用户反馈体验很差,开播后体验也差,最终找到我们,我们大概只花了 5 天时间就把他从原来的方案全部切过来了,跑起来就很流畅。因为我的协议跟他原来接的厂商协议是对齐的,所以切得很快。
我们最担心的是:这些国家的一些客户并不直接接入腾讯云,他可能接入的是本地运营商,本地运营商切换后不一定能全部覆盖到我们。不过我们也做了很多方案去应对,中间确实也发生过一两个国家本地渠道流量被砍掉、全部切到我们这边的情况,但我们有一些应急方案,包括一些 AI 的处理能力,基本上都承接住了。
提问:像有厂商现在做视频生成也非常强,但我看这次腾讯云多模态领域的定位是要补全"从生成到稳定交付给用户"之间的链路。我想问为什么会卡这样一个生态位?担不担心以后从生成到交互之间的链路被压缩以后,这个生态位会被忽略和绕过?
李郁韬:这是好问题,我们内部也在讨论。卡这个位置可能是我们内部的一个战略定位,但更多的是我们关注最终用户和企业客户需要什么,不局限于卡位这个小点。我们过去服务的这些视频生产制作厂商、点播运营平台,他们关注的点永远是端到端、整体平台的流畅性、效率和稳定性。基于这个最终诉求出发——
我们发现,很多厂商今天看到有新的多模态大模型、生成视频和图片的大模型之后,第一件事就是全部对接一遍:今天对接这家厂商,明天另一家出了新的,再对接一遍。对接完之后他一定会发现这样那样的问题,而且每一家遇到的都一样。我们从这些客户反馈里得出一个共性诉求:我们应该帮他们把底下这些东西全部做好,让他们更专注于业务创新和上层应用。这也是我们过去十年做音视频 PaaS 最基本的定位和出发点,只是今天到了 AI 大模型时代,我们还是秉承这个理念。
第二个点,大家可能担心:未来一个新模型出来,泛化能力更好、智能化更好之后,是不是就不需要那么多 Harness 工程、那么多链条去串起来了?但我们至少过去半年观察下来,不会,甚至 Harness 的重要性还会更加加强。原因在于:如果把大模型当成后端的生产力,生产力的提升会显著刺激前端应用需求的增长,而且需求增长的广度会一直强于生产力的提升。这个过程中会存在一个供给关系差,这个差里面永远存在一个不可调和的矛盾——大模型永远满足不了最终用户的极致需求。所以中间就存在"如何把模型能力最大化地呈现给最终用户"的问题,这就是 Harness 存在的必要性。
所以我们会在 WAND 解决方案里构造几十种我们认为好用的模型服务,用很好的方式串起来,用云服务 API 的方式提供给企业客户,让他们减少在选择模型、评测模型、模型怎么用得更好上的投入。比如 prompt engineering,每家做得都不一样,同一个模型最后出来的效果也不一样。我们希望用自己沉淀的专业能力,把大家在这个层面的水平提升到尽可能一致和高的水平。所以我们认为 Harness 在多模态领域的空间一直存在,而且会放大。
三年前大家可能觉得海外模型是全球最强的,但现在再看,中国的模型——包括混元等——在质量上跟海外部分知名模型没有太大差距了。在多模态生成这个领域,今天可能某家领先,但可能过半年别家也会出来、也很强。1~2 年以后,多模态生成的格局可能会像语言模型那样百花齐放。
而且很多客户追求的不是最极致的效果,而是最高性价比:在这个场景我不需要顶级效果,可能中间水平的效果就够,但成本是最优的。因为最终客户还是看 ROI、看商业化,如果效果很好但成本很高,他也用不了。所以不用担心是不是会一家独大。
第二,我们做 Harness 工程强调的一点是:腾讯有十到二十年在音视频这个行业的积累。你可能会问,这个积累在多模态、大模型时代还有没有价值?其实多模态和大模型所学的知识、训练样本,也是基于音视频的经验积累出来的结果,所以我相信我们在音视频垂直行业的经验比现在的大模型更足。
提问:我们有超分、横转竖、剪辑字幕这些能力,但竞品其实也有类似功能。咱们本质的区别、核心竞争力在哪里?
李志成:在媒体这一块,国内外厂商想支持的人应该都有,但腾讯云最明显的差异化能力是这样:在国内,大量短视频、直播 App,头部那几家的视频处理、超分、分享,基本上全部是我们的客户,而且用的只有腾讯云一家方案。对其他家来说,这个能力可能更多是他产品组件的一个补充;而腾讯云深耕这么多年,不管是服务的客户还是线上跑的量,在这个方向上有更多的现网经验、更好的数据积累,从效果来说相对是有差异化的。
举个例子。这个行业里说了很多年——我们参加海外的会议,无论欧洲荷兰IBC还是美国NAB这两大行业会议,每个厂家都说有横转竖的能力。包括今年我们在展会上看到,基本上每个厂商都在讲这个能力,但你发现他们没解决一个问题:假设我要把一个横版视频转成竖版,如果这个画面里有比分牌、有字幕、有 logo,你转成竖版的时候,怎么把这些元素合理地放进竖版画面里?这个行业普遍还没有很好地解决这个问题,他们只能做到"画面很干净、什么都没有"的情况下转一下就可以;一旦画面里有比分、有字幕就不行了。
腾讯云在前面讲的解决方案里,有很好的元素提取、字幕提取、翻译等能力,这些在行业里有比较完善的解决方案,我们把它做到行业里最好,所以最后呈现出来的差异化很明显。更多的是说,我们在技术上、服务的客户上、跑出来的经验数据和质量细节上,相对行业还是有一些差异化能力的。
提问:从 QQ 时代的实时视频到今天 WAND 的 AI,根本是两个物种。到今天您觉得 WAND 算是音视频的一个新趋势叙事,还是实打实的一个新增长曲线?
李郁韬:我觉得一脉相承的是:用户对音视频体验的追求是一脉相承的。我还记得原来 QQ 时代做音视频,我们天天纠结怎么支持 480、720,怎么把分辨率往上提,怎么在成本和码率之间取平衡,怎么让用户的卡顿率哪怕降低 0.1 个百分点。这跟今天我们做音视频云服务、做 WAND 整体解决方案,出发点和关注点是一样的,没有变化。
只是今天我们希望用 WAND 这个品牌,来加强我们对音视频云服务未来更聪明、更智能化、更高并发的分发,以及能力上限的追求,所以起了这么一个品牌名字。里面最终的追求,还是对最终用户体验的提升,以及企业客户在成本效率上的提升——这是我们的目标。
提问:东南亚、拉美和中东是你们这次重点覆盖的区域,你们怎么看待这些新兴市场云媒体需求的增长潜力?未来三年在海外媒体云的项目扩张目标,还有资本开支计划是怎样的?
李郁韬:先回答最后一个。我们在海外基础设施一直在持续的投入,但世界杯的带宽波动很大,回落之后这些设施怎么办?这就需要我们去拓展更多客户来使用,让服务得到比较高的利润率。也正是因为过去三年持续高速投入,这次我们才有这么大的服务容量,支撑住全球 17 个国家和地区的世界杯直播。所以最后一个问题的答案是:我们会保持高投入。
关于海外拓展,现在其实已经进入一个新阶段。过去我们更关注拓展中国周边的国家和地区,因为地理位置更近、触达客户更容易,对中国文化的接受度也更高。但今天我们已经走到最远:拉美有一些客户开始使用我们,欧美也开始有客户搬迁过来,这是我们新阶段的尝试。
这个过程中,每个区域的诉求和发展阶段不太一样:
第一类,跟中国互联网发展阶段高度一致的——从消费用户角度看,应用的丰富度和品质差不多。我们会把这些市场作为重点攻坚和深耕的市场,把整套解决方案、云服务,以及我们的运营和创新的产品技术推广到当地,一方面满足当地借鉴成熟运营模式、复制成功产品经验的诉求,另一方面解决他们对供应商多选择的问题,我们做了大量工作去兼容他们原来的供应商、协议、迁移难度,让他们快速用到我们的技术。这个某种程度上跟今天制造业、新能源出海是类似的。
第二类,是新兴发展甚至高速发展的国家区域,有几个显著特点:人口数量大、年轻用户基数大,有大量用户愿意使用新的创新业务,但当地基础设施还不够健全,需要好的云服务商来弥补用户和基建之间的 gap,这是我们非常大的一个机会点。这次世界杯直播中,就有不少客户开始选用我们,也是一个验证。
第三类,是欠发达地区,我们觉得它面向未来。整个基础设施建设、云服务和 AI 算力的发展还在加快,这些国家有可能迎来类似过去十年移动互联网发展的红利,实现跨越式发展。今天不好说,但这也是我们想下一步去拓展和布局的。
提问:你刚提到在欠发达地区会帮助他们做一些基建。这些地区的资本回报率现在如何?在不同地区的建设上会有什么区别?是合作还是自己建设?另外,我们看到像 Google 今天发布的数据显示资本开支已经超过营业利润,腾讯云这方面怎么规划?
李郁韬:我先说第二类发展中国家的拓展。比较值得一提的是今年在印尼市场。首先它是千岛之国,网络设施其实不好,本身有很多挑战;但它用户很多,有两亿多、接近三亿人口,其中很大比例是二十多岁的年轻人,对互联网应用、用手机观看赛事直播有非常强的意愿。
今年比较好的点是,我们在当地不仅跟头部科技互联网企业有合作——去年跟 GoTo 有一个比较大的合作,完成了他们整个搬迁项目——特别是现在跟当地最大的运营商,开始在更底层资源上合作,比如合建 CDN。这让他们的网络得到互联网技术的加强:原来他们服务本网运营商的用户,还要外采一个第三方 CDN,成本贵不说,还会遇到跨网的质量问题。今年我们用非常短的时间跟他们做了一个合建 CDN,刚好赶在世界杯之前。整个合作过程一环扣一环,非常深入,也让他们今年在很多运营活动上有了不错的新用户增长,取得了积极的商业效果。
所以这个问题间接回答了你关于资本回报的疑问:我们不仅看腾讯云自己的回报,更要看客户的商业价值回报和生态伙伴的价值增长。
提问:这次世界杯决赛在线峰值超过千万,带宽峰值也比上届高很多。这个规模在你们内部是有预期的吗?中间遇到哪些挑战?怎么保障?
李志成:整体来看还是符合我们的判断,基本上跟我们预期差不多。今年的时间点,比如在亚太是在凌晨,这会有点影响;中东、南美那些国家基本符合预期,包括决赛的基建也符合我们的预计。中间可能有一些,比如亚太某些国家出现一些峰值,包括出现故障后切到我们这边,基本上还在我们的控制范围之内。
因为我们去年的规模已经超过全球最高同时8000万人在线了了,今年世界杯大概在5000万,所以整体还在我们资源可控的范围之内。包括今天出现突发,我们前面也讲了,有一些 AI 的处理能力,能够自动去做码率自适应、带宽调度、跨地区调度这些事情,不需要我们同事去值班处理,所以这也在我们的工作范围之内。
提问:现在腾讯多模态能力已经在视频、短剧、漫剧出海等方面应用。从落地经验看,不同行业对多模态交付的核心需求有哪些不同?
李志成:不管是短剧、漫剧还是电商、工具类,出海最大的一个共性是:前期他们可能关注效果、关注影响力,但到中后期都很关注 ROI——到底能不能盈利、能产生多少价值。
腾讯云在这块的价值是,我们提供一个端到端的 Harness 工程结构:不只提供多模态生成,还包括生成之后的增强、压缩,以及多语种翻译、分发这些,一整套端到端解决方案。这有个好处:客户原来用了很多家,成本算不清楚,各家的成本加起来对他来说不太可控;用腾讯云以后,端到端大概多少成本算得很清楚,因为整个方案全是腾讯云的,有哪些成本、分发成本是多少都比较清楚。所以对这些工具类客户的经营、运营是一个比较好的优势点。
第二,我们在音视频这么多年,在很多工具类、视频这块有比较完善的端到端解决方案,做了很多治理。举个例子:现在客户用很多多模态模型,不管国内还是海外的,都有一个最大的问题——生成的视频里可能有乱码、语音不清晰,或者人物、场景出现幻影之类的。原来他用别的方案,这些 bad case 解决不了,那怎么办?就只能重新生成、重新试,成本要花很多倍。
腾讯云跟行业里这些多模态平台都有合作,出现 bad case 以后,我们提供一个分段的修复方案:比如出现乱码,我们在开始的时候就可以做修复,这样它不需要再重新生成,我们直接把生成的结果做一个修复,而修复的成本很低。这样对用户来说,整体成本可控、效果也可控。这就体现了我们的价值。所以出海客户现在最关注的,还是整体的 ROI、能不能把成本做好——因为现在这个概念在行业里已经是一个比较清楚的阶段。
提问:中国的服务去推广到海外市场,这个时候你们会怎么说服他们使用你们的平台服务?
李郁韬:这确实是大家都很关心的问题。这些年面对这个问题,我们通常都是把它拆开来看。客户关注数据隐私保护等问题,其实会更关注某些具体方面:比如用到大数据服务、用户数据类服务,他可能对这个东西非常关心。但实际上我们提供的很多云服务,是对传输的增强、对画质的提升,以及转码这些功能性的东西,用户在原来的数据隐私保护或合规要求里,并没有明确说这些不能做。
把这些问题按场景分开之后,我们发现大量客户其实不会受此影响。反而原来因为没有人去跟他们交流、澄清这些东西,他们就一概而论——中国厂商都不能用;实际情况不是这样。
我再举一个反过来的例子。我们观察到很有意思的一个点:他们在经营亚太区业务的时候,会更多地去看中国有没有解决方案;更突出的是,在经营在华业务的时候,也会更主动地寻求本地合规的云服务方案。所以这个东西对我们来说是硬币的两面,但我们看到的更多是对中国科技企业和云服务的一个新机会。
在这个过程中,我们肯定会关注最终用户的体验和企业价值怎么去做双赢,中间遇到的一些地区性法规、合规我们都会一起解决。所以目前来看,还好,不会遇到太多这样的问题。
提问: 我有两个针对产品的问题。第一,资料里提到我们和的多家具身智能企业开展合作,具身智能也是今年 WAIC 上很火的领域,能否介绍这块的进展?第二,资料里提到我们与很多 AI 短剧平台合作,AI 短剧过去半年发展很快,他们可能都是用少数几个大模型加上自建的智能体和工作流——在这样的背景下,80% 的头部客户选择腾讯云的原因是什么?我们的不可替代性体现在哪里?
李郁韬:这两个问题有一点小关系,我先回答具身智能。我们跟艾欧,还有其他几家具身智能企业,甚至一些无人车、无人清扫车都开展了合作。里面的合作点很有意思:这些无人车、机器人设备有两个最重要、又不太好解决的需求。
第一个是,在紧急情况下需要有人远程实时介入控制、实时监控,这不是一件容易的事。如果用传统的音视频解决方案,延时不好解决,通常会到一两秒;这一两秒的画面,如果是在一个移动的设备上,就意味着大概几米的空间是不受控制的——当它出现紧急情况、不自主可控的时候,人没办法在这个范围内介入。所以我们几年前就孵化了一套解决方案——TRRO 远程实时操控(远程数智人的解决方案),去解决机器人在人工介入时、在弱网情况下远程接管能保持稳定、低延时通信的核心问题。
第二个是,机器人自己有一个"小脑"在本体,可以本地化演进;未来他们会往云端或边端的"大脑"方向做连接,这个连接过程也需要用到一些通信,特别是抗弱网的通信能力,这也是在跟我们积极探讨、合作的点。与此同时,要做智能就必须采集大量生产环境的数据来训练,数据来源需要在设备、机器人前端装不同摄像头,采集音视频数据回传,这个回传场景也是我们在积极探索合作的点。
所以我想说的是:大家关注机器人更多是它的机械构造、舵机、本身的智能化,但它中间肯定会遇到很多通信和音视频应用上的小点,我们希望做它的音视频多模态 Harness,去弥补机器人、具身智能领域这些小的音视频应用点。
现在市面上所有的多模态模型,没有哪一家是很稳定的,很多模型都会出现 bad case:比如生成的视频里有乱码,做转场的时候有异常,还有一个最大的问题是语音——你把很多片段拼出来的时候,听起来语音不连贯,声音也不统一,这是行业一个非常大的痛点。另外,做出海短剧要做多语言翻译,视频到 YouTube 等平台时,还会遇到生成视频画质不够的痛点。
针对这些痛点,腾讯云提供了端到端的解决方案。我举个简单的例子——以翻译这个场景来讲。现在行业里大家做的多是多模态翻译,但有一个问题:多模态翻译时不太稳定、容易出现幻觉,在一个视频里出现这种 case 时,客户就不能直接对外发布,只能派很多人去检查、修复,人力成本很高。
我们的 Harness 工程做了一件事:现在行业里讲的很多 Harness 工程,基本方法是"运行—规划—检查—修复"这样一个过程。比如我们在做翻译时,有一个模型可以做翻译;翻译出来结果之后,其他平台就直接给你一个翻译结果让你自己选,而腾讯云会再用大模型的多模态去做一个理解——判断这个翻译在这个场景下对不对、有哪些不对,如果不对就再去做修复。这样翻译场景的效果稳定性,从客户来看能提升大约 20%。对短漫剧行业来说,出海的出品成本和成功率、效率都提升很多。
所以我们讲 80% 其实是国内短漫剧头部那几家,现在应该 90% 都有了——大家想到的资源都有。但他为什么还是选择腾讯云?是因为我们针对这种场景做了很多 Harness 工程,效率相对更高、ROI 成本更低。当然他不用腾讯云也有别的解决方案,但用那种独立方案,整个生产成本会很高;腾讯云给他的,从成本和效果综合看是一个最优选择。
提问:我想请教两个问题。第一,资料提到我们在世界杯期间围绕个性化广告做了一些工作,能不能具体介绍我们做了什么,以及这些能力未来的应用空间?第二,请二位总结一下,云厂商在多模态领域未来会围绕哪几个关键方向展开竞争?
李志成:先说广告。这个行业里,国内广告和海外广告有个比较大的差异。国内互联网广告,不管央视还是腾讯、几个大的 App,每家都有支持自己的广告平台;为了把资源和广告主绑定,每家的广告协议、分类都是私有的,不能通用。海外不一样,海外广告相对通用,基本上都走 OTT 里的标准——在 OTT 行业里,广告怎么合作、怎么用是有标准的,比如用第三方广告、用人群定向分配这些都比较标准化。
现在传统 OTT、广电行业也慢慢在做一些创新。比如今年央广云听做了一个广告方案。原因是:国内有很多终端,包括出租车、一些公共场合的设备,这些设备比较老,没法更新,做不了 App 的更新。所以很多客户希望做一个标准的方案——在云端做广告处理,让终端能够适配,把广告直接投放出来。这刚好是我们前面讲的,做了七八年海外 OTT 行业积累的能力:广告的 SSAI(Server-Side Ad Insertion,服务端广告插入)标准我们基本都支持了。央广云听旗下有几千万终端用户,整体来看效果挺好。海外方面,比如韩国头部的 OTT 和 App,基本上也都使用我们的服务,我们提供了很多专属的、个性化的广告解决方案。
其实我觉得 AI 时代给广告业务带来很多新的创新机会。举个例子:在海外,传统广告行业我们想切入其实很难。但刚好这波 AI 里,我们看到一些新的机会——因为 AI 的很多新资源,传统广告厂商没有优势,而我们这些互联网厂商在 AI 能力的应用、理解和更新上有优势。所以在韩国等地的世界杯 OTT 里,我们在 AI 广告上做了很多创新。
李郁韬: 第二个问题我来回答,云厂商在多模态领域的竞争,我建议关注三个方向。
第一,多模态的训练和算力。这跟语言模型的训练不太一样,今天多模态领域挺大比例还投在多模态的理解和生成上。在很短暂的未来,会有大量端到端的语音交互、端到端的视频生成——一句话或多个参数去生成更长的视频,这些都会进一步发展,对算力的要求、对云厂商本身基建的投入都很大。所以训练和算力是未来竞争的一个点。
第二,存储和数据积累。多媒体相对于文字,存储量要求更高,对存储稳定性、数据清洗和获取的要求也不一样。大量视频需要在预训练之前做数据清洗和处理,不同模态的数据要放在一起、训练前要做的处理都跟语言文字类不一样,这是云厂商需要构建的竞争力之一。
第三,也是今天讨论比较多的,应用生产端。云服务商提供更面向最终客户的推理服务、综合处理的应用能力,是未来影响云厂商能否被客户选择的重要因素。这一点对腾讯云来说非常重要:我们在全球已经有大量音视频客户基础,在国内也有大量生产和直播客户,所以对于创新趋势中产生的需求,我们怎么在运营端用很好的方式帮客户满足——比如今天提到的很多视频后处理、多模态推理,我们未来也会在这一块进一步加强,构建竞争优势。
提问:我有两个问题。第一,服务世界杯这种全球化直播赛事之后,腾讯云音视频或整个腾讯云沉淀了哪些可复用或可持续演进的资源、技术或实践经验?第二,从更长远、更顶层的视角看,AIGC 时代视频服务商的核心竞争力锚点在哪里?腾讯云音视频又在哪些方面做了重点投入?
李郁韬:第一个,沉淀下来的是很多世界杯之后的客户,我们观察到里面还有大量机会和需要挖掘的点。很多客户是第一次做世界杯直播服务,也是第一次选择中国厂商,在这么短暂的两三个月里,我们能提供的服务、他们能腾出手来做创新的点都相当有限。我们整个产品线非常丰富,是中国比较领先的解决方案,里面很多产品能力未来都会被这些新客户使用到。所以接下来我们会在音视频的方方面面跟他们做进一步的创新和拓展,让他们感受到中国技术的力量。
第二个,在 AIGC 部分,我前面提到的训练算力、存储数据处理、推理应用这三个方向,我们会持续增强竞争力。我再展开说一下后面应用和处理的部分。我观察到从去年开始,整个 AI 算力已经开始从训练往推理倾斜,很多厂商构建推理算力的开销已经超过训练投入,这意味着很多 AIGC 应用开始进入大规模生产应用。在中国比较典型的趋势是短剧、漫剧的制作,这部分已经大量用多模态技术做生产,这是我们看到比较明确、可以复制到全球的一个机会。
第二个比较大的点,是实时互动——端到端的语音交互,不过今天还受限于很多技术没有突破得非常好。过去大家觉得实时语音交互跟一个 AI 智能体像人一样无缝沟通是很酷炫的事情,但过去一年多我们在行业里跑下来看,(对算力和智能化的要求还很高)。所以我们可以把很多多模态应用部署在边缘端,这样可以很好地复用原来音视频云在边缘做的 CDN 基础设施建设,在这之上提供边缘推理服务,面向广大客户,让他们后续精调的多模态模型能够部署在边缘。这也是未来一个不错的 AIGC 云服务机会点。
带来的潜在想象空间是:未来大家自己面向具体场景的多模态模型,能方便地部署在离用户最近的边缘端,以低时延方式提供端到端交互、实时视频生成、实时视频直播的服务,在里面加上足够成熟的智能化——这可能是未来我们跟着整个产业发展,能贡献给市场的一个重要机会。
李志成:第一,世界杯之后国内的一个明显变化是这种大规模活动来看,国内客户对腾讯的信任度越来越高。现在国内一些大型直播、一些服务商会优先考虑腾讯云,品牌认可在国内应该越来越好。
在海外,我们花了七八年时间,对标 OTT 行业里的标准协议基本都支持了,而且有一些差异化能力,包括转码、增强分发,以及数字水印这些。这些差异化能力在海外传统 OTT 领域现在越来越明显,客户和 OTT 行业对我们的认可度也越来越高,这也是我们将来一个很好的点。
第二,在多模态这块,将来的发展我觉得跟语言模型差不多。两三年前语言模型刚起来,最近像腾讯的一些偏 AI 的工具慢慢就出来了,而且逐步形成头部效应。多模态也是一样:大家现在用的这种 AI 工具,包括我们现在在视频、多模态领域也在跟一些工具做合作,在视频、语音、生成、处理上做一些集成。我觉得将来这种垂直的 AI 工具会越来越多,而且会出现头部。多模态在这些头部工具里也是一个主流应用。
现在我们被问得最多的,就是短剧、工具类、电商工具的使用,我觉得未来 1~2 年会慢慢普及,很多用户、企业都会用起来——就跟以前的模型一样,两三年前更多是垂直行业在用,现在基本上全普及了,成了大家工作中的一部分。多模态也是这个方向,这些垂直工具会把这些能力全部集成进去,让多模态应用越来越贴近用户行业的需求。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.