![]()
你有没有想过,你在抖音上刷到的那条丝滑的广告视频,到底是谁做的决定?
比如为什么这条广告用了这段配乐而不是那段,为什么先展示产品细节再放使用场景,为什么结尾突然弹出一个"立即购买"的按钮。以前的答案很简单:都是人。剪辑师、策划、投放专员,一群人开会讨论,凭经验定下来。
但如果这些决策能交给AI,而且AI还能根据每条广告的实际点击效果不断变聪明呢?
这就是字节跳动这篇论文要解决的事。他们做了一个叫AgenticGen的系统,让AI不仅会做广告视频,还会从广告投放后的真实点击率、转化率里学习,越做越懂什么样的视频更能打动人。这事听起来简单,做起来却藏着不少讲究。
**广告视频不是普通视频,它得对业务负责**
先说清楚一件事:广告视频生成和普通的AI视频生成完全是两码事。
普通视频生成,你给个文字描述,模型吐出一段画面,好看就行了。但广告视频不一样,它的成功与否最终要靠上线后的点击率和转化率来衡量。这就好比你写一篇文章,如果目标只是"读起来通顺",那很容易;但如果目标是"读完的人一定要买你推荐的东西",难度立刻上了一个台阶。
论文里提了个概念,叫产品条件推理问题。
产品条件推理问题:不是单纯地"生成一段视频",而是要综合考虑产品的素材、过去的广告投放经验、预期的线上表现,共同决定这条视频该怎么拍。
也就是说,AI在动手做视频之前,得先像一个广告策划一样思考:这个产品有哪些现成素材可以用?之前类似的广告表现怎么样?这次应该走什么路线?
Seedance 2.0、Sora这些视频生成大模型,已经能把文字、图片、音频转成很逼真的视频片段了。但它们都是被动的生成器,你给什么指令它做什么,不会自己去琢磨"这么做效果好不好",更不会因为一条视频上线后点击率低就自动调整下一次的策略。这正是AgenticGen想要补上的那块拼图。
**把一个大问题拆成两步走:先定策略,再写草稿**
AgenticGen没有让AI一步到位直接生成成品视频,而是把整个过程拆成了两个阶段:策略选择和草稿生成。
策略选择阶段,AI要做的事情类似于导演在开机前定基调。它会看产品信息(名称、卖点、描述),再看手头有哪些素材(视频、图片,以及这些素材过去的表现数据),然后从十几种预设的创作策略里挑出一组合适的。这些策略大致分成三类:素材编辑(比如换个更带感的背景音乐、加个更有冲击力的开头钩子)、参考式生成(借鉴投放效果好的同类视频的叙事套路,重新生成新素材)、跨素材混剪(把几段素材重新剪辑排列,讲一个新故事)。
如果一个产品原本的视频已经表现不错、画质也过关,AI可能就只做轻量编辑,换个音乐、强化一下购买按钮的提示。但如果原始素材质量堪忧,AI就会选择重新生成新内容,再和其他素材混剪拼接。
这里有一个细节挺有意思:AI做决定时还得遵守一些硬性规则。
有效性约束:一套判断标准,规定某些策略在特定情况下不能用。比如可用于混剪的片段数量不够、时长不达标时,混剪策略就是无效的;素材里如果有人在唱歌,替换背景音乐这个策略也不能用。
这就像厨师做菜,不是想放什么调料就放什么,得先看看食材新不新鲜、够不够量,再决定用什么做法。如果不设这层约束,AI可能会选出一套听起来很美但实际执行不了的方案,比如想混剪却发现根本没有足够的素材可用,最后生成流程直接卡壳。
选完策略之后,进入草稿生成阶段。这一步是把抽象的策略变成具体可执行的指令:该用什么音乐、加什么贴纸、文案怎么写、镜头怎么排序。生成好的草稿,最后交给Seedance 2.0这样的视频生成模型和CapCut这样的剪辑工具去真正渲染出成片。
这套两段式设计的好处在于,它把一个原本模糊的"生成一条好广告"的任务,拆成了两个具体、可以单独打分、单独优化的环节。策略选得好不好,草稿写得好不好,都能分别评估,分别改进。
**在线反馈这事没那么简单,真实数据里全是噪音**
理论上讲,AI做的决策对不对,直接看广告上线后的点击率不就完了?
但现实要复杂得多。第一个麻烦是时间成本:一条广告投放出去,得让足够多的人看到,才能算出一个靠谱的点击率,这个观察周期不短。第二个麻烦更棘手:点击率这个数字本身会被很多和视频质量无关的因素干扰,比如这条广告被推给了什么样的用户群体、投放系统给了它多少曝光机会、甚至同一天不同时段用户心情都不一样。
这就好比你想知道两家奶茶店谁做的珍珠奶茶更好喝,但你没法直接比较他们的营业额,因为一家开在写字楼底下客流量本来就大,另一家开在小巷子里天然吃亏。你比较的不是奶茶好不好喝,比较的是地段好不好。
研究团队想了个办法,叫曝光均衡投放。
曝光均衡投放:给同一个产品生成12条视频,把它们放进一个专门的流量池里,绕开广告系统正常的推荐排序环节,让这12条视频获得大致相同的曝光机会,再比较谁的点击率更高。
这样一来,视频之间的点击率差异,才更能真实反映视频本身的好坏,而不是被投放机制的偏差带偏。只有当一条视频获得了至少1000次曝光,团队才会把它的数据纳入训练,数据量不够的话,噪声太大,不能信。
**两套奖励模型:一个懂生意,一个懂审美**
光有曝光均衡的数据还不够,接下来的问题是:怎么把这些点击率数据变成AI能学习的信号?
团队训练了两个奖励模型,分工不同。
第一个是性能导向奖励模型,专门从线上点击数据里学"什么样的视频商业表现好"。这里有个技术选择很值得说一下:他们没有直接让模型去预测某条视频的点击率具体是多少,而是用了一种叫Bradley-Terry的两两比较方法。
Bradley-Terry成对比较:不问"这条视频的点击率是多少",而是问"在同样条件下,A视频和B视频比,哪个更好",用这种相对排序取代绝对数值预测。
为什么要这么绕?因为点击率这个绝对数字本身就不干净,混杂了太多和视频质量无关的干扰因素,直接拿来做回归预测,模型学到的可能是噪音而不是真正的规律。但如果只是问"这两条谁更好",在同一个曝光均衡的小组里比较,干扰因素基本抵消了,得到的相对好坏判断就靠谱得多。
实验数据也证实了这个选择是对的:用两两比较的方式训练,模型在验证集上的准确率是60.85%,而如果直接做绝对数值预测,只有52.92%,中间差了将近8个百分点。
奖励模型看视频的时候,也不是光看画面。团队给它喂了四类信息:视频画面本身、音频和语音内容(背景音乐、语音识别出的文字)、视频的叙事结构(用文字描述这个视频讲了个什么故事)、以及广告特有的元素(钩子、字幕、卖点文案、品牌名称、购买按钮)。这几类信息一层层叠加进去,准确率从只看画面的56.55%一路涨到60.85%。其中音频信息的贡献最大,涨了近2个百分点,团队观察到背景音乐的节拍和画面剪辑点是否同步,和广告效果关系很密切。
第二个奖励模型叫规则导向奖励模型,负责补上第一个模型看不到的东西:人类的审美和质量底线。
有些视频点击率可能还不错,但内容本身有硬伤,比如画面有明显瑕疵,或者标题党式的夸张宣传。这类问题光靠点击数据是发现不了的,因为用户点进去看了不代表这条广告的质量真的过关。团队请广告方面的专家总结出一套评判标准,覆盖脚本、内容、装饰、音频四个维度,每个维度再细分成是否符合平台调性、吸引力强不强、逻辑通不通顺、和产品是否一致、美感协调不协调这五个方面,然后用这套标准训练一个基于Qwen2.5-Omni-7B的模型去打分。
这两个奖励模型其实是在从两个不同的角度回答同一个问题:好广告到底是什么样的。一个从数据里挖出"用户喜欢什么",一个从专家经验里总结出"什么算合格"。两者结合起来,才不至于让AI为了追求点击率,走上标题党的歪路。
**先用DPO热身,再用GRPO精调**
有了奖励模型,接下来就是怎么让AI真正学起来。团队用了两阶段训练:先DPO,后GRPO。
DPO:一种离线训练方法,直接从已经收集好的"哪个更好、哪个更差"的成对数据里学习,不需要模型自己重新生成内容去试错。
GRPO:一种在线强化学习方法,让模型自己生成一批候选方案,再根据打分结果调整策略,边生成边学习。
为什么不直接上强化学习,非要先来一轮DPO热身?这背后其实有个现实考量:强化学习需要模型不断尝试、不断试错,而每一次"尝试"在这个场景里都意味着真的要生成一条视频、真的要投放到线上、真的要等用户点击反馈,成本和周期都不小。如果一上来就让一个还没被"调教"过的模型直接上强化学习,效率会很低,就像让一个完全没学过游泳的人直接跳进泳池里练自由泳,还不如先在岸上教他动作要领,再下水实战。
DPO用的就是前面提到的曝光均衡数据里,那些已经跑出结果的"最好的一组"和"最差的一组",让模型直接学会往好的方向靠。实验显示,DPO把策略选择阶段的准确率从49.72%提升到56.48%,草稿生成阶段从50.64%提升到58.34%,平均提升了7个百分点左右。
热身结束后,GRPO登场,做更精细的在线优化。这一步的巧妙之处在于,它给策略选择和草稿生成两个阶段分别设计了不同类型的奖励。
策略选择阶段用的是过程奖励,包含全局奖励(这个策略历史上在各个产品里表现的平均水平)和局部奖励(这个策略组合和当前产品下历史最佳组合的重合程度),外加一个规则检查(策略是否满足前面提到的有效性约束,不满足直接得零分)。
草稿生成阶段用的是结果奖励,就是前面训练好的两个奖励模型打的分,性能分和审美分按权重融合,再加上格式检查(草稿是否能被顺利执行,不能执行也是零分)。
这里有组消融实验的数据挺说明问题。如果只用性能奖励去优化草稿生成,模型在性能指标上的胜率能冲到61.04%,但在审美维度的胜率只有51.74%,几乎是掷硬币的水平。反过来只用审美奖励,审美胜率冲到60.24%,性能胜率却掉到了50.78%。这说明单独依赖任何一种信号,模型都会顾此失彼,要么为了博眼球牺牲了内容质量,要么内容规规矩矩但没有商业冲击力。而把两种奖励按0.6:0.4的比例融合起来,性能胜率保持在60.52%,审美胜率也提升到55.86%,两头兼顾,平均胜率58.19%,是所有方案里最高的。
这个结果其实揭示了一个更普遍的道理:单一指标驱动的优化,很容易把系统带偏。就像一个只看考试分数评价学生的教育体系,最后培养出来的可能是应试机器而不是真正有能力的人。广告系统如果只盯着点击率,很可能滑向标题党的深渊;只盯着审美标准,又可能做出好看但不赚钱的作品。两个奖励信号互相牵制,才让整个系统走得更稳。
**上线见真章:数据说了算**
说了这么多设计思路,最终还是要看在真实广告系统里跑出来的结果。
团队在抖音的广告系统里做了两轮A/B测试。第一轮比较的是,用AgenticGen的SFT版本(也就是还没经过DPO和GRPO强化,只是初步训练过的版本),对比之前那种人工配置、各环节各自为战的旧流程。结果是点击率提升3.48%,转化率提升2.30%,广告主价值(Advv,衡量归因转化带来的总价值)提升9.83%。
Advv:广告主价值,用来衡量一条广告为广告主带来的实际转化价值,计算方式是曝光次数乘以点击率乘以转化率再乘以出价。
第二轮才是真正验证这篇论文核心主张的地方:拿经过DPO和GRPO强化训练后的版本,对比没做强化训练的SFT版本。结果是点击率再提升2.72%,转化率提升2.63%,广告主价值提升9.61%。
这个结果有意思的地方在于,团队收集的在线反馈主要围绕点击率展开,但转化率也跟着涨了,说明优化后的策略不只是让人更愿意点进去看,连点进去之后愿不愿意下单也变好了。而广告主价值的涨幅比点击率和转化率相乘算出来的理论涨幅还要更高一些,团队推测这是因为出价更高的流量往往对应质量更好的原始素材,AI在有靠谱素材可用的情况下,能做出的决策空间更大、效果也更明显。这也从侧面说明了一件事:再聪明的AI,巧妙难为无米之炊,素材本身的质量始终是天花板。
表格:核心实验结果
| 对比 | CTR | CVR | Advv |
| 人工配置 → SFT | +3.48% | +2.30% | +9.83% |
| SFT → DPO+GRPO | **+2.72%** | **+2.63%** | **+9.61%** |
写在后面
读完这篇论文,我印象最深的其实不是那些百分比数字,而是团队处理"在线反馈"这件事的谨慎程度。他们完全可以图省事,直接拿广告系统里跑出来的真实点击率去训练模型,但他们没有,而是专门搭了一套曝光均衡的投放机制,宁可多花流量成本,也要保证数据干净。这种对数据质量的洁癖,某种程度上比模型架构本身更值得学习。很多AI项目失败,不是算法不行,是喂给算法的数据里全是噪音,模型学的其实是噪音的规律。
另一个让我反复琢磨的地方是双奖励模型的设计。性能奖励和审美奖励单独拎出来看都不完美,前者容易滑向标题党,后者容易脱离商业现实。但把两者放在一起相互制衡,反而跑出了两边都不错的结果。这让我想到,任何一个只用单一指标评价复杂系统的做法,可能天然就是有缺陷的,无论是评价一个AI模型,还是评价一个人的工作表现。
论文里没有细说的一点是,那十几种创作策略到底是怎么被专家总结出来的,这背后大概率是无数次广告投放试错攒下来的经验,这些经验现在被结构化成了AI能理解和调用的选项。某种意义上,这篇论文做的事情,其实是把广告从业者脑子里那些说不清道不明的"手感",一点点变成了可以被量化、被训练、被复制的东西。这事儿说起来平淡,但仔细想想还挺让人五味杂陈的。
Q&A
Q1:AgenticGen是什么?
A:AgenticGen是字节跳动提出的一个广告视频生成系统,它把广告视频生成拆分成策略选择和草稿生成两个阶段,并利用广告上线后的真实点击率、转化率数据不断优化这两个阶段的决策,最终在抖音广告系统里实测提升了点击率、转化率和广告主价值。
Q2:AgenticGen是怎么用真实广告数据训练模型的?
A:团队搭建了一套曝光均衡投放机制,让同一产品生成的多条视频获得大致相同的曝光机会,避免投放系统偏差干扰判断,再用点击率数据训练性能导向的奖励模型,同时用专家标注数据训练审美导向的奖励模型,最后结合DPO和GRPO两种强化学习方法优化生成策略。
Q3:AgenticGen相比之前的人工配置流程效果提升了多少?
A:相比人工配置的旧流程,AgenticGen的初步版本点击率提升3.48%、转化率提升2.30%、广告主价值提升9.83%;经过DPO和GRPO强化训练后,又在此基础上进一步提升点击率2.72%、转化率2.63%、广告主价值9.61%。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.