网易首页 > 网易号 > 正文 申请入驻

600万奖池尘埃落定,有人靠DeepSeek网页版拿下冠军

0
分享至

编辑|张倩

最近,你有没有刷到一篇题为《我用 DeepSeek 网页版拿下 KDD Cup 冠军!》的帖子?

这个帖子的作者是 Kaggle 全球排名第一的「无敌叉烧包」同学。最近,他和在国内算法竞赛中累计获得 15 次冠军的队友一起,拿下了 TAAC × KDD Cup 2026 大赛的工业赛道冠军,奖金 15 万美元。



工业赛道冠军团队「日之光面」。

这个比赛我们之前也介绍过,是腾讯广告算法大赛(TAAC)与 KDD 联动的一场比赛(参见:「龙虾」爆火,token成「硬通货」后,这场AI比赛变得更重要了),奖金池高达 88.5 万美元(约合 600 万元人民币)。学术赛道冠军奖金比工业赛道还高,达到了 30 万美元。这样的赛事级别和奖池规模在国内非常少见。

大赛的报名人数也创了新高 —— 吸引了来自 52 个国家和地区的 13913 名选手,组成 5746 支队伍,覆盖全球 907 所院校,可见赛事竞争有多激烈。

上周,大赛在韩国济州岛(KDD 大会举办地)落下帷幕,学术赛道、工业赛道两大 TOP,以及两项原创突破奖,现场一次性揭晓。



学术赛道冠军团队 lozyyeah。

正如「无敌叉烧包」同学写的那样,这届比赛有个很有意思的变化:选手们几乎都是「AI Native」的,大模型、生成式工具天然就是他们日常工作流的基础 —— 遇到不会的地方,跟 AI 学;结果提不上去,让 AI 出主意;代码写得慢,用 vibe coding……

「无敌叉烧包」和队友组成的「日之光面」团队更有意思,直接给国产大模型来了个「压力测试」:没有调用任何 API,没有在 GPT 和 Claude 之间切换,全程只用一个 DeepSeek 网页对话框,就跑出了「冠军工作流」,全网直呼「爽文」,帖子也被大量转发。



「日之光面」团队使用 DeepSeek 网页版打比赛的大致流程。

不过,大家也提到,其实工具便利是一方面,更重要的还是「研究思路」,这也是选手们在比赛中拉开距离的关键。

好在,大赛收官的 workshop 上,获奖选手们把各自的方案完整讲了一遍。听下来最直观的感受是:这道价值 600 万的赛题,确实被「压榨」出了不少真东西,几乎每个获奖方案都有自己的原创突破。这些方案,甚至有可能让广告之外的 LLM 研究也从中受益,因此值得逐个细看。

不过在此之前,我们得先回到起点:这到底是一道什么样的题?

这道题的难点,藏在「统一」两个字里

今年赛题的官方题目叫「面向大规模推荐的序列建模与特征交互的统一」。听着很绕,其实说到底就一件事:用一种统一的建模方法,预测一个用户看到某条广告之后,会不会真的迈出下一步,比如点击、购买、注册,或者下载。行业给这个概率起了个名字叫 CVR,但说白了,它预测的是人的行为,所以要对人有充分的理解。

这个预测怎么进行呢?主要靠两类数据:一类是用户行为序列,像一条不断滚动的时间轴,比如一个用户早上刷朋友圈、中午看新闻、下午在小程序点咖啡、回家路上追剧;另一类是非序列的多域特征,比如用户的「人设」、广告所属的类目,还有一些上下文信号和交叉特征。

当然,出于公平和隐私,这些数据都做了脱敏处理,不放任何原始文本、图片、URL 或可识别个人信息。 所以选手不是在「理解内容」,而是在一堆匿名 ID 和向量里,把「人」和「货」在同一个表示空间里对上号。



注意,真正的难点其实体现在「统一」这两个字上。

过去,这种预测任务是分开进行的:一个模型处理非序列特征(比如看用户是什么样的人),一个模型处理行为序列(比如看用户最近干了什么),最后再把两边的判断拼起来。这种「各算各的、最后再汇总」的方式,不仅会带来重复的计算和更高的系统复杂度,也很难充分捕捉序列行为与多域特征之间细粒度的交互关系。

而今年赛题要的「统一建模」,就是要找到一种新的模型结构,让不同形态、不同时间维度的信息在同一个模型里真正发生交互。这就像发明一台「超级混动车」,让汽油和电在系统底层就融合成一种统一的能量表征,再高效输出动力。

但真要把这台「超级混动车」造出来并不容易。官方说得很直白:绝不是把所有特征「强行塞进」一个网络就算统一。它要你把非时序的多字段、上下文特征,和带严格时间戳、跨多个行为域的行为流,在同一个架构里深度融合。拍平了会丢掉字段身份和时间关系,全做精细交互又会让算力爆炸。此外,这套统一模块还得在海量、极度稀疏、基数庞大的工业特征面前保持鲁棒。

更苛刻的是鱼与熊掌必须兼得:准确率要上去,还要支持深层堆叠,并在高性能 GPU 上实现大 Batch 的高效训练与推理。而为了逼大家拼模型设计的真本事,比赛全程严禁模型融合(No Ensembling),靠集成刷榜的套路直接作废。说白了,这台车既要爬坡有力,又要省油,还得一口气跑完长途。

这台「车」造出来有什么价值呢?被请到现场发言的 Meta 推荐系统专家 Rui Li 把账算得很清楚,一笔是技术账,一笔是经济账



技术账的核心问题是:Agent 能替你写代码、订机票、回邮件,但你会让 Agent 替你刷视频、替你刷朋友圈、替你和朋友聊天吗?大概率不会。因为「消费内容、打发时间、维系关系」这些事没法外包,而推荐恰恰长在这些事的入口上。所以哪怕 AI 再往前走,推荐也不会被吃掉。

更关键的是,推荐是一个没有标准答案的问题,信号噪声又极大。所以改进推荐系统更像是一场压力测试,Rui Li 自己都承认「魔鬼都在细节里」。这样一场压力测试对于选手的成长相当有利。

此外,正因为推荐在这种噪声里泡了十几年,才练出一套「从噪声行为数据里把人读出来」的本事。而这套本事,很可能正是今天 LLM 做个性化最缺的那一课 —— 大模型会解题,但还不太会读人,而推荐系统十几年就干了一件事,在嘈杂的行为里读人,这种能力的影响边界可能被低估了。

经济账则更直接。在广告这种场景里,0.1% 的提升就意味着数十亿美元,0.01% 都不是小钱 —— 按 Rui Li 的说法,这比今年发出的奖金多得多。这也是为什么相关人才值钱。

这些价值,都是大赛的吸引力所在。

冠军方案:怎么把效果做到极致?

题读完了,该看解法了。首先来看两个冠军团队的方案,他们解决的是统一建模之后,两个最紧迫的实操问题。这让他们把效果做到了极致。

工业赛道冠军:怎么生成更好的 Query?

工业赛道冠军「日之光面」团队抓住的,是推荐系统里一个很容易被忽略的问题:Query 质量

我们可以把历史行为看作一个信息库,Query 就是模型递进去的检索请求。请求模糊,再长的序列也难转化为有效信号。

官方 Baseline 虽然使用 Cross-Attention 读取用户行为序列,但 Query 主要由简单 MLP 生成,用户、广告和上下文之间缺少充分交互。

于是,团队把优化重点从「塞入更多历史」转向了「生成更好的 Query」,并由此提出 QueryFormer:先让用户、广告和其他非序列特征充分交互,形成质量更高的 Query,再用它从行为序列中寻找与当前广告最相关的信息。



具体来说,QueryFormer 先按字段边界拆分不同来源的 Dense Embedding,分别生成 Token;随后通过 Self-Attention 完成用户侧、广告侧的内部交互,再以 Cross-Attention 建模用户与广告的匹配关系。这样,模型在读取历史前,已经知道面对的是「怎样的用户」和「哪一条广告」。

在序列检索阶段,QuerySeqCrossAttn 使用广告侧 Query,从四个业务域中动态提取相关行为;SeqQueryCrossAttn 则用 Cross-Attention 替代固定的 MLP 来生成 Query。

团队还通过多列 Embedding Matrix,从同一份输入中学习不同视角的 Query。随着列数增加,模型效果持续提升,但后期收益逐渐减小,因此最终选择了效果与推理效率更均衡的配置。消融实验也显示,多个 Query 优化模块都带来了稳定增益,其中用 Cross-Attention 动态生成 Query 的作用最明显。



最终结果验证了团队的核心判断:面对漫长而嘈杂的用户历史,提高「检索问题」的质量,比单纯增加历史长度或模型规模更有效

学术赛道冠军:有用信息怎么跨层运输?

「日之光面」解决的是「怎样问对问题」,学术赛道冠军「lozyyeah」关注的则是如何聚焦意图

他们在调研中发现,现有统一推荐模型已经能让用户特征、广告特征和行为序列相互交互,但这些模块主要解决「当前这一层怎样融合」。随着网络不断堆叠,用户意图可能被覆盖,序列信息可能被过度压缩,最终出现表示坍塌和扩展效果不稳定。

为此,团队提出 CRAFT,把研究重点从 Feature Interaction 转向 Feature Transport。它不只考虑特征之间如何交流,还要控制有用信息怎样穿过多层网络。其思路受到 flow matching 的表示运动视角启发,但并非直接套用 flow matching。



具体来说,模型首先会把输入整理为非序列 Token、序列摘要和 Intent Token。每个 CRAFT Block 会先汇总非序列信息,再生成缩放、偏置和残差门控参数,对 Intent Token 和序列状态进行动态调整;完成这一步「搬运」后,原有的 Cross-Attention、RankMixer 等模块才开始进行特征交互。

其中,Intent Token 不再只是用来检索序列的 Query,而是贯穿多层网络的信息载体。模型既能根据当前样本,把它推向更合适的表示空间,也能在必要时拉回初始状态,从而减少用户意图和序列证据在多层交互中被冲淡。

实验显示,随着 CRAFT Block 增加,模型效果稳步提升,Intent Token 的表示空间也变得更加丰富,说明有用信息确实能够在更深的网络中持续传递。不过,这种收益并不会随着模型变大而无限增长:适度增加宽度效果最好,继续扩展反而收益停滞。

因此,CRAFT 的价值不只是把模型做大,而是提供了一条更可控的扩展路径 —— 让网络在增加容量时,仍能保留并传递真正有用的信息。

不设排名门槛,两项原创突破奖到底在突破什么?

两支冠军队致力于解决信息怎样「取准」「送稳」这两个实操问题,两项原创突破奖则继续向下追问,承载这些信息的系统应该怎样搭、怎样长。

这里需要特别说一下原创突破奖的分量。腾讯官方给这两个奖的定位很特殊,它们不与总排名挂钩,每个奖 4.5 万美元,专门奖励在技术无人区的探索。哪怕最终排名不在前列,只要方案足够亮眼、有原创突破,照样能够拿奖。去年大赛甚至是在颁奖现场临时增设了这个奖项,就为了奖励一支排名不在前三但方案极其出彩的队伍。今年直接预设两个,摆明了态度,他们要把奖励投向可能改变下一代推荐系统技术路线的研究:一个要重写不同特征如何共处的底层架构,另一个要验证这种架构能否真正走向规模化。



统一框架原创突破奖获奖团队 T-Squared。



Scaling Law 原创突破奖获得团队 gg。

这种对于技术原创性的看重,让两个突破奖方案有了更自由的探索空间。

统一框架原创突破奖:不同特征之间的通信边界是怎样的?

我们在前面提到,传统推荐模型往往像一座分工明确的工厂:非序列特征由一个模块处理,用户行为序列交给另一个模块,直到最后才汇合。统一框架原创突破奖团队 T-Squared 则希望把这些步骤串成一条流水线,让用户、商品、上下文和多域行为序列在同一个主干中更早、更深入地交互。这也回应了本次大赛的核心命题。

不过,统一并不意味着把所有 Token 放在一起任其交流。多个行为域在语义、长度和时间模式上差异明显,如果采用完全连接的 Attention,无关信息可能互相干扰,强行为域也可能压制弱行为域。为此,团队提出以 TopoMask 为核心的统一框架:表示空间保持统一,信息流动则受到结构约束



模型首先构建 Global Memory 和 Domain Memory。前者汇总不同来源的全局信息,后者为每个行为域保留独立摘要,避免领域特征被过早混合。DualQ 模块还会围绕当前候选广告,提前建立用户、商品和上下文之间的联系,再生成适配不同领域的 Query。



进入 MaskRec Block 后,TopoMask Attention 会根据预设的拓扑关系,决定每类 Token 可以读取哪些信息。它类似于把语言模型中的因果 Mask 从「时间顺序」推广到「特征关系」:所有 Token 都在同一个主干中更新,但并非彼此完全可见,从而兼顾统一建模与结构保留。

实验表明,这种受控通信的统一架构能够稳定提升效果,其中稠密特征的结构化组织尤其重要:压缩得太狠会损失信息,拆得过细又容易主导训练、引发过拟合。

因此,TopoMask 的核心价值不只是「把特征放在一起」,而是为不同信息设计合理的连接方式 —— 让该交流的充分交流,不该混合的保持边界

Scaling Law 原创突破奖:模型变大时,新容量里该装什么?

Scaling Law 原创突破奖获得者 gg 团队关注的,是推荐模型扩容时一个更基础的问题:新增参数究竟应该用在哪里

官方 Baseline 已经能够统一处理静态特征和行为序列,但多组 Dense 和用户画像特征被过早压缩,多值特征中的细节也容易在池化中丢失。此时继续加宽模型,可能只是让它反复处理同一批有限信息。

为此,团队提出 CosFormer,核心思路是让「信息」和「模型宽度」协同扩展。传统方法通常保持输入 Token 不变,只增加处理这些 Token 的参数;CosFormer 则要求每次增加模型容量时,都同步加入一组携带新信息的 Token。换句话说,模型不仅要变得更强,也要看到更多有价值的东西。



这些新增 Token 被组织为四类语义信息:静态特征、显式交叉特征、序列相关特征和全局特征。例如,不同来源的 Dense 特征不再被过早压缩,用户与候选广告的交互也被提前显式建模,时间和历史窗口信息则形成独立通道。所有 Token 最终进入同一条信息流,由统一模型完成预测。

信息变多之后,CosFormer 还要解决「怎样把它们用好」。MaskNet 引导的双流结构会根据当前样本选择和重加权不同通道;Token-type Private FFN 则让同类 Token 共享网络、不同语义类型分别处理。这样既能提高模型的专业化程度,也避免为每个 Token 单独建模带来的过拟合。

实验中,信息与宽度协同扩展带来了持续而稳定的收益,单纯增加参数或加入不携带新信息的空 Token 则很快遇到瓶颈。随着新增信息逐渐重复,模型的边际收益也会下降,形成一个经验上的「信息前沿」。



这说明推荐模型的 Scaling 不能只看参数量:新增容量只有承载新的有效信号,并配套相应的信息选择机制,才可能真正转化为效果提升

把四套方案放在一起看,层次其实很清晰:QueryFormer 解决了输入端的问题(怎么问对),CRAFT 解决了传输层的问题(怎么保真),TopoMask 重新定义了架构层的连接规则,CosFormer 则摸到了扩展层的规律边界。从「怎么问」到「怎么传」,再到「怎么连」、「怎么扩」,它们拼出了一条从局部到系统、从当下到未来的完整技术主线 —— 推荐系统的下一步,不会只靠更大的模型,而要靠更高效的信息组织。

600 万奖池之外,这场比赛真正留下了什么?

跳出赛题本身,从外部视角看,这场比赛真正沉淀下来的,是两样东西:一样给了行业,一样给了人。

给行业的,首先是方向。Rui Li 在演讲里把话说得很明白:只要持续投入算力,推荐模型就能持续换回收益。也就是说,Scaling Law 这套在 LLM 身上被验证过的逻辑,这次被系统地搬进推荐,相当于把这条路又照亮了一截。



其次是数据。推荐研究这么多年跑得不快,一个绕不开的原因是工业数据很难拿到。Rui Li 提到,他 20 年前读博时,连一份能用来做研究的推荐数据集都找不到;LLM 跑得快,很大程度是因为它有公开数据、公开 benchmark,而推荐领域不然。腾讯这次把海量真实业务日志清洗、脱敏到能拿出来公开比赛的程度,本身就是在补学术界和工业界之间最难补的那道 gap。数据一旦开放,后面整个领域的研究节奏都会跟着快起来。

给人的,则是舞台和去处。和 KDD 联动之后,选手站上的不再是一个公司办的赛场,而是国际舞台。大家和来自 52 个国家和地区的一万多名选手同台竞技、互通有无,简历上从此多了一项全球都认的加分项。

更实在的是后半程:比赛结束不是句号,腾讯并没有把它当成一次性的选拔,而是放进了一套长期的人才布局里:赛事负责让全球技术人才同场交流、展示能力,青云计划负责在赛后持续关注和支持,覆盖发现、吸纳、培养几个环节。接下来,腾讯还会面向有实力、有实操能力、能把想法快速落地的人,提供持续的技术交流、产业研究和项目实践机会。对选手来说,这意味着进入真实业务场景的机会,他们可以接着把事做下去。

等到明年的大赛开场,今天被验证的技术路线,或许已经成为下一轮竞争的起点。到那时,新一批 AI Native 选手又会把推荐系统往前推多远?值得期待!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“我突然不爱女儿了!”单亲妈妈公开表达厌恶:我下班回家还得伺候她

“我突然不爱女儿了!”单亲妈妈公开表达厌恶:我下班回家还得伺候她

世界圈
2026-08-18 10:03:01
曾有俄罗斯高官语出惊人:沙俄时期侵占的中国领土,如今可以明码标价再卖回给中国!这背后,其实折射出远东开发已陷入停滞的残酷现实

曾有俄罗斯高官语出惊人:沙俄时期侵占的中国领土,如今可以明码标价再卖回给中国!这背后,其实折射出远东开发已陷入停滞的残酷现实

人生录
2026-07-29 00:05:09
微信上基本不发朋友圈的人,未必低调,十有八九是这三种人:1、生活过于丰富,不便展示;2、看透人性,藏锋守拙;3、自给自足,太充实

微信上基本不发朋友圈的人,未必低调,十有八九是这三种人:1、生活过于丰富,不便展示;2、看透人性,藏锋守拙;3、自给自足,太充实

美芽
2026-08-15 12:32:27
弟弟举报哥哥“顶替上大学”案庭审至深夜;哥哥指控弟弟“涉嫌行贿”:送一官员十条和天下香烟,后被退回,弟弟称系“和表姐吹牛”

弟弟举报哥哥“顶替上大学”案庭审至深夜;哥哥指控弟弟“涉嫌行贿”:送一官员十条和天下香烟,后被退回,弟弟称系“和表姐吹牛”

青年家
2026-08-19 14:06:45
中国不伺候了!C919适航证被欧盟卡了七年,如今谁求谁还真难说!

中国不伺候了!C919适航证被欧盟卡了七年,如今谁求谁还真难说!

小兰聊历史
2026-08-19 18:41:12
8月19日莫斯科遭狂轰!英国送15万架无人机,俄导弹血洗前线

8月19日莫斯科遭狂轰!英国送15万架无人机,俄导弹血洗前线

观察者海风
2026-08-19 18:15:48
浙江一女子忍到女儿高考结束离婚,再嫁苦等10年的初恋,谁料,女儿却说,妈,我只有一个爸,你去奔向你的幸福吧!

浙江一女子忍到女儿高考结束离婚,再嫁苦等10年的初恋,谁料,女儿却说,妈,我只有一个爸,你去奔向你的幸福吧!

神奇故事
2026-08-19 00:32:09
“50多个头衔全是自己封的”,冒充港中大教授,频频与名人合影,“假总编”还拿到了真聘书

“50多个头衔全是自己封的”,冒充港中大教授,频频与名人合影,“假总编”还拿到了真聘书

扬子晚报
2026-08-19 15:57:06
生育大势已定!2026新生儿预估出炉,低生育率根本不是年轻人偷懒

生育大势已定!2026新生儿预估出炉,低生育率根本不是年轻人偷懒

离离言几许
2026-08-18 17:32:43
三剑齐发!iPhone 18 Pro发布会锁定9月9日:机圈年度大戏将至

三剑齐发!iPhone 18 Pro发布会锁定9月9日:机圈年度大戏将至

快科技
2026-08-19 18:30:04
就在刚刚,广东队重磅三个消息:徐杰突然受伤,教练组迎来新成员,萨姆纳提价

就在刚刚,广东队重磅三个消息:徐杰突然受伤,教练组迎来新成员,萨姆纳提价

伴你终老n
2026-08-19 08:21:15
埃尔多安警告:如果局势需要,土耳其不会犹豫,将直接投入战争

埃尔多安警告:如果局势需要,土耳其不会犹豫,将直接投入战争

墨子翟的日记y
2026-08-18 18:30:03
朝鲜缺电远比越南严重,中国却始终不送电:一旦输电线搭过去,恐成无底洞烂账

朝鲜缺电远比越南严重,中国却始终不送电:一旦输电线搭过去,恐成无底洞烂账

z千年历史老号
2026-08-16 15:52:48
中国最良心的 8 个AAAAA景区,全部免费,不收门票,争取每年去一个!!

中国最良心的 8 个AAAAA景区,全部免费,不收门票,争取每年去一个!!

旅游周刊
2026-08-16 20:23:41
一人毁掉整部剧!《藏锋》里这位“戏混子”,成为全剧最大败笔

一人毁掉整部剧!《藏锋》里这位“戏混子”,成为全剧最大败笔

借你一生
2026-08-19 15:29:49
黄仁勋看走眼了!以为中国几十家芯片会互掐,结果一起攻破生态墙

黄仁勋看走眼了!以为中国几十家芯片会互掐,结果一起攻破生态墙

离离言几许
2026-08-19 16:24:52
炸裂!3孩非亲生后续!第三者打电话道歉:是她勾引我的!妻子:你侵犯我隐私

炸裂!3孩非亲生后续!第三者打电话道歉:是她勾引我的!妻子:你侵犯我隐私

小鋭有话说
2026-08-18 08:01:59
台儿庄一战,我军阵亡五万余人,至于日军的伤亡数字,讲出来怕是让人难以置信

台儿庄一战,我军阵亡五万余人,至于日军的伤亡数字,讲出来怕是让人难以置信

人生录
2026-07-21 00:05:07
日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

健康科普365
2026-08-13 14:30:15
国防部发出正式通牒:如果马德雷山号再不拖走,我们就不客气了!

国防部发出正式通牒:如果马德雷山号再不拖走,我们就不客气了!

墨兰史书
2026-08-19 07:20:07
2026-08-19 19:32:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13794文章数 142720关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

车友会活动进入未开放神祠内部参观引争议 当地回应

头条要闻

车友会活动进入未开放神祠内部参观引争议 当地回应

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

艺术
数码
旅游
游戏
房产

艺术要闻

河北出土东汉隶书石碑,被誉为“笔法之祖”

数码要闻

继冰箱、烤面包机后,微软Xbox将与宜家推出联名家具

旅游要闻

今年前7个月中国内地访日游客数量同比降56.3%

索尼官方精选 PS推荐会免阵容:全是精品个个优秀

房产要闻

涉及3800亩!海口秀英港又有大动作!

无障碍浏览 进入关怀版