![]()
再聪明的算法,终归要回到动态环境中检验。
作者丨幸丽娟
编辑丨齐铖湧
IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。大会召开之际,AI科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。
在上一篇中,我们观察到了大厂在参数竞赛上的克制,以及对算力效率的追求。
而蚂蚁集团入选的四篇论文,则指向了一条同样重要但路径截然不同的技术脉络:对动态环境适应能力的系统性探索。
算法模型的精度在实验室里不断刷新纪录,但一旦部署到真实世界,性能衰减几乎成为常态。原因很简单:真实世界从来不是静止的。
蚂蚁集团的业务场景,将这种“不静止”推向了极致:超10亿用户、8000多种服务,支付洪峰与凌晨低谷之间可以差出几个数量级,风控模型必须以小时级响应黑产策略的迭代,全球化部署还要适配各国迥异的金融基础设施。
在这样的环境里,“一次训练、永久部署”的静态模型,注定陷入“刻舟求剑”的困境。
也正因此,真正的智能,在于算法能否感知环境变化、主动调整自身策略、在动态中寻找最优解。蚂蚁集团这四篇论文,不约而同地回答了这个核心命题:如何让AI从“静态的求解器”进化为“动态的自适应者”?
01
MSRGC-Net:让时间序列
聚类“自适应”数据密度分布
时间序列聚类,就是把海量行为序列自动归类,这是一种理解行为模式、监控异常信号的基础工具。
但现有方法各有各的尴尬:
相似度方法(如k-Shape):能抓局部模式,但要算所有样本两两之间的距离,数据一多就跑不动了;
深度学习方法(如自编码器):表征能力强,但训练贵、调参烦、算力消耗大;
传统特征提取:依赖人工设计特征,关键的时间动态信息可能被丢掉。
更大的问题是:现实中的时序数据密度分布极不均匀——双十一交易数据密集如暴雨,凌晨数据则稀疏如滴水,但传统方法需要你提前告诉它分成几类,这本身就与现实错位。
蚂蚁集团联合重庆邮电大学提出的 MSRGC-Net,用一套“无训练”的组合拳,绕开了精准度和计算效率之间的两难选择。
![]()
论文地址:https://arxiv.org/pdf/2606.12077v1
▎它的核心逻辑可以拆成三步:
![]()
第一步,多尺度储备池编码(特征提取)。使用多个无需训练的回声状态网络(ESN)作为储备池计算的基本单元,仅靠调整谱半径就能从原始时序中同时提取局部波动和长期趋势,将所有样本聚合后形成视图特征矩阵 ,作为后续环节的输入。
第二步,“颗粒球”锚定图构建(结构建模),这是最巧妙的部分。算法不再盯着单个数据点,而是根据数据的局部密度自动划分“颗粒球”(Granular Ball):密度高的区域形成小而多的颗粒,密度低的区域形成大而少的颗粒。数据规模从 N 压缩到 M(颗粒数,M < N),同时噪声干扰也被抑制。
第三步,基于共识的多尺度图优化。跨尺度的锚定图通过共识策略融合,使模型既能捕获微观局部模式,又能把握宏观全局趋势,最终生成无需人工指定聚类数目的鲁棒聚类结果。
这套打法效果如何?
![]()
在5个多变量基准数据集、15项评估指标(NMI、ARI、RI各5项)上,MSRGC-Net拿了12项最优、2项第二——80%的最优率。
更关键的是,它避开了O(n²)的成对计算,实现了近线性的复杂度。简单说就是:又快又准,而且不需要你猜要分几类。
在蚂蚁的实际业务场景中,这意味着系统能根据流量密度自动调整聚类粒度——高峰时精细分群抓异常,低谷时粗粒度概括省算力,始终跟着数据走。
02
让离线到在线强化
学习“自适应”数据混合策略
强化学习有个著名的“水土不服”问题——“分布偏移”:在离线数据上训练好的模型,一上线就容易“失忆”。这是因为离线数据和在线交互数据之间存在分布差异,导致在线初期策略迅速“遗忘”离线学到的知识。
现有的解决办法无非两种:要么固定50%离线+50%在线这样的混合比例,要么用启发式规则优先采样“近策略”的样本。
但问题是,策略在不同阶段的需求完全不一样——早期需要更多离线数据稳住基本盘,后期需要更多在线数据探索新可能。固定策略,就是刻舟求剑。
蚂蚁集团联合上海交通大学提出ROAD ,把数据混合比例从一个“预设参数”变成了“动态决策变量”。
![]()
论文地址:https://arxiv.org/pdf/2605.14497
它的核心思想很有意思:数据选择本质上是个双层优化问题。
![]()
内层(Inner-Level):标准的Q学习更新,即最小化贝尔曼误差;
外层(Outer-Level):将数据混合策略视为元决策变量,以最大化在线策略的预期回报为目标。
两层通过多臂老虎机 MAB(Multi-Armed Bandit)算法近似求解,使得混合策略能够在训练过程中实时调整:一旦发现模型开始“遗忘”离线阶段学到的知识,就自动调高离线数据的采样比例来稳住基本盘;当模型趋于保守、探索不足时,又及时增加在线数据的占比,鼓励它去试错。
实验做得挺扎实。团队在离线到在线强化学习的三大经典基准上进行了验证:AntMaze(机器人在迷宫中寻找目标)、MuJoCo(仿生机器人的运动控制)和FrankaKitchen(机械臂在厨房中完成复杂操作)。这些任务难度不同、状态空间各异,能比较全面地检验算法的泛化能力。
![]()
为验证ROAD的算法普适性,研究团队ROAD和IQL、PEX、CQL、Cal-QL等多种主流离线算法“嫁接”在一起。结果显示:无论底层用哪种算法,ROAD都能稳定带来性能提升。
![]()
以PEX+ROAD为例,该方法在D4RL基准的24个连续控制任务上取得了71.12的总体平均分,24个任务里有18个排第一,显著优于固定比例、递减比例、启发式平衡回放等所有基线。
也就是说,ROAD 能够让模型在“保守继承”和“激进探索”之间找到了最优平衡点——既不会一上线就翻车,也不会错失实时数据带来的提升机会。该方法对蚂蚁集团风控模型上线、推荐系统实时优化这类场景而言,价值很鲜明。
03
DSEBO:让高维贝叶斯
优化“自适应”搜索子空间
贝叶斯优化是黑盒函数优化的经典方法,但一碰到高维问题就头疼。一种常见解法是随机嵌入——把优化投射到低维子空间,但新问题来了:有效维度到底是多少?
传统方法要么依赖专家经验给定固定子空间维度,要么通过试错法反复估计,不仅消耗大量资源,且固定的子空间维度难以适配不同任务。更麻烦的是,有效维度本身可能随优化进程变化:初期探索时低维度就够用,后期精调时可能需要更高维度的细节。
蚂蚁集团联合华东师范大学、南京大学提出的 DSEBO,让子空间维度成为优化进程中的“动态变量”,随搜索进度自主切换。
![]()
论文地址:https://arxiv.org/pdf/2605.23473
DSEBO的核心机制是“从低到高,逐级跃升”:
![]()
从低维子空间出发,优化器在低维空间生成候选解,经随机嵌入映射至原始空间,并快速摸清目标函数的大致轮廓,然后结果反馈驱动高斯过程迭代更新;
观察到收敛后自动触发维度扩展,通过共享嵌入矩阵把低维解“继承”到高维;
新子空间初始化和继续优化,由共享嵌入矩阵确保各子空间相互嵌套,形成“低维探索→收敛触发→维度扩展→继续优化”的循环,直到达到评估预算上限。
其中维度扩展环节,扩展幅度也不是固定的——算法会根据当前最优值变化曲线自适应调整:曲线平缓就慢点扩,省不必要的开销;曲线陡峭就快点扩,快速捕捉高维增益。
实验结果是:在合成函数(Levy、Griewank、Sphere,D=1000)和三个真实任务(MSLR、Lasso-Hard、LIMO)上,DSEBO与REMBO、SIRBO、BAxUS、TuRBO等十几种主流方法逐一对比,几乎所有任务上都拿下了最优解——精度和收敛速度双双领先。
![]()
这套“低维探路、高维精调”的打法,在蚂蚁的日常研发中也很实用——信贷模型的超参数调优、风控策略的阈值寻优、营销活动的多变量实验设计,不再需要专家拍脑袋估计维度了,算法自己会“边走边看”,实现了自动化、高效率的运行。
04
VGA-BenchV2:让视频评估
基准“自适应”AIGC生态的进化
如果说前三篇论文讨论的是算法层面的自适应,那么VGA-BenchV2展示的是评估基础设施如何“自适应”AIGC 技术生态的迭代。这也是四篇论文中唯一聚焦多模态内容理解的工作,映射了蚂蚁集团在数字生活、内容生态等非金融领域的战略储备。
AIGC让视频生产大爆发,但一个核心问题卡住了:我们怎么系统性评估这些生成视频的质量?
传统评估指标如 FVD(评估整体质量与时序连贯性)CLIP Score(评估生成图像与文字描述的语义一致性),主要看画面清不清晰、动作连不连贯、文本对不对得上。至于构图精不精妙、光影讲不讲究、色彩和不和谐——这些关乎“美感”的感知品质,它们几乎无能为力。
此前CVPR 2026上,蚂蚁联合北京电影学院、通用人工智能研究院(BIGAI)提出了VGA-Bench,首次为视频审美评估建立了三维度框架(美学质量、美学标签、生成质量),并基于1016个提示词、12个生成模型、超6万个视频构建了评估基准,让AI第一次学会了从专业视角“鉴赏”视频。
![]()
论文链接:https://arxiv.org/pdf/2604.10127
但视频生成模型进化太快,以月为单位的迭代节奏让固定基准很快就“不够用了”。在这篇IJCAI 2026论文中,团队又进一步推出VGA-BenchV2。
![]()
开源地址:
https://huggingface.co/datasets/BestVictoryLab/VGA-Bench
▎核心进化有三点:
第一,人工标注量级增加。VGA-BenchV2新增了36,000条任务级人工标注,其中美学质量标注16,200条、美学标签标注13,200条、生成质量标注6,600条,相比VGA-Bench分别实现了13.46倍、11.15倍和1.55倍的扩展。更充足的“人类偏好”数据,让评估器与人的审美判断对齐得更准。
第二,评估器架构升级。团队设计了混合架构:VAQA-Net负责连续美学评分,VTag-Net和VGQA-Net基于Qwen大视觉语言模型进行标签识别和质量评估。大模型的引入,让评估器对复杂视觉语义的理解上了一个台阶。实验结果表明,其在多个生成模型上的评估结果与人类判断高度一致。
第三,从“评估”到“优化”的闭环打通。 这是VGA-BenchV2最具突破性的设计:它将学到的美学评估器作为奖励信号,直接用于强化学习的生成模型微调。这意味着评估基准不再只是“裁判员”,它给出的分数可以直接转化为优化信号,指导生成模型在美学质量上持续迭代。
VGA-Bench到VGA-BenchV2,评估体系不再是静态的标尺,而是与生成生态“共进化”的活系统。对于蚂蚁集团的内容理解、安全审核、推荐优化等场景而言,视频质量评估能力不仅能跟上AIGC生态的演进,还能反过来驱动上游模型的优化:从“打分”到“优化”,闭环就此形成。
04
结束语:再聪明的算法,
终归要回到动态环境中检验
四篇论文分别从无监督学习、强化学习、黑盒优化和多模态评估四个方向切入,共同指向了同一个技术路径——从静态到动态的范式转换。
实验数据也印证了这条路径的有效性:MSRGC-Net在15项指标中拿下12个第一、2个第二;ROAD在多类离线到在线强化学习任务中超越现有策略;DSEBO在千维优化问题上实现了可量化的改进;VGA-BenchV2在多个生成模型上的评估结果与人类判断高度一致。
顺着这条技术路径再看蚂蚁的整体布局,会发现一个清晰的“双轮驱动”结构:一面在金融核心场景中深耕时序建模、强化学习和优化算法;一面在数字生活与内容生态中前瞻布局多模态理解与评估基础设施。
说到底,算法再聪明,终归要回到动态的环境中检验。这四篇论文的真正价值,或许正在于它们都生长在真实的业务土壤里:蚂蚁的业务场景不是论文的“背景板”,而是问题的来源、数据的产地和效果的检验场。
而这或许,正是工业界做 AI 研究最独特的地方——他们不只是在“做论文”,更是在为真实世界的问题,找“能抗住动态变化”的解法。
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.