蚂蚁集团一篇论文拿了VLDB 2026工业赛道最佳论文奖。获奖原因不是模型多聪明,而是把数据管理的活儿干到了极致——用一张“逻辑表”管住了3050亿条训练数据。
这套系统叫OmniTable,核心思路八个字:逻辑统一,物理分离。听起来抽象,翻译一下就是:数据在底层还是分散存的,但对外暴露的接口是一张统一的“大表”,上层应用不用关心数据散落在哪,直接查就行。
![]()
规模有多大?
35+PB的存储,3050亿条记录。这个量级下,传统的数据管理方式早就跑不动了,但OmniTable硬是把SFT(监督微调)数据准备的周期从14天压缩到2.5天,效率提升接近6倍。
为什么值得关注?
大模型训练里,数据准备往往是最脏最累的活。模型训练可能只要几天,但清洗、去重、格式化、拼接这些前置工作能拖上两周。OmniTable解决的就是这个瓶颈——让数据工程师不用再跟底层存储细节搏斗。
VLDB是数据库领域的顶级会议,工业赛道拿最佳论文,说明这套方案不是实验室玩具,而是真在蚂蚁的生产环境里跑出了效果。3050亿条数据能被一张表驯服,这个思路对任何做大模型训练的公司都有参考价值。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.