网易首页 > 网易号 > 正文 申请入驻

浙大清华新研究:给表格大模型装上‘进化技能库’,告别盲目自信

0
分享至


不更新模型参数,如何让表格大模型获得可进化的边界拓展能力?SkillTFM:首次将Skill技术引入表格大模型。

编辑丨岑峰


编者按:

在近期的深度报道中,AI科技评论持续为您追踪了因果智能(Causal AI)的发展脉络——从“稳定学习”打破分布外泛化(OOD)魔咒,到因果大数据模型重塑物理世界,再到因果发现大模型DAG-FM 破解因果图的理论死结。我们反复向行业抛出一个命题:单纯依靠“关联拟合”与“海量刷题”的深度学习大模型,在面对未知环境与分布偏移时,必然陷入“盲目自信”的系统性幻觉。

那么,在当下火热的大模型与 Agent(智能体)时代,严谨的“因果哲学”究竟应该如何工程化落地?

今天我们为大家解读的这篇《SkillTFM》工作,给出了一套教科书级别的解法。

这篇论文首创性地将 Agent 领域的“Skill(技能)”引入了表格大模型。表面上看,这是一次系统架构的创新;但在底层,这完全是因果思想在 Agent 时代的一次“降维打击”:面对模型的局部失败,它拒绝了传统打补丁的盲目性,而是将因果推断中最核心的准则刻入了系统基因——无证据,不干预;无安全验证,不部署。

在这个框架下,强如 Claude 或 Gemini 等顶级 LLM,也仅仅拥有“提案权”,而没有“部署权”。任何修改都必须经过严格的局部因果证据匹配和无害性(no-harm)检查。本文将带您深度拆解,因果思想是如何化身为“理性的守门员”,让大模型获得安全、可控且可进化的边界拓展能力的。

论文标题:SkillTFM: Gated Skill Evolution for Training-Free Adaptation of Tabular Foundation Models

论文链接:https://arxiv.org/abs/2608.06137

研究团队:浙江大学、清华大学

通讯作者:浙江大学人工智能学院况琨副教授

论文核心亮点:

边界定位:表格基础模型并非在整个任务上完全失效,其错误通常集中在特定数据结构或局部区域。SkillTFM 首次将Skill技术引入表格基础模型,从数据规律和模型行为中识别这些边界,只在证据充分时执行修复。

选择性修复:系统不会无条件调用预处理或校准方法,而是对候选技能进行排序和认证;没有技能通过时,主动保留基础模型预测。

闭环进化:SkillTFM 将边界证据、执行记录、候选修改与本地验证连接成闭环,使系统不仅能调用已有技能,还能在发现新边界后,经验证吸收新的能力。

迁移能力:实验将同一套外部技能状态应用于 LimiX、TabPFN、TabICL和TabDPT,并在四种 runner 上均观察到性能提升。

表格基础模型正在颠覆传统的结构化数据学习方式。面对一个新数据集,模型可以通过任务上下文直接服务新数据集,大幅免去了逐一训练和反复调参的痛苦。

但统一预测器并不意味着没有边界。当真实物理世界的数据出现分布偏移、缺失、噪声或未知的非线性结构时,再强的表格大模型也会产生系统性误差。如果直接保留原始预测,等于对错误视而不见;但如果固定地执行预处理或校准,又极易破坏模型原本可靠的结果。

这里的真正难点,并不是程序员手里有没有“修复工具”,而是:当前任务是否真的需要修复?现有证据是否足以支持修复?当新的失败模式出现时,系统能否把处理经验转化为可复用的新能力?

为此,研究团队提出了SkillTFM。据我们所知,SkillTFM 是首个将 Skill 引入表格基础模型免训练适配的框架,并可通过可插拔设计接入不同的智能体与表格基础模型。它将证据驱动的技能调用、选择性修复与验证式技能更新连接成闭环。

不同于重新训练模型或固定执行后处理,SkillTFM 将能力扩展放在模型外部:系统既能调用已有技能处理已知边界,也能在发现新边界后,经验证吸收新的技能与控制规则。证据充分时,系统执行修复;证据不足时,则保留基础模型预测。

在 10 次随机种子实验中,SkillTFM 在三类边界设置下取得了 0.128–0.142 的平均 AUC 增益,并实现了惊人的“Zero Observed Harm(零观察伤害)”。面对初始技能库未覆盖的非线性边界,技能进化更是一举将 AUC 从 0.699 暴力拉升至 0.898。

01

边界失败,绝不等于模型整体失效

现实中的模型失败,往往不是一个简单的“会”或“不会”。

以论文中的电价预测任务为例,基础模型在绝大部分时间段内都能给出合理预测,却偏偏在几个局部区域“掉链子”——比如出现周期性的高估、短时的持续高估,或者面对价格快速上冲时反应迟钝(低估幅度)。

面对这种情况,SkillTFM 拒绝“推倒重来”。它不会重新生成整条预测曲线,而是从局部数据规律和基础模型的误差趋势中寻找证据,只修改获得证据支持的区域;而在证据不足、或修复方案未通过安全认证的区域,系统会非常保守地保留基础模型的原始预测。



图1:丨 真实电价预测中的选择性修复。SkillTFM 针对周期性高估、短时持续高估和快速上冲低估调用相应技能,并在其他区域保留基础模型轨迹。

在这种克制的“选择性修复”下,两个示例窗口的 MAE分别从 45.03 降至 23.90,以及从 66.16 降至 33.62。在完整电价预测实验中,SkillTFM 仅仅修改了 38.2% 的预测点,却精准覆盖了 83.4% 的大误差点,让整体 MAE 发生质变(53.02 降至 25.16)。

这个案例揭示了 SkillTFM 的基本判断:模型的能力边界不是一道死板的“三八线”。即使在同一个任务中,也可能同时存在“亟待修复的雷区”和“必须保留的安全区”。

02

SkillTFM:让边界拓展有证据、有门槛

SkillTFM 是如何在基础模型外部,搭建起这套结构化的技能状态的?其核心由证据提取、修复技能、门控策略和技能记忆四大模块组成。

首先,系统观察当前数据与基础模型行为,从特征分布、标签与特征关系、预测偏差、趋势和周期性、缺失模式等方面寻找边界迹象。

随后,这些证据会激活技能库中可能适用的修复技能,例如特征筛选、降维、样本调整、缺失修复、输出校准和预测融合。技能库中的方法不会全部执行,只有适用条件与当前证据匹配、且没有触发禁用条件的技能才会进入候选集合。

候选技能经过排序后,按照顺序依次接受运行时认证。只有当证据充分、风险可接受,并且历史失败记录没有阻断该路线时,候选技能才会执行。如果排名靠前的候选没有通过,系统继续检查下一个;如果所有候选均未通过,则 fallback 到基础模型预测。


图2丨SkillTFM 的整体机制。下方展示证据如何激活修复技能,并通过排序和认证产生 certified repair 或 fallback;上方展示执行记录如何形成候选修改,并经过 promotion gate 更新技能状态。

SkillTFM 还会记录每次 repair 或 fallback 时观察到的证据、考虑过的技能、认证结果和最终动作。当已有技能无法覆盖新的边界时,这些 execution traces 可以支持本地搜索、失败分析或外部 LLM 提出 candidate edits。

新的候选不只可以增加修复方法,也可以调整证据提取、技能排序和风险控制方式。但任何候选都不能直接进入部署状态:它必须证明自己能够改善目标边界,并通过 no-harm 与回归检查。

在初始技能库没有覆盖的非线性边界上,SkillTFM 首先选择全部 fallback,与基础模型保持相同的0.699 AUC;新的非线性技能通过验证后,AUC 提升至0.898,fallback rate 降至23.0%,同时没有观察到性能伤害。

03

该拓展时拓展,该保留时保留

研究首先在 held-out、mixed 和 generator/severity transfer 三种边界设置下评估 SkillTFM。

SkillTFM 在三种设置下分别取得 0.142、0.135 和 0.128 的平均 AUC 增益,并保持 zero observed harm。这些结果说明,技能层不仅能够覆盖训练时已经观察到的边界,还可以迁移到边界混合、生成机制变化和严重程度变化的任务。

但 SkillTFM 并不追求尽可能高的修复覆盖率。研究进一步按照基础模型的 AUC 将任务划分为 C1–C4 四个性能区间,观察系统在不同基础能力下的行为。


表1丨不同边界设置下的能力评估。表中报告10次随机种子实验的均值与标准差。


图3丨不同基础模型性能区间下的边界拓展与 fallback 行为。随着基础模型性能提高,SkillTFM 的修复收益逐渐收敛,同时更加倾向于保留原始预测。

在 C1 区间,基础模型 AUC 仅为 0.367,SkillTFM 将其提升至 0.815,增益达到 0.448,fallback rate 为 12.5%。随着基础模型逐渐可靠,修复收益依次下降,fallback rate 则从 27.3%、63.2% 持续上升。

到了 C4 区间,基础模型 AUC 已达到 0.931,SkillTFM 仅将其提高至 0.936,同时 fallback rate 达到 98.8%。

这说明 SkillTFM 并不会因为技能库中存在修复方法就强行调用。面对明显边界失败时,它积极拓展能力;当基础模型已经接近性能饱和时,它几乎完全保留原始预测。

04

技能可以跨模型迁移,LLM 也只有“提案权”

如果外部技能只适用于某一个基础模型,那么它仍然更像模型专属补丁,而不是可复用的边界能力。

研究将同一套 SkillTFM 技能状态连接到 LimiX、TabPFN、TabICL和TabDPT。尽管这些模型的结构、训练方式和基础性能不同,SkillTFM 均带来稳定改善,核心迁移实验中的 AUC 增益达到 0.139–0.148。


图4丨SkillTFM 在不同表格基础模型之间的技能迁移。同一套外部技能状态持续改善四种 TFM,说明经过验证的边界处理能力可以跨基础模型复用。四种 runner 上的一致增益说明,学习到的 skill state 并非针对单一模型构造的临时补丁,而具有跨 TFM 复用的潜力。

这种可迁移性同样体现在技能进化的候选提出环节。SkillTFM 不绑定某一个固定的 optimizer,Qwen、Gemini 和 Claude 都可以根据 execution traces 分析失败模式,并提出新的候选修改。

但大模型只有“提案权”,没有“部署权”。


表2丨不同 LLM optimizer 在统一 SkillTFM 技能进化协议下的候选修改结果。LLM 负责提出候选方案,本地 promotion gate 独立决定其能否进入部署状态。

实验中,Qwen、Gemini 和 Claude 分别提出了 7、11 和 11 个符合格式要求的候选。其中只有少数候选通过基础模型上的初步验证,最终没有一个候选满足完整的 promotion 条件;Claude 提出的方案则因证据不足而停止晋升。

这些结果体现了本地 promotion gate 的作用:不同 LLM 负责提出候选方案,但不能直接修改部署状态;候选是否被接受,取决于其是否具有充分证据、带来目标能力提升,并通过 no-harm 与回归检查。

05

结语:从“盲目拟合”走向“可控进化”

SkillTFM 提供了一种面向表格基础模型的能力拓展路径,为当前火热的大模型 Agent 架构指明了一条新路:大模型负责提供强大的通用预测基础,而外部的 Skill State(技能状态)则作为“理性的守门员”,专门处理那些有明确证据支持的边界疑难杂症,并将验证过的新经验内化为可复用的能力。

这项工作表明:在不更新大模型底层参数的前提下,凭借基于证据的选择性修复严苛的门控技能进化,AI 系统的能力边界依然可以得到持续、安全、可验证的拓展。这不仅是一次技术的突破,更是一次模型治理哲学的胜利。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
打,奉陪到底,中方连下三禁令,堵住28国后路,一个时代开始了

打,奉陪到底,中方连下三禁令,堵住28国后路,一个时代开始了

夏末moent
2026-08-13 16:16:23
双子星合砍31分!中国男篮还能相信吗?

双子星合砍31分!中国男篮还能相信吗?

柚子说球
2026-08-14 00:14:05
2026年全国高校最新排名!北理工位居第11,武汉大学跌到23名

2026年全国高校最新排名!北理工位居第11,武汉大学跌到23名

教育导向分享
2026-08-13 18:42:00
Alo海外官网已对中国停售

Alo海外官网已对中国停售

第一财经资讯
2026-08-13 12:12:55
美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

心灵得以滋养
2026-08-13 10:32:18
为什么体制内许多人不愿意出差了?网友:更难绷的是疗休养

为什么体制内许多人不愿意出差了?网友:更难绷的是疗休养

夜深爱杂谈
2026-08-12 22:13:28
唐艺素颜被罚30万掉粉4万,中年女歌手的审美困境

唐艺素颜被罚30万掉粉4万,中年女歌手的审美困境

陈意小可爱
2026-08-14 00:51:44
泪目!台风天,女外卖员半路把1岁娃托给上海一超市!店主:孩子浑身湿透颤抖……你送完再来接!

泪目!台风天,女外卖员半路把1岁娃托给上海一超市!店主:孩子浑身湿透颤抖……你送完再来接!

环球网资讯
2026-08-13 09:12:17
大家发现没有了吗?油车跑1000公里要500块,电车跑1000公里呢?

大家发现没有了吗?油车跑1000公里要500块,电车跑1000公里呢?

白米饭怎么吃
2026-08-04 20:31:41
回顾:山东女子野生虎区强行下车,与幼虎合照,10分钟后悲剧发生

回顾:山东女子野生虎区强行下车,与幼虎合照,10分钟后悲剧发生

兰姐说故事
2025-01-17 10:30:03
“子承父业”称霸一方近30年,大连“丁氏”家族23人涉黑案2019

“子承父业”称霸一方近30年,大连“丁氏”家族23人涉黑案2019

刘哥谈体育
2026-08-14 00:45:39
8月开始中国或将迎来四大降价潮:除车价以外,这三类也要降价了

8月开始中国或将迎来四大降价潮:除车价以外,这三类也要降价了

民生格物
2026-08-12 15:47:24
玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

木言观
2026-08-01 13:58:35
钟晱晱:干死实体的是电商平台!于东来:不,是黑心的房东!

钟晱晱:干死实体的是电商平台!于东来:不,是黑心的房东!

壹只灰鸽子
2026-08-12 14:11:22
触目惊心!南太行22岁程梦圆坠亡,多张现场图复盘:她离张良庙的平地非常近了

触目惊心!南太行22岁程梦圆坠亡,多张现场图复盘:她离张良庙的平地非常近了

火山詩话
2026-08-11 12:01:11
八强出炉!泰国爆冷淘汰波兰,日本单局7分崩盘,亚洲多达4队

八强出炉!泰国爆冷淘汰波兰,日本单局7分崩盘,亚洲多达4队

跑者排球视角
2026-08-13 14:52:37
今夜,13家A股公司紧急提示风险

今夜,13家A股公司紧急提示风险

21世纪经济报道
2026-08-14 01:20:21
法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

落纸生花创意手工
2026-07-19 12:06:31
多名演员发文抵制,业内人士:很悲哀,收入猛降八成,几乎成“免费劳动力”

多名演员发文抵制,业内人士:很悲哀,收入猛降八成,几乎成“免费劳动力”

上海约饭局
2026-07-05 15:23:20
网友:郭德纲改红歌有什么错?分明是网友小题大做、上纲上线!评论区不少人替郭德纲喊冤!

网友:郭德纲改红歌有什么错?分明是网友小题大做、上纲上线!评论区不少人替郭德纲喊冤!

谭谈社会
2026-08-14 00:22:14
2026-08-14 06:12:49
粤语音乐喷泉
粤语音乐喷泉
来听音乐吧
145文章数 11802关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

本地
教育
旅游
游戏
公开课

本地新闻

黄州一夜,苏轼写给普通人的月光

教育要闻

8月30日前完成!山东综评价系统填写教程!

旅游要闻

春城昆明名字根源,不是滇池不是美景,源自两千年前滇西古老部族!

跨越星海的“仰齐与共”,我们又打了一场“仰齐浜”保卫战

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版