网易首页 > 网易号 > 正文 申请入驻

7B模型对标GPT-4o,全球首个医疗代码生成大模型训练平台来了

0
分享至

德克萨斯大学西南医学中心团队投稿 发自 凹非寺
量子位 | 公众号 QbitAI

医疗AI场景复杂,需要“又懂医疗又懂编程”的agent。

但像GPT这样现成的大模型难以直接部署,该如何突破技术壁垒?

答案是:打造一个统一的训练平台,专门训练能够生成医疗代码的大模型。

最近,来自埃默里大学、佐治亚理工学院、耶鲁大学和德克萨斯大学西南医学中心的研究团队,发布了全球首个专注于医疗代码生成的大模型训练平台——MedAgentGym。

该平台不仅提供了全面的评估基准,更重要的是建立了完整的训练生态系统,能够系统性提升大模型在医疗领域的代码生成和推理能力。

实验结果表明,经过MedAgentGym训练的开源模型Med-Copilot-7B在多项医疗编程任务上达到了与GPT-4o相当的性能水平。

医疗AI的”编程瓶颈”

当前医疗AI应用面临着一个关键技术挑战:如何让AI系统自动生成可靠的医疗相关代码。

无论是处理电子健康记录(EHR)查询、生物信息学分析,还是构建临床决策支持系统,都需要精确的编程能力作为支撑。

然而,现有解决方案存在明显局限:

商业模型的现实困境

- 数据隐私风险:医疗数据的敏感性使得直接调用商业API存在合规风险
- 成本压力:大规模医疗应用的API调用费用难以承受
- 部署限制:无法在本地或私有云环境中灵活部署

开源模型的能力短板

- 专业知识不足:缺乏深度的医学领域知识
- 编程能力有限:在复杂的医疗编程任务上表现不佳
- 训练资源缺乏:缺少专门的医疗代码训练数据和环境

研究表明,引入编程能力可以显著提升模型在计算医疗推理任务上的表现。在MIMIC-III、eICU和MedCalcBench等数据集中,基于代码的计算推理成功率远高于传统的自然语言推理方法。

在MIMIC-III、eICU和MedCalcBench三个数据集中,基于代码的计算推理(橙色)成功率远高于传统的叙述式推理(蓝色)。

MedAgentGym:突破性的解决方案

与其他基准相比,MedAgentGym提供了集成了可执行环境、交互式反馈和任务隔离运行设施的编码训练平台。为了解决这一系列挑战,MedAgentGym提供了一个前所未有的综合性解决方案。该平台的核心创新体现在三个维度:

大规模真实医疗任务集合

MedAgentGym整合了来自12个真实生物医学场景的72,413个编程任务实例,覆盖129个不同类别。

任务范围横跨四大核心领域:
- 结构化医疗信息检索:如EHR数据库查询、临床记录分析
- 医疗数据科学:包括统计分析、临床计算等
- 生物信息学建模:涵盖序列分析、系统发育学等
- 机器学习应用:临床预测、风险评估等

数据模态极其丰富,包含临床笔记、实验室报告、EHR表格、生物序列等多种格式,全面考验模型的综合处理能力。

高效可扩展的训练基础设施

MedAgentGym在技术架构上实现了多项突破:

- 容器化隔离环境:每个任务都封装在独立的Docker容器中,预装所有依赖项,确保环境安全性和可复现性
- 交互式反馈机制:当代码执行出错时,系统能将错误信息转化为结构化的自然语言反馈,帮助模型进行调试和优化
- 并行处理能力:集成Ray和Joblib等后端引擎,支持大规模并行轨迹采样和训练

在拥有交互式调试能力时(蓝色),gpt-4.1-mini模型的性能远高于移除该能力后(橙色)的表现,证明了MedAgentGym交互式环境的巨大价值。

此外,错误类型分析揭示了当前模型在复杂医疗代码任务中面临的主要挑战。其中,“陷入循环”不能成功debug是最主要的错误类型,占比高达50.39%。

全面的模型评估体系

研究团队系统性评估了超过25个主流大模型,包括:

  • API商业模型:GPT系列
  • 开源通用模型:Qwen、LLaMA、Gemma等
  • 专业编程模型:Qwen2.5-Coder等
  • 医疗领域模型:HuatuoGPT、MedReason等

评估结果揭示了商业模型与开源模型之间的显著性能差距,为后续优化指明了方向。

MedAgentGym零样本(Zero-shot)测试集结果详细列出了超过25个前沿大模型在8个不同任务上的原始得分,是评估各模型在医疗代码生成领域综合实力的核心依据。

Med-Copilot:开源模型的逆袭之路

基于MedAgentGym平台,研究团队开发了Med-Copilot系列模型,并取得了突破性成果。

训练策略: 采用两阶段精细化训练框架:

- 监督微调(SFT):使用2,137个成功执行的代码轨迹进行初始训练
- 强化学习优化(DPO):通过偏好优化进一步提升性能

性能突破

Med-Copilot-7B通过SFT训练,性能提升36.44%
结合DPO后,总体性能提升达到42.47%
最终在MedAgentGym基准上达到59.90分,接近GPT-4o的性能水平

关键技术创新

研究团队还训练了一个AI验证器(Verifier),能够从多次代码生成尝试中自动识别最佳解决方案。实验显示:

  • 在16次尝试中,模型的潜在成功率可达45%
  • AI验证器能够以42%的准确率识别出正确答案
  • 仅有3%的差距证明了验证器的可靠性

仅使用SFT、仅使用DPO以及SFT与DPO结合的策略对7B和14B基础模型性能的提升效果,验证了SFT+DPO两阶段训练框架的有效性。

可持续进化的蓝图:自我提升与性能扩展

MedAgentGym不仅展示了一次性的成功,更揭示了一条可持续进化的清晰路径。其中的关键,在于一个强大的“AI裁判”(即验证器,Verifier)。

性能具备高度可扩展性

研究团队让模型对同一个任务进行多次尝试(最多16次),并让“AI裁判”从这些尝试中选出最佳答案。结果令人惊喜:

- 潜力上限 (Pass@k):在16次尝试中,模型只要有一次成功,就算解出。在这种理想情况下,成功率从单次尝试的17%飙升至45%。这说明模型本身具备解决问题的潜力。
- 实际表现 (Best@k):更关键的是,在“AI裁判”的帮助下,从这16次尝试中自动选出的最佳答案,其实际成功率高达42%!

仅有3%的微小差距证明,这个AI裁判的眼光极其“毒辣”,能够非常可靠地识别出正确的解决方案。这一成果意义重大,因为它意味着这个验证器已经足够强大,可以作为奖励模型(Reward Model)赋能给PPO、GRPO等更先进的在线强化学习框架,为训练出更强大的医疗AI铺平了道路。

- 无论是增加训练数据量,还是在推理时增加尝试次数(Rollouts),模型的最终成功率都表现出稳定、显著的提升。这为未来进一步提升模型性能指明了方向:更多的计算投入和数据积累,将带来更强大的医疗AI智能体。

推理时增加尝试次数(k)能提升成功率(Pass@k);此外,显示增加训练数据量也能稳定提升模型表现。

- 模型可以自我提升:这种强大的验证能力也解锁了模型的自我提升:AI智能体可以通过“拒绝采样+迭代DPO”的自我改进循环,利用自己生成的轨迹数据进行持续学习和优化,不断突破性能上限 (3-5%)。

通过“拒绝采样SFT”和两轮DPO的自我改进循环,模型性能得以持续增长。

未来展望:加速医疗AI的普惠化进程

MedAgentGym的发布,为医学的AI和大语言模型智能体的研究者和开发者提供了一个强大工具。它通过提供一个统一、开放、可扩展的平台,填补了医疗代码智能体开发领域的关键空白。

通过将真实世界的生物医学任务、高效可复现的基础设施以及对前沿模型的大规模基准测试相结合,MedAgentGym为推动LLM在医疗领域的应用奠定了一个坚实的基础。

研究团队希望,MedAgentGym能够激发更多创新,促进高效、可靠、临床接地的AI智能体的发展,最终为现实世界的医疗研究与实践提供支持。

有理由相信,在MedAgentGym的助力下,一个能够从成功中学习、从失败中进化的,更加智能和高效的未来医疗新时代,正加速到来。

论文链接:https://arxiv.org/abs/2506.04405

项目主页:https://wshi83.github.io/MedAgentGym-Page/

代码链接:https://github.com/wshi83/MedAgentGym

数据及模型:https://huggingface.co/MedAgentGym

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
欺负台渔民的菲律宾,获台当局赠送舰艇,岛内民众也看不下去了

欺负台渔民的菲律宾,获台当局赠送舰艇,岛内民众也看不下去了

相思赋予谁a
2026-09-18 21:06:29
伯克希尔·哈撒韦任命沃伦·巴菲特为名誉董事长,霍华德·巴菲特任董事长

伯克希尔·哈撒韦任命沃伦·巴菲特为名誉董事长,霍华德·巴菲特任董事长

界面新闻
2026-09-18 18:07:13
苹果新品官宣,9月18日,正式发售

苹果新品官宣,9月18日,正式发售

科技堡垒
2026-09-17 11:07:17
中央批准,张文兵任江苏省委常委

中央批准,张文兵任江苏省委常委

上观新闻
2026-09-18 18:10:03
国际乒联重磅宣布:未来两届单打世界杯举办地确定,静待洛奥到来

国际乒联重磅宣布:未来两届单打世界杯举办地确定,静待洛奥到来

乒谈
2026-09-18 09:11:29
1年倒闭九万家,五个月亏损200万?昔日的暴利生意正批量“失联”

1年倒闭九万家,五个月亏损200万?昔日的暴利生意正批量“失联”

老沮系戏精北鼻
2026-09-18 14:45:02
中国第二轮“严打”来了,这次更严格,一个都跑不了!

中国第二轮“严打”来了,这次更严格,一个都跑不了!

职场资深秘书
2026-09-18 19:47:37
英联杯:17岁妖星双响 新援阿兰1射1传 曼城5-0诺维奇豪取6连胜

英联杯:17岁妖星双响 新援阿兰1射1传 曼城5-0诺维奇豪取6连胜

钉钉陌上花开
2026-09-18 05:49:21
斯诺克最新战报!中国军团2进3出,新人爆冷吉尔伯特,2将1-6惨败无缘正赛!

斯诺克最新战报!中国军团2进3出,新人爆冷吉尔伯特,2将1-6惨败无缘正赛!

刘姚尧的文字城堡
2026-09-18 20:02:07
10万亿!中国或将成为全球,乃至人类历史上,第一个“电力王国”

10万亿!中国或将成为全球,乃至人类历史上,第一个“电力王国”

福建睿平
2026-08-14 07:35:06
住建部:4楼及以上住宅都要加装电梯,所有临空处护栏高度提高到不低于1米2

住建部:4楼及以上住宅都要加装电梯,所有临空处护栏高度提高到不低于1米2

大象新闻
2026-09-18 13:03:10
3个月内三位“金融副省长”回归金融系统!黄志强出任国开行行长,蔡东履新金融监管总局

3个月内三位“金融副省长”回归金融系统!黄志强出任国开行行长,蔡东履新金融监管总局

时代周报
2026-09-18 21:02:16
完了!问界真要撤出华为门店了,有网友开始退定金,二手车价格也崩了?

完了!问界真要撤出华为门店了,有网友开始退定金,二手车价格也崩了?

南财社V
2026-09-17 22:29:10
手机,要变天了

手机,要变天了

牛弹琴
2026-09-16 06:22:20
佩莱格里诺、马斯坦托诺兑现承诺,请全队吃阿根廷烤肉

佩莱格里诺、马斯坦托诺兑现承诺,请全队吃阿根廷烤肉

懂球帝
2026-09-18 18:08:02
国民党一人不装了,疯狂攻击大陆,挑战郑丽文,十分不简单

国民党一人不装了,疯狂攻击大陆,挑战郑丽文,十分不简单

DS北风
2026-09-17 16:18:04
郑秀文用半辈子减肥,抑郁、暴瘦至78斤,终在54岁发福认不出

郑秀文用半辈子减肥,抑郁、暴瘦至78斤,终在54岁发福认不出

汪巗的创业之路
2026-09-17 04:15:02
办不起就别办!中国队自费住酒店,泰国队机场打地铺,印度队最惨

办不起就别办!中国队自费住酒店,泰国队机场打地铺,印度队最惨

天马幸福的人生
2026-09-17 20:25:07
圆明园人员经费五年超10亿,钱都花在哪了?

圆明园人员经费五年超10亿,钱都花在哪了?

马小白
2026-09-18 14:01:07
回来了!国安边路飞翼伤愈复出,2次骨折不言弃,明年能否留队?

回来了!国安边路飞翼伤愈复出,2次骨折不言弃,明年能否留队?

体坛鉴春秋
2026-09-18 17:23:58
2026-09-18 21:48:49
量子位 incentive-icons
量子位
追踪人工智能动态
13349文章数 176565关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

赖清德当局拟赠菲律宾退役船舰"金门舰" 遭国民党痛批

头条要闻

赖清德当局拟赠菲律宾退役船舰"金门舰" 遭国民党痛批

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

艺术
时尚
游戏
数码
亲子

艺术要闻

刘炜画了幅《我的风景》,1840万!

没想到这件事,对我的改变这么大!

玩家票选《生化危机》十大英雄 艾达王排名引争议

数码要闻

蓝宝石公布类魂游戏《不朽遗志》联名款NITRO+ RX 9070 XT OC显卡

亲子要闻

走进爱他美放心工厂:以食品安全守护万千妈妈信任

无障碍浏览 进入关怀版