网易首页 > 网易号 > 正文 申请入驻

字节开源最全面代码大模型基准FullStack Bench

0
分享至

代码大模型越来越卷,评估AI编程水平的“考卷”也被迫升级。12月5日,字节豆包大模型团队开源最新代码大模型评估基准FullStack Bench,在业界首次囊括编程全栈技术中超11类真实场景,覆盖16种编程语言,包含3374个问题,相比此前基准,可以更有效地评估大模型在现实世界中的代码开发能力。

代码评估基准是衡量大模型编程能力的标准工具,也是推动模型优化的关键驱动力。不过,当前的代码评估基准覆盖的应用类型和编程语言较为有限,难以反映真实世界中代码开发场景的多样性和复杂性。

比如,主流代码评测集HumanEval和MBPP中近80%数据只聚焦基础编程和高级编程问题;DS-1000中95%数据都集中于数据分析和机器学习任务,且仅对Python语言进行评测;xCodeEval虽覆盖多项任务,但基本局限于高级编程和数学领域。

因此,字节豆包大模型团队与M-A-P开源社区联合提出FullStack Bench,一个专注于全栈编程和多语言编程的代码评估数据集。为囊括在真实全栈开发中涉及的各类应用场景,研究团队从全球最大的程序员技术问答社区Stack Overflow中随机抽取了50万个问题进行分析,筛选出占总问题数前88.1%的应用领域,并对其分布做了适当调整来保证每个领域的鲁棒性,最终形成了FullStack Bench关注的超过11种应用场景及分布比例。

FullStack Bench包含3374个问题,每个问题均包括题目描述、参考解决方案及单元测试用例,总计15168个单元测试。为保证评估准确性,问题内容均由相关领域的编程专家设计,并经AI和人工验证进行质量复核。在初始数据集构建后,团队根据主流代码大模型测试结果,按问题难度、模糊性和可解性对数据质量进行了交叉评估和进一步完善。

FullStack Bench数据集构成情况

为方便开发者对大模型代码能力进行系统性测试,豆包大模型团队还开源了一款高效的代码沙盒执行工具——SandboxFusion,用于评估来自不同语言的不同编程任务。除了FullStack Bench,SandboxFusion还兼容超过10种广泛使用的代码评估数据集,支持23种编程语言。开发者在单服务器上即可轻松部署SandboxFusion,也可直接在GitHub上进行体验。

发布评测基准及沙盒的同时,字节代码大模型也首次曝光。研究中,豆包大模型团队对全球20余款代码大模型及语言大模型的编程表现进行了评测(详见论文),其中包括未披露过的豆包代码大模型Doubao-Coder。

近半年,字节在代码大模型领域进展迅速,今年6月字节发布了由自研代码基座模型支撑的AI编程助手豆包MarsCode,目前每月为用户贡献百万量级代码。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
襄阳割麦反转?官方回应“割四赔五”是旧俗,可麦烂地里只是开始

襄阳割麦反转?官方回应“割四赔五”是旧俗,可麦烂地里只是开始

奇思妙想草叶君
2026-05-29 16:32:56
13死最新消息!肇事车主事发前一天疯发拉客信息,长期在杭州五常

13死最新消息!肇事车主事发前一天疯发拉客信息,长期在杭州五常

火山詩话
2026-05-29 17:16:33
杭州女子征婚:不要彩礼,能提供5分钟夫妻生活,每月给男人3000

杭州女子征婚:不要彩礼,能提供5分钟夫妻生活,每月给男人3000

谭谈社会
2026-05-28 18:34:27
五天近12亿,《给阿嬷的情书》被11亿成本大片打败,丢掉全球冠军

五天近12亿,《给阿嬷的情书》被11亿成本大片打败,丢掉全球冠军

影视高原说
2026-05-28 18:59:51
赛力斯高管谈特斯拉FSD入华:FSD模拟的是人类视觉驾驶逻辑 华为乾崑智驾超越人眼

赛力斯高管谈特斯拉FSD入华:FSD模拟的是人类视觉驾驶逻辑 华为乾崑智驾超越人眼

快科技
2026-05-29 15:40:07
襄阳“割四赔五”后续!当事人还原真相,父亲曝更多,官方回应

襄阳“割四赔五”后续!当事人还原真相,父亲曝更多,官方回应

180视角
2026-05-29 13:43:46
因金色毛发酷似特朗普,孟加拉国一头白化水牛走红,将被送往动物园免于被宰

因金色毛发酷似特朗普,孟加拉国一头白化水牛走红,将被送往动物园免于被宰

都市快报橙柿互动
2026-05-28 16:52:33
董明珠回应“不用海归派”言论:本意不是说“海归派”不好,坚信中国高校能培养出世界级的优秀人才

董明珠回应“不用海归派”言论:本意不是说“海归派”不好,坚信中国高校能培养出世界级的优秀人才

每日经济新闻
2026-05-27 23:38:01
37岁车手翻车身亡!家人炮轰组委会:黄金时间救援推诿 还我公道

37岁车手翻车身亡!家人炮轰组委会:黄金时间救援推诿 还我公道

念洲
2026-05-29 21:00:37
同事一个月请了三次丧假,结果领导说:你家亲戚死光了?然后同事就给了领导一耳光!我们上去拉偏架,最后领导被揍的鼻青脸肿,还降职调岗

同事一个月请了三次丧假,结果领导说:你家亲戚死光了?然后同事就给了领导一耳光!我们上去拉偏架,最后领导被揍的鼻青脸肿,还降职调岗

大爱三湘
2026-05-28 21:14:00
外交部郑重声明

外交部郑重声明

证券时报
2026-05-29 20:36:06
日本记者爆料,高市早苗外访归来大发雷霆,看来下跪都没求到稀土

日本记者爆料,高市早苗外访归来大发雷霆,看来下跪都没求到稀土

忠诚TALK
2026-05-29 11:13:57
美股半导体硬件、存储芯片、服务器、应用软件全线爆发 多股再创历史新高

美股半导体硬件、存储芯片、服务器、应用软件全线爆发 多股再创历史新高

财联社
2026-05-29 21:44:13
印度富婆看不起中国,携带200万元就来炫富,结果想在中国定居

印度富婆看不起中国,携带200万元就来炫富,结果想在中国定居

千秋文化
2026-05-29 19:52:25
41岁夫妻因“房事频繁”双双入院,医生提醒:每周不应超过一个数

41岁夫妻因“房事频繁”双双入院,医生提醒:每周不应超过一个数

医学原创故事会
2026-05-29 23:34:07
国务院出台新规,将改写2.5亿普通人的命运

国务院出台新规,将改写2.5亿普通人的命运

流苏晚晴
2026-05-29 16:11:42
骑手将外卖挂在门把手上未打电话被投诉,顾客:很忌讳,像上供;骑手被罚款10元后划破顾客门锁,平台:无法赔偿修锁费用,建议走法律途径

骑手将外卖挂在门把手上未打电话被投诉,顾客:很忌讳,像上供;骑手被罚款10元后划破顾客门锁,平台:无法赔偿修锁费用,建议走法律途径

台州交通广播
2026-05-29 20:25:23
别急着赢!华为韬(τ)定律威胁不了台积电,"逻辑折叠"并非首创

别急着赢!华为韬(τ)定律威胁不了台积电,"逻辑折叠"并非首创

可达鸭面面观
2026-05-29 16:35:20
耿彦波落选原因复杂

耿彦波落选原因复杂

叮当当科技
2026-05-30 01:50:40
37岁企业董事长、车手张秀军环塔拉力赛中意外离世,弟弟发声:哥哥开车翻到水坑里溺亡,三个年幼孩子尚不知父亲遇难

37岁企业董事长、车手张秀军环塔拉力赛中意外离世,弟弟发声:哥哥开车翻到水坑里溺亡,三个年幼孩子尚不知父亲遇难

极目新闻
2026-05-29 21:53:30
2026-05-30 04:27:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
11933文章数 117088关注度
往期回顾 全部

科技要闻

Claude Opus 4.8凌晨突发上线

头条要闻

释永信被判24年 中国佛教协会:完全是咎由自取

头条要闻

释永信被判24年 中国佛教协会:完全是咎由自取

体育要闻

即使是文班亚马,也做不到这件事

娱乐要闻

奚梦瑶何猷君将于6月在法国举行婚礼

财经要闻

近3个月跌超20% 黄金"猴市"下的众生相

汽车要闻

900V+3.2秒破百 领克10+&领克10上市16.99万元起

态度原创

手机
房产
本地
数码
公开课

手机要闻

自研OS+玄戒+AI大模型,小米18系列,稳了!

房产要闻

顺德澐璟「澐冠」再出圈:顶阶人群不是买房,是追加“传世资产”

本地新闻

用剪纸的方式,打开江苏扬州

数码要闻

宏碁推多款游戏新品:两款笔记本、一款串流掌机,还有键盘、背包

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版