网易首页 > 网易号 > 正文 申请入驻

字节开源FullStack Bench,首次覆盖全栈编程超11类真实场景

0
分享至


代码大模型越来越卷,评估AI编程水平的“考卷”也被迫升级。12月5日,字节豆包大模型团队开源最新代码大模型评估基准FullStackBench,在业界首次囊括编程全栈技术中超11类真实场景,覆盖16种编程语言,包含3374个问题,相比此前基准,可以更有效地评估大模型在现实世界中的代码开发能力。

代码评估基准是衡量大模型编程能力的标准工具,也是推动模型优化的关键驱动力。不过,当前的代码评估基准覆盖的应用类型和编程语言较为有限,难以反映真实世界中代码开发场景的多样性和复杂性。

比如,主流代码评测集HumanEval和MBPP中近80%数据只聚焦基础编程和高级编程问题;DS-1000中95%数据都集中于数据分析和机器学习任务,且仅对Python语言进行评测;xCodeEval虽覆盖多项任务,但基本局限于高级编程和数学领域。

FullStackBench数据覆盖超11种应用领域,远超当前主流代码评估基准

因此,字节豆包大模型团队与M-A-P开源社区联合提出FullStackBench,一个专注于全栈编程和多语言编程的代码评估数据集。为囊括在真实全栈开发中涉及的各类应用场景,研究团队从全球最大的程序员技术问答社区StackOverflow中随机抽取了50万个问题进行分析,筛选出占总问题数前88.1%的应用领域,并对其分布做了适当调整来保证每个领域的鲁棒性,最终形成了FullStackBench关注的超过11种应用场景及分布比例。

FullStackBench包含3374个问题,每个问题均包括题目描述、参考解决方案及单元测试用例,总计15168个单元测试。为保证评估准确性,问题内容均由相关领域的编程专家设计,并经AI和人工验证进行质量复核。在初始数据集构建后,团队根据主流代码大模型测试结果,按问题难度、模糊性和可解性对数据质量进行了交叉评估和进一步完善。

FullStackBench数据集构成情况

为方便开发者对大模型代码能力进行系统性测试,豆包大模型团队还开源了一款高效的代码沙盒执行工具——SandboxFusion,用于评估来自不同语言的不同编程任务。除了FullStackBench,SandboxFusion还兼容超过10种广泛使用的代码评估数据集,支持23种编程语言。开发者在单服务器上即可轻松部署SandboxFusion,也可直接在GitHub上进行体验。

发布评测基准及沙盒的同时,字节代码大模型也首次曝光。研究中,豆包大模型团队对全球20余款代码大模型及语言大模型的编程表现进行了评测(详见论文),其中包括未披露过的豆包代码大模型Doubao-Coder。

近半年,字节在代码大模型领域进展迅速,今年6月字节发布了由自研代码基座模型支撑的AI编程助手豆包MarsCode,目前每月为用户贡献百万量级代码。

·论文地址:https://arxiv.org/pdf/2412.00535v2

·数据集开源地址:https://huggingface.co/datasets/ByteDance/FullStackBench

·沙盒开源地址:https://github.com/bytedance/SandboxFusion

·沙盒体验入口:https://bytedance.github.io/SandboxFusion/playground/datasets

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1场3-1逆转,乌兹别克垫底淘汰,韩国被送回家,世界杯第30队出线

1场3-1逆转,乌兹别克垫底淘汰,韩国被送回家,世界杯第30队出线

侃球熊弟
2026-06-28 09:40:59
输球急眼了?韩国出局怪到中国头上,日本网友:以后我们也这么说

输球急眼了?韩国出局怪到中国头上,日本网友:以后我们也这么说

赵或是个热血青年
2026-06-28 10:00:13
大兴机场竟成首选了?这么多北京人都不走首都机场,到底为什么

大兴机场竟成首选了?这么多北京人都不走首都机场,到底为什么

呼呼历史论
2026-06-26 07:11:45
少林寺新方丈释印乐,上任才10个月,少林寺被曝一下少了800多万

少林寺新方丈释印乐,上任才10个月,少林寺被曝一下少了800多万

许三岁
2026-06-14 09:57:24
官方:朝鲜被取消下一届U17亚洲杯参赛资格,并被罚款5万美元

官方:朝鲜被取消下一届U17亚洲杯参赛资格,并被罚款5万美元

懂球帝
2026-06-27 17:09:37
荷兰足协:向加克波及其家人表示慰问;他决定继续留在荷兰队

荷兰足协:向加克波及其家人表示慰问;他决定继续留在荷兰队

懂球帝
2026-06-28 04:24:09
日本专家球迷表态:佛得角其实实力不如中国,但拥有一套无敌战术

日本专家球迷表态:佛得角其实实力不如中国,但拥有一套无敌战术

体坛狗哥
2026-06-27 17:50:59
男不男女不女?周深再陷审美争议,观众不买账了,原来李晨没说谎

男不男女不女?周深再陷审美争议,观众不买账了,原来李晨没说谎

草莓解说体育
2026-06-26 20:14:50
1场1-2,让韩国没有奇迹了!短短3天被坑6次,伊朗出线也开始危险

1场1-2,让韩国没有奇迹了!短短3天被坑6次,伊朗出线也开始危险

侃球熊弟
2026-06-28 07:12:32
内娱大洗牌!全员取消艺名,流量明星彻底慌了,冯绍峰最令人意外

内娱大洗牌!全员取消艺名,流量明星彻底慌了,冯绍峰最令人意外

料峭春寒洞
2026-06-26 02:26:56
WTT美国大满贯:大爆冷!国乒男单全国冠军0:3被淘汰,止步资格赛

WTT美国大满贯:大爆冷!国乒男单全国冠军0:3被淘汰,止步资格赛

国乒二三事
2026-06-28 09:20:08
真主党在首都骚乱,说明黎巴嫩政府做对了:以色列并不是最大敌人

真主党在首都骚乱,说明黎巴嫩政府做对了:以色列并不是最大敌人

林子说事
2026-06-27 18:20:55
动辄没收,本质上是那灰色十年的思维

动辄没收,本质上是那灰色十年的思维

林中木白
2026-06-27 10:31:05
大学专业死亡潮来临,正准备报志愿的高考生傻眼了

大学专业死亡潮来临,正准备报志愿的高考生傻眼了

果壳
2026-06-26 16:19:44
大姑姐拿走我50万存折,我挂失补办,她家次日狂打百通电话我不接

大姑姐拿走我50万存折,我挂失补办,她家次日狂打百通电话我不接

观观说事
2026-06-28 10:15:03
4-1只是开胃菜!时隔4年的复仇局,法国急不可耐,梅西这次要小心

4-1只是开胃菜!时隔4年的复仇局,法国急不可耐,梅西这次要小心

生活新鲜市
2026-06-27 21:45:40
四川发布一批干部任前公示 涉厅级领导职务

四川发布一批干部任前公示 涉厅级领导职务

爱看头条
2026-06-27 13:06:35
特朗普又出大瓜!与34岁私人助理秘密关系曝光,白宫连夜紧忙封口

特朗普又出大瓜!与34岁私人助理秘密关系曝光,白宫连夜紧忙封口

李健政观察
2026-06-28 10:37:57
藏有全球一半以上的黄金,方圆200平方公里,这个大坑有多值钱?

藏有全球一半以上的黄金,方圆200平方公里,这个大坑有多值钱?

抽象派大师
2026-05-25 15:32:36
形势有多严峻?原来中国中产阶级就是这样被干翻的,你有中招没?

形势有多严峻?原来中国中产阶级就是这样被干翻的,你有中招没?

世界圈
2026-06-06 13:56:44
2026-06-28 11:52:49
产业家
产业家
产业互联网第一媒体
1171文章数 1339关注度
往期回顾 全部

科技要闻

DeepSeek最新论文:如何让大模型跑得更快

头条要闻

割牛草女孩代表北大回母校招生 曾称自己终于走出大山

头条要闻

割牛草女孩代表北大回母校招生 曾称自己终于走出大山

体育要闻

世界杯最火门将,站到了阿根廷和梅西面前

娱乐要闻

白玉兰奖落幕,唯她被骂惨

财经要闻

两只股票撑起的韩国股市,半年熔断 33 次

汽车要闻

潮流+复古+科技满配 神行者8带来了豪华新能源的新解法

态度原创

本地
亲子
时尚
公开课
军事航空

本地新闻

世界杯球迷节:比球赛更好玩的派对

亲子要闻

胡图图妥妥的是爷爷奶奶们的梦中情孙 杨雪呀

今年夏天被“这件单品”刷屏,时髦又气质!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

黎以美达成三方框架协议

无障碍浏览 进入关怀版