数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

首次覆盖超11类编程场景!字节开源最全面代码大模型基准FullStack Bench

2024-12-05来源:互联网编辑:芳华

代码大模型越来越卷,评估AI编程水平的“考卷”也被迫升级。12月5日,字节豆包大模型团队开源最新代码大模型评估基准FullStack Bench,在业界首次囊括编程全栈技术中超11类真实场景,覆盖16种编程语言,包含3374个问题,相比此前基准,可以更有效地评估大模型在现实世界中的代码开发能力。

代码评估基准是衡量大模型编程能力的标准工具,也是推动模型优化的关键驱动力。不过,当前的代码评估基准覆盖的应用类型和编程语言较为有限,难以反映真实世界中代码开发场景的多样性和复杂性。

比如,主流代码评测集Humaneval和MBPP中近80%数据只聚焦基础编程和高级编程问题;DS-1000中95%数据都集中于数据分析和机器学习任务,且仅对Python语言进行评测;xCodeeval虽覆盖多项任务,但基本局限于高级编程和数学领域。

图表, 条形图

描述已自动生成

FullStack Bench数据覆盖超11种应用领域,远超当前主流代码评估基准

因此,字节豆包大模型团队与M-A-P开源社区联合提出FullStack Bench,一个专注于全栈编程和多语言编程的代码评估数据集。为囊括在真实全栈开发中涉及的各类应用场景,研究团队从全球最大的程序员技术问答社区Stack Overflow中随机抽取了50万个问题进行分析,筛选出占总问题数前88.1%的应用领域,并对其分布做了适当调整来保证每个领域的鲁棒性,最终形成了FullStack Bench关注的超过11种应用场景及分布比例。

FullStack Bench包含3374个问题,每个问题均包括题目描述、参考解决方案及单元测试用例,总计15168个单元测试。为保证评估准确性,问题内容均由相关领域的编程专家设计,并经AI和人工验证进行质量复核。在初始数据集构建后,团队根据主流代码大模型测试结果,按问题难度、模糊性和可解性对数据质量进行了交叉评估和进一步完善。

表格

描述已自动生成

FullStack Bench数据集构成情况

为方便开发者对大模型代码能力进行系统性测试,豆包大模型团队还开源了一款高效的代码沙盒执行工具——SandboxFusion,用于评估来自不同语言的不同编程任务。除了FullStack Bench,SandboxFusion还兼容超过10种广泛使用的代码评估数据集,支持23种编程语言。开发者在单服务器上即可轻松部署SandboxFusion,也可直接在GitHub上进行体验。

图形用户界面

描述已自动生成

发布评测基准及沙盒的同时,字节代码大模型也首次曝光。研究中,豆包大模型团队对全球20余款代码大模型及语言大模型的编程表现进行了评测(详见论文),其中包括未披露过的豆包代码大模型Doubao-Coder。

近半年,字节在代码大模型领域进展迅速,今年6月字节发布了由自研代码基座模型支撑的AI编程助手豆包MarsCode ,目前每月为用户贡献百万量级代码。

论文地址:https://arxiv.org/pdf/2412.00535v2

数据集开源地址:https://huggingface.co/datasets/ByteDance/FullStackBench

沙盒开源地址:https://github.com/bytedance/SandboxFusion

沙盒体验入口:https://bytedance.github.io/SandboxFusion/playground/datasets

iPhone17系列销售势头猛 本周国内激活量或冲破1000万台大关
【CNMO科技消息】11月14日,据数码博主爆料称,iPhone17系列国内激活量将于本周突破1000万台。截至11月2日,该系列在国内的激活数量已突破825万台,其中iPhone 17 Pro Max约3…

2025-11-14

95后「AI天才少女」罗福莉加入小米,AI圈人才争夺再掀热潮
DeepSeek员工、有天才名号、小米雷军出千万年薪挖角,这几个因素叠合起来,让不怎么关注 AI 的网友都知道了这位 95 后技术大牛。暂且不说这“千万年薪”是不是真消息,能让雷军出动请人, 相信大家都能从…

2025-11-13

原DeepSeek核心成员罗福莉加盟小米MiMo团队
近日,一则科技圈的重磅消息引发广泛关注:曾参与DeepSeek-V2大模型研发的“天才少女”罗福莉,正式宣布加入小米Xiaomi MiMo团队,并表示将“全力奔赴心中的AGI(通用人工智能)”。这一消息不仅证实了此前关于她跳槽小米的传闻,更透露出小米在AGI领域的战略布局。

2025-11-13

双11手机市场:苹果销量领跑,小米成国产手机销量佼佼者
【太平洋科技】11 月 12 日消息,本年度的双 11 正式收官,各大电商平台的品类销售排名也随之揭晓。据京东官方数据,在全部品牌销量累计榜中,苹果、小米、vivo 占据前三席位。在全部品牌销售额累计榜…

2025-11-12

中国折叠屏手机市场回暖,2025年全球出货量或达5470万台引关注
基于前三季度的良好表现,IDC预计2025年中国折叠屏手机市场出货量将接近千万台,延续此前持续增长的趋势。 机构指出,折叠屏手机正成为智能手机市场的全新增长极,2025年全球出货量预计达5470万台,中国市…

2025-11-12

联想双十一成绩亮眼:89亿销售额揽19冠 平板与多品类齐发力
不仅一举夺得笔记本电脑总榜自营销量冠军与POP销售额冠军,更在细分品类中实现了多维度领跑。旗下的ThinkPad与ThinkBook分别拿下POP销售额冠军与自营高端销售额冠军;游戏本方面,联想更是包揽了自营…

2025-11-12

2025年Q3中国折叠屏手机回暖:出货量增17.8\% 体验升级或成高端市场关键赛道
【环球网科技综合报道】11月11日消息,根据IDC最新手机季度跟踪报告显示,2025年第三季度,中国折叠屏手机市场迎来显著回暖,该季度出货量达到263万台,同比增长17.8%。市场动能的恢复,一方面得益于手机…

2025-11-11

取消实体卡槽换来长续航!纯eSIM版iPhone17 Pro多场景续航表现亮眼
在美国、加拿大、日本等特定市场销售的纯 eSIM 版本,由于取消了实体 SIM卡槽,获得了更大的电池空间,续航表现明显优于实体卡槽版本。在综合活跃使用测试中,eSIM 版续航达 16 小时 12 分钟,比实…

2025-11-11

荣耀400系列发货量破600万创佳绩 荣耀500系列新设计蓄势待发
在海外首发时,销量就达到前代产品的2-3倍。在中国市场上,荣耀400系列首销日销量同比荣耀300系列增长195%,同比荣耀200系列增长138%,打破近三年荣耀手机首销日销量纪录。6月30日,该系列全球累计激…

2025-11-11