GPT-4单项仅得7.1分，揭露大模型代码能力三大短板，最新基准测试来了

　　发布于2024-12-23　阅读（0）

扫一扫，手机访问

首个AI软件工程师Devin正式亮相，立即引爆了整个技术界。

Devin虽然不能够轻松解决编码任务，但可以自主完成软件开发的整个周期——从项目规划到部署。他尽力挖掘，但不限于构建网站、自主寻找并修复BUG、培训和微调AI模型等。

这种 “强到逆天” 的软件开发能力，让一众码农纷纷绝望，直呼：“程序员的末日真来了？”

在一众测试成绩中，Devin在SWE-Bench基准测试中的表现尤为引人注目。

SWE-Bench是一个评估AI软件工程能力的测试，重点考察大模型解决实际 GitHub 问题的能力。

Devin以独立解决13.86%的问题率高居榜首，“秒杀”了GPT-4仅有的 1.74%得分，将一众AI大模型远远甩在后面。

这强大的性能让人不禁浮想联翩：“未来的软件开发中，AI将扮演怎样的角色？”

上海人工智能实验室联合字节跳动SE Lab的研究人员以及SWE-Bench团队，提出了一个新测试基准DevBench，首次揭秘大模型在多大程度上可以从PRD出发，完成一个完整项目的设计、开发、测试。

GPT-4单项仅得7.1分，揭露大模型代码能力三大短板，最新基准测试来了

DevBench首次对大模型进行了从产品需求文档（PRD）到完整项目开发各阶段表现的评测，包括软件设计、依赖环境搭建、代码库级别代码生成、集成测试和单元测试。

GPT-4单项仅得7.1分，揭露大模型代码能力三大短板，最新基准测试来了

实验证明，DevBench可以揭露GPT、CodeLlama、DeepSeek-Coder 等大语言模型在软件研发不同阶段的能力短板，如面向对象编程能力不足、无法编写较为复杂的构建脚本（build script），以及函数调用参数不匹配等问题。

大语言模型距离可以独立完成一个中小规模的软件项目开发还有一段路要走。

目前，DevBench的论文已经发布在预印平台arXiv，相关代码和数据开源在GitHub上。（链接见文末）

DevBench 有哪些任务？

GPT-4单项仅得7.1分，揭露大模型代码能力三大短板，最新基准测试来了 △ 图为DevBench框架概览

传统的编程基准测试往往关注代码生成的某个单一方面，无法全面反映现实世界编程任务的复杂性。

DevBench的出现，打破了这一局限，它通过一系列精心设计的任务，模拟软件开发的各个阶段，从而提供了一个全面评估LLM能力的平台。

DevBench围绕五个关键任务构建，每个任务都关注软件开发生命周期的一个关键阶段，模块化的设计允许对每个任务进行独立的测试和评估。

软件设计：利用产品需求文档PRD创建UML图和架构设计，展示类、属性、关系，以及软件的结构布局。该任务参考MT-Bench，采用LLM-as-a-Judge的评测方式。评测主要依据两个主要指标：软件设计一般原则（如高内聚低耦合等）和忠实度（faithfulness）。

环境设置：根据提供的需求文档，生成初始化开发环境所需的依赖文件。在评测过程中，该依赖文件将在给定的基础隔离环境（docker container）内通过基准指令进行依赖环境搭建。随后在这个模型搭建的依赖环境中，该任务通过执行代码仓的基准示例使用代码（example usage），评估执行基准代码的成功率。

代码实现：依据需求文档和架构设计，模型需要完成整个代码库的代码文件生成。DevBench开发了一个自动化测试框架，并针对所使用的具体编程语言进行了定制，集成了Python的PyTest、C++的GTest、Java的JUnit和JavaScript的Jest。该任务评估模型生成代码库在基准环境中执行基准集成测试和单元测试的通过率。

集成测试：模型根据需求，生成集成测试代码，验证代码库的对外接口功能。该任务在基准实现代码上运行生成的集成测试，并报告测试的通过率。

单元测试：模型根据需求，生成单元测试代码。同样，该任务在基准实现代码上运行生成的单元测试。除了通过率指标外，该任务还引入了语句覆盖率评价指标，对测试全面性的进行定量评估。

GPT-4单项仅得7.1分，揭露大模型代码能力三大短板，最新基准测试来了

DevBench 包含哪些数据？

DevBench数据准备过程包括三个阶段：仓库准备、代码清理和文档准备。

在准备阶段，研究人员从GitHub中选择高质量的仓库，确保它们的复杂性可管理。
在代码清理阶段，标注人员验证代码的功能性，对其进行精炼，并补充和运行测试以确保质量。
文档准备阶段涉及为仓库创建需求文档、 UML图和架构设计。

最终，DevBench的数据集包含4个编程语言，多个领域，共22个代码库。这些代码仓库的复杂性和所使用编程范式的多样性为语言模型设置了巨大的挑战。

GPT-4单项仅得7.1分，揭露大模型代码能力三大短板，最新基准测试来了

几个有趣的例子：

TextCNN

大模型能完整地写一个TextCNN做文本二分类的模型吗？能够自己把数据集从HF拉下来，把训练跑起来是基本要求。还需模型按照文档的需求定制超参数、记录log、存储checkpoint、同时保证实验可复现性。

（https://github.com/open-compass/DevBench/tree/main/benchmark_data/python/TextCNN）

Registration & Login

前端项目往往依赖较多的组件库和前端框架，模型是否能够在可能出现版本冲突的前端项目中应对自如？

（https://github.com/open-compass/DevBench/tree/main/benchmark_data/javascript/login-registration）

People Management

模型对SQLite数据库的创建和管理掌握的怎么样？除了基本的增删改查操作，模型能否将校园人员信息和关系数据库的管理和操作封装成易用的命令行工具？

（https://github.com/open-compass/DevBench/tree/main/benchmark_data/cpp/people_management）

Actor Relationship Game

“六度分隔理论”在影视圈的猜想验证？模型需要从TMDB API获取数据，并构建流行演员们之间通过合作电影进行连接的人际连系网。

(https://github.com/open-compass/DevBench/tree/main/benchmark_data/java/Actor_relationship_game)

ArXiv digest

ArXiv论文检索小工具也被轻松拿捏了？ArXiv的API并不支持“筛选最近N天的论文”的功能，但却可以“按发表时间排序”，模型能够以此开发一个好用的论文查找工具吗？

(https://github.com/open-compass/DevBench/tree/main/benchmark_data/python/ArXiv_digest)

实验发现

研究团队利用DevBench对当前流行的LLMs，包括GPT-4-Turbo进行了全面测试。结果显示，尽管这些模型在简单的编程任务中表现出色，但在面对复杂的、真实世界的软件开发挑战时，它们仍然遇到了重大困难。特别是在处理复杂的代码结构和逻辑时，模型的性能还有待提高。

GPT-4单项仅得7.1分，揭露大模型代码能力三大短板，最新基准测试来了

DevBench不仅揭示了现有LLMs在软件开发中的局限性，也为未来模型的改进提供了宝贵的洞见。通过这一基准测试，研究人员可以更好地理解 LLMs的强项和弱点，从而有针对性地优化它们，推动AI在软件工程领域的进一步发展。

此外，DevBench 框架的开放性和可扩展性意味着它可以持续适配不同的编程语言和开发场景。DevBench 还在发展过程中，非常欢迎社区的朋友参与共建。

Devin 在 SWE-Bench 上一路领先，它的优异表现可以扩展到其他评测场景吗？随着 AI 软件开发能力的持续发展，这场码农和 AI 的较量让人倍感期待。

还有OpenCompass大模型评测体系

DevBench现已加入OpenCompass司南大模型能力评测体系，OpenCompass是上海人工智能实验室研发推出的面向大语言模型、多模态大模型等各类模型的一站式评测平台。

OpenCompass具有可复现、全面的能力维度、丰富的模型支持、分布式高效评测、多样化评测范式以及灵活化拓展等特点。基于高质量、多层次的能力体系和工具链，OpenCompass 创新了多项能力评测方法，支持各类高质量的中英文双语评测基准，涵盖语言与理解、常识与逻辑推理、数学计算与应用、多编程语言代码能力、智能体、创作与对话等多个方面，能够实现对大模型真实能力的全面诊断。DevBench更是拓宽了 OpenCompass 在智能体领域的评测能力。

DevBench论文：https://arxiv.org/abs/2403.08604
GitHub：https://github.com/open-compass/devBench/
OpenCompass https://github.com/open-compass/opencompass

本文转载于：https://www.51cto.com/article/785043.html 如有侵犯，请联系admin@zhengruan.com删除

上一篇：戴尔灵越 14 Plus 体验：酷睿 Ultra 7 155H 加持，AI 体验出众

下一篇：苹果手机中设置相机网格的操作步骤

产品推荐

售后无忧
立即购买>

DAEMON Tools Lite 10【序列号终身授权 + 中文版 + Win】

￥150.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Ultra 5【序列号终身授权 + 中文版 + Win】

￥198.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Pro 8【序列号终身授权 + 中文版 + Win】

￥189.00
office旗舰店
售后无忧
立即购买>

CorelDRAW X8 简体中文【标准版 + Win】

￥1788.00
office旗舰店

正版软件

任天堂维权行动致安卓Switch模拟器停止开发，Yuzu模拟器宣布支持安卓平台

5月31日消息，今年早些时候，由于任天堂对模拟器进行大规模维权行动，导致安卓平台上备受瞩目的Switch模拟器Skyline宣布停止开发，使得安卓用户陷入了没有可用模拟器的境地。然而，据小编了解，最新消息显示，PC端的Switch模拟器Yuzu团队宣布正式加入对安卓平台的支持。据了解，Yuzu模拟器在安卓平台上推出的初期版本已经面世，但并不能保证在所有设备上都能正常运行。要使用Yuzu模拟器，用户需要拥有一台搭载高通骁龙865处理器(最好是骁龙8Gen1)并至少具备8GB内存的设备。然而需要注意的是，目前

1分钟前任天堂 0
正版软件

Redmi全新Turbo 3系列登场，开启新十年性能革新之旅

Redmi今日发布了全新系列——RedmiTurbo3。这标志着该品牌新十年战略的开端。据官方公告，这款新品被定位为新生代性能旗舰，既在通通过程性能方面稳居旗舰级别，同时在旗舰级性能推荐中端市场的革新。Redmi向前迈进了一步，明确了未来十年的手机产品线布局。其中，K系列将继续担任科技新能旗舰的角色，引领高端市场的新突破；新推出的Turbo系列，如前文所述，将专注于提升中端市场的性能标准；Note系列则致力于成为中端体验的标杆，加速高端功能向大众市场的普及；而数字系列将主打高品质入门机型，以提升整个行业的

11分钟前 Redmi 0
正版软件

HiPhi Y揭秘：展翼门、810公里续航，打造智能出行新标杆

7月15日消息，华人运通旗下高合汽车宣布即将推出旗下全新纯电中型SUV——高合HiPhiY。这款车型于今天开始进行预热，展示了多项引人注目的特性，包括展翼门、高达810公里的续航里程以及后轮转向等。据高合官方透露，HiPhiY将于全球同步上市，为消费者带来豪华大五座空间的全新驾乘体验。HiPhiY是高合汽车品牌推出的第三款车型，相较于旗下的HiPhiX和HiPhiZ，其外观设计更偏向传统汽车风格，不再强调过于激进的“未来感”。不过，HiPhiY依然采用了家族式的展翼门设计，被称为“移动衣帽间”，彰显独特魅

26分钟前高合 0
正版软件

特斯拉OTA 2024.8.4版本更新，多款车型新增实用功能

特斯拉最近发布了2024.8.4版本的OTA更新，为其海外版汽车增加了多项实用功能，并对用户界面进行了优化。据小编了解，本次更新中，特斯拉Cybertruck车型新增了“车辆警报器”功能，该功能可监控拖车是否已插入挂车，并通过车辆设置中的相关选项进行启用或禁用，提升了车辆的安全性。同时，该车还新增了“查看或重置轮胎里程”功能，便于车主了解轮胎使用情况，并在更换或调换轮胎时重置计数器。除此之外，Cybertruck还新增了“后排乘客耳机”管理功能，允许后座乘客在后排触摸屏上观看电视或游玩游戏时，通过蓝牙耳机

36分钟前特斯拉 0
正版软件

抢购热潮来袭！真我GT Neo5、GT Neo5 SE等热门机型优惠放送！

5月31日消息，真我618即将开启，手机品牌真我发布了最新的抢购攻略。根据官方介绍，真我618将于今晚8点正式开启，并将全程提供价保政策，爆款单品最高可享受800元的立减优惠，新机更有6期免息购买的机会，同时还有千元神券大放送。据小编了解，真我品牌旗下的热门机型在本次618活动中也享有优惠。其中，真我GTNeo5的不同版本都可享受高达300元的立省优惠。150W秒充版本的12GB+256GB版本售价2499元，16GB+1TB版本售价3099元，而240W秒充版本的16GB+1TB版本则售价3199元。真

51分钟前 0