COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

📅 2026/8/24 12:38:42
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
COMPASS基准论文总结与关键部分翻译一、文章主要内容总结(一)研究背景当前主流代码生成基准(如HumanEval、MBPP等)仅聚焦功能正确性,通过测试用例执行判断代码是否输出预期结果,却忽略了实际软件开发中至关重要的算法效率(如避免指数级时间复杂度代码)和代码质量(如可维护性、可读性、模块化)。这一缺陷导致即便模型生成的代码通过测试,若存在效率低下或质量问题,在生产环境中仍会引发用户体验差、系统扩展性不足、长期维护成本高等问题,尤其在LLM日益广泛应用于生产环境的背景下,评估缺口亟待填补。(二)COMPASS基准设计核心构成:包含50道来自Codility真实编程竞赛的题目,覆盖多领域算法与不同难度级别,配套393,150条人类提交数据作为基线,可对比LLM与人类的百分位排名。初始研究限定模型使用Python 3生成代码,未来将扩展至更多编程语言。三维评估框架正确性:通过基础功能、边缘案例、极端案例等全面测试集,以“通过测试用例占比”计分(公式:Ccorr=100⋅NpassedNtotalC_{c