代码大模型,如何衡量真实工程能力?东软参与“方升-Code”评测体系升级发布

科技IT
2026 09-27 14:58:21
分享
评测体系的升级,需要回答“应该评什么”。来自产业一线的工程实践,则能够帮助识别:哪些问题最值得纳入评价?在同期举行的“方升-Code”大模型代码能力基准测试闭门研讨中,与会代表围绕重点评测方向、科学评测方法、评测如何反哺研发,以及AGI时代评测体系演进和国际影响力提升等议题展开交流。

东软结合长期大型软件工程与通信行业实践,参与了相关讨论。对于持续运行多年、规模庞大、依赖关系复杂的核心生产系统,软件研发的难点,往往不在于从零写出一段代码,而在于理解和改变一个已经存在的复杂系统。工程师需要读懂历史代码,识别模块之间的依赖,定位问题,并在不破坏已有功能的前提下完成修改。一项看似局部的需求,可能涉及多个文件、复杂调用关系和长期积累的业务规则。代码修改完成,也不意味着工程任务已经结束,还需要通过测试验证结果,并处理执行过程中可能出现的异常。

这些真实场景,对代码大模型提出了更高要求:

系统理解:能否理解大型代码仓及其依赖关系?

任务执行:能否完成跨文件修改与缺陷修复?质量保障:能否生成有效测试,识别修改引入的风险?稳定可控:当任务变长、环境变化或执行异常时,能否可靠地完成任务?如果评测主要关注相对独立的代码生成,就难以完整反映模型应对上述工程挑战的能力。

围绕这些问题,东软在研讨中建议,进一步强化真实任务结构、场景化题库和应用侧验证,让评测任务与实际研发需求建立更紧密的联系。在测试数据方面,可探索通过脱敏与合成数据兼顾工程真实性与测试可复现性;在任务设计方面,应进一步关注异常恢复、安全边界和长程任务执行能力。这些建议的重点,不是单纯增加测试题目,而是让评测更加贴近软件工程的真实工作方式。

让模型在评测中面对的问题,更接近工程师每天真正需要解决的问题。对于软件企业而言,评测任务与真实研发场景建立的联系越紧密,测试结果就越有机会为模型选择、工程部署和持续优化提供有价值的参考。

来源:数字经济
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。