东软结合长期大型软件工程与通信行业实践,参与了相关讨论。对于持续运行多年、规模庞大、依赖关系复杂的核心生产系统,软件研发的难点,往往不在于从零写出一段代码,而在于理解和改变一个已经存在的复杂系统。工程师需要读懂历史代码,识别模块之间的依赖,定位问题,并在不破坏已有功能的前提下完成修改。一项看似局部的需求,可能涉及多个文件、复杂调用关系和长期积累的业务规则。代码修改完成,也不意味着工程任务已经结束,还需要通过测试验证结果,并处理执行过程中可能出现的异常。
这些真实场景,对代码大模型提出了更高要求:
系统理解:能否理解大型代码仓及其依赖关系?
任务执行:能否完成跨文件修改与缺陷修复?质量保障:能否生成有效测试,识别修改引入的风险?稳定可控:当任务变长、环境变化或执行异常时,能否可靠地完成任务?如果评测主要关注相对独立的代码生成,就难以完整反映模型应对上述工程挑战的能力。
围绕这些问题,东软在研讨中建议,进一步强化真实任务结构、场景化题库和应用侧验证,让评测任务与实际研发需求建立更紧密的联系。在测试数据方面,可探索通过脱敏与合成数据兼顾工程真实性与测试可复现性;在任务设计方面,应进一步关注异常恢复、安全边界和长程任务执行能力。这些建议的重点,不是单纯增加测试题目,而是让评测更加贴近软件工程的真实工作方式。
让模型在评测中面对的问题,更接近工程师每天真正需要解决的问题。对于软件企业而言,评测任务与真实研发场景建立的联系越紧密,测试结果就越有机会为模型选择、工程部署和持续优化提供有价值的参考。