北航开源Code2Bench:动态评测终结LLM“刷分”乱象,代码大模型迎来严苛大考
针对代码大模型评测中常见的“刷分”与数据泄露问题,北京航空航天大学团队开源了动态评测基准Code2Bench。该框架通过“来源扩展”和“严格度扩展”双轮驱动,构建了动态演进的测试集,迫使模型展示真实的代码生成能力而非单纯的记忆能力。目前该项...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
针对代码大模型评测中常见的“刷分”与数据泄露问题,北京航空航天大学团队开源了动态评测基准Code2Bench。该框架通过“来源扩展”和“严格度扩展”双轮驱动,构建了动态演进的测试集,迫使模型展示真实的代码生成能力而非单纯的记忆能力。目前该项...