对抗数据“刷题”污染:开源框架 Req-2-Rank 重新定义 LLM 编码能力评测
针对当前大语言模型编码评测中普遍存在的训练集泄漏和数据污染问题,开源社区推出了全新的评测框架“Req-2-Rank”。该项目摒弃了传统的固定题库模式,转而采用 LLM 动态生成编程需求的策略,从根本上杜绝了模型针对特定数据集“背诵答案”的可...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
针对当前大语言模型编码评测中普遍存在的训练集泄漏和数据污染问题,开源社区推出了全新的评测框架“Req-2-Rank”。该项目摒弃了传统的固定题库模式,转而采用 LLM 动态生成编程需求的策略,从根本上杜绝了模型针对特定数据集“背诵答案”的可...