当下各类AI模型的测评跑分普遍虚高,榜单数据和实际使用体验严重脱节,很多用户实测后,都会产生落差感,这种行业乱象源于普遍的基准测试污染。
目前行业通用的AI测评题库,大多是公开共享的数据集,各大AI模型在海量互联网数据训练的过程中,会提前收录大量测评题目和标准答案。模型参与测评时,并不是实时分析、解题作答,而是调取训练数据中记忆的答案默写输出,并非真实能力体现。

相关专业数据早已证实这一问题,Scale AI在2024年发布的行业研究显示,GSM8K小学数学测评、HumanEval编程测评的题库中,有16%的题目已经出现在主流AI训练数据内,Llama 2模型的训练集中,也包含超16%的MMLU测评题目。
依托背诵题库作答,所有模型的测评分数都被大幅拉高,头部模型得分普遍集中在九十分以上的狭小区间,微小的分数差距,根本无法区分模型的真实能力。一旦更换全新的、未收录的测评题目,模型的作答准确率会大幅下滑,真实水平彻底暴露。
除了题库泄露、数据污染之外,各大厂商还会通过多种手段刻意刷高测评分数。很多团队会针对性拆解测评规则,专门适配题库格式刷题,摸清答题规律提升正确率。同时厂商不会公开单次测评成绩,会反复测试数十次,仅对外公布最高分版本的数据。部分企业还会制作专属测评特供版模型,专门适配各类榜单测试,和用户实际下载使用的通用版本性能完全不同。
行业乱象已经得到官方认可,OpenAI公开宣布放弃使用SWE-bench Verified测评基准,原因是GPT-5.2等前沿模型,可以凭借任务编号精准复现标准答案,测评榜单已经完全失去参考价值。
想要客观判断一款AI模型的真实实力,不能依赖榜单跑分,需要结合实际场景实测。优先选择全新的、未被污染的测评题库,测试模型解决陌生问题的能力,摒弃老旧题库的参考数据。最核心的判断标准,是模型的落地实用性,能否高效完成日常工作、生活中的真实任务,远比虚拟跑分有意义。
同时需要理性看待新晋爆款模型,榜单数据碾压同行的新品,大概率存在刷分嫌疑,真实用户的长期使用反馈,远比短期高分榜单靠谱。AI工具的核心价值是落地使用、解决实际问题,而非榜单比拼,脱离实际体验的跑分数据,没有任何参考意义。


