跳转至

模型好不好用,谁说了算?从榜单崇拜到自建评测

Ch01.1150 模型好不好用,谁说了算?从榜单崇拜到自建评测

📊 Level ⭐⭐ | 5.3KB | entities/模型评测-从榜单崇拜到自建评测.md

模型好不好用,谁说了算?从榜单崇拜到自建评测

阿里云开发者社区文章(作者李俊霖/鲸羚)从 Humanity's Last Exam(HLE)的命运切入,系统梳理了四代模型评测方法论的兴衰,并用古德哈特定律(Goodhart's Law)解释为什么所有公开评测最终都会失真:HLE 发布时最强模型正确率不到 10%,但仅一年半后公开榜单口径下榜首已涨到 50% 以上——"这不是 HLE 的失败,而是所有评测的命运"。文章的核心主张是:公开榜单只能给出行业坐标,无法保证模型在你的业务场景上好用,最务实的做法是用自己真实遇到的难题构建测试集来评测模型,这套数据同时还能作为 few-shot 增强模型能力(一鱼两吃)。

四代模型评测的命运

第一代是固定考卷(2020 年 GPT-3 之后):MMLU、GSM8K、HumanEval 等,两个致命问题是背题(公开题目可能进入训练数据,分数测到的是记忆力)和满分(难度固定而模型能力上涨,考卷失去区分度)。第二代是真人盲测(2023 年 UC Berkeley LMSYS 的 Chatbot Arena/LMArena):用户实时出题、匿名双模型投票、Elo 排名,模型无法背题且能直接知道用户偏好,但一些模型针对人类评估者偏好做了优化(多用列表、控制长度、加表情符号),这些技巧不影响实际能力却能让评估者更倾向投票。

第三代是真实任务(2023 年 10 月普林斯顿 SWE-bench):从 GitHub 拿真实 issue,模型要读懂代码库、定位问题、写补丁、跑项目测试;判分用 FAIL_TO_PASS(修掉 bug)与 PASS_TO_PASS(不把别的功能改坏)两类测试,但测的是 GitHub 开源项目的 issue,"它测的是真实任务,但不一定是你的真实任务"。第四代是 Agent 全链路(2025 年起):OpenAI 的 BrowseComp(1,266 道"难找但容易验证"的网页检索题,模型必须自己规划搜索词、打开网页、交叉验证)与 Terminal-Bench(真实终端、Docker 沙箱、指令-环境-参考解法-测试脚本),代价是"贵"——一次完整链路评测的成本是固定考卷的几十倍,成本高导致样本量小、结果不稳定,且工具版本、网页状态、终端环境一变结果就可能不一样。

古德哈特定律:指标失真的机制

1975 年英国经济学家 Charles Goodhart 论货币政策时写道:"任何稳定的统计规律,一旦被拿来当控制目标,就会开始崩塌。"人类学家 Marilyn Strathern 改写成更流行的版本:"当一项指标成为目标时,它就不再是一项好的指标了。"四代评测看似各不相同(选择题、盲测、真实任务、Agent 工作流),背后都是古德哈特定律的不同显影:评测分数只是模型"好不好用"的替身,近似指标用久了就会失真。这为 LLM 评测基准全景 中"基准饱和与评测军备竞赛"的现象提供了统一解释框架。

怎么规避古德哈特定律:自建评测

规避最直接的办法不是再找一张更难的卷子,而是用自己真实题目来评测模型:公开榜单给行业坐标,自己的测试集才能告诉你模型能不能进流程。作者实践了具体的收集方法:有意识收集自己遇到的、模型难以解决的问题作为测试集,用 AI 写了一个 Chrome 插件,在表格输入后自动把数据同步成 jsonl(每行 {"prompt": 输入, "completion": 期望输出}),这套数据可直接交给大部分市面上的模型平台做评测,也能换个格式当 few-shot 使用。文章还与 智能体评测框架 的趋势呼应:评测正从"模型怎么回答"走向"系统能不能办事",而自建评测集是应对 代码生成评测 这类高成本评测不可复现问题的务实解。

总结而言:AI 模型公开榜单只能给出行业坐标,无法保证模型在具体业务场景上的效率;最务实的做法是用自己真实遇到的难题构建测试集评测模型,这套数据同时还能作为 few-shot 增强模型能力。HLE 的组织者之一 Dan Hendrycks 正是五年前 MMLU 论文的第一作者——"同一个人,出的第一张卷子已经被遗弃,于是他出了第二张更难的试卷,然而在可以预见的未来,第二张试卷也会被淘汰",这个循环是评测方法论演进的真实写照。

原文存档