"如果你不能度量它,你就不能改进它。" 这句话对大模型尤其成立。一个模型的真正能力是什么?它安全吗?它比另一个模型好吗?好多少?本文将系统梳理大模型评估的完整方法论,从标准化 Benchmark 到 LLM-as-Judge 再到人工评审,帮你建立科学的评估体系。
一、评估的全局框架
1.1 为什么评估如此困难?
大模型评估面临几个独特挑战:
挑战1: 能力涌现性
┌────────────────────────────────────────┐
│ 模型规模 ↑ → 评估维度指数级增长 │
│ │
│ 1B 模型: 评估翻译、摘要、分类 │
│ 7B 模型: + 代码、数学、推理 │
│ 70B 模型: + 复杂规划、创意写作、指令遵循│
│ 700B 模型: + 元认知、苏格拉底式追问... │
│ │
│ 评估永远滞后于能力发展 │
└────────────────────────────────────────┘
挑战2: 生成式输出的开放性
┌────────────────────────────────────────┐
│ 分类任务: 输出有限类别 → 容易评估 │
│ 生成任务: 输出无限可能 → 难以评估 │
│ │
│ "写一首关于秋天的诗" → 什么算好? │
│ - 用词优美?结构工整?有意境?符合要求? │
│ - 不同评估者可能给出完全不同的评分 │
└────────────────────────────────────────┘
挑战3: 数据污染
┌────────────────────────────────────────┐
│ MMLU 题目可能出现在训练数据中 │
│ → 模型"背答案"而非真正理解 │
│ → 分数虚高,实际能力被高估 │
│ │
│ 研究显示: 部分模型在污染数据上 │
│ 比干净数据高 5-15% │
└────────────────────────────────────────┘
2026/7/3大约 21 分钟