"让模型变聪明靠预训练,让模型变乖靠对齐。但对齐这条路,有人走了三步,有人只走了一步。"
引言:为什么需要对齐?
大模型预训练后,虽然具备了海量知识,但有三个问题:
- 不对齐人类意图:你问"请帮我写一封邮件",它可能继续补全为"请帮我写一封辞职信的模板……"
- 可能产生有害内容:没有安全护栏,模型可能输出歧视、暴力等有害内容
- 不会拒绝:面对超出能力范围的请求,不会说"我不知道"
2026/7/3大约 16 分钟
"让模型变聪明靠预训练,让模型变乖靠对齐。但对齐这条路,有人走了三步,有人只走了一步。"
大模型预训练后,虽然具备了海量知识,但有三个问题:
"如果你不能度量它,你就不能改进它。" 这句话对大模型尤其成立。一个模型的真正能力是什么?它安全吗?它比另一个模型好吗?好多少?本文将系统梳理大模型评估的完整方法论,从标准化 Benchmark 到 LLM-as-Judge 再到人工评审,帮你建立科学的评估体系。
大模型评估面临几个独特挑战:
挑战1: 能力涌现性
┌────────────────────────────────────────┐
│ 模型规模 ↑ → 评估维度指数级增长 │
│ │
│ 1B 模型: 评估翻译、摘要、分类 │
│ 7B 模型: + 代码、数学、推理 │
│ 70B 模型: + 复杂规划、创意写作、指令遵循│
│ 700B 模型: + 元认知、苏格拉底式追问... │
│ │
│ 评估永远滞后于能力发展 │
└────────────────────────────────────────┘
挑战2: 生成式输出的开放性
┌────────────────────────────────────────┐
│ 分类任务: 输出有限类别 → 容易评估 │
│ 生成任务: 输出无限可能 → 难以评估 │
│ │
│ "写一首关于秋天的诗" → 什么算好? │
│ - 用词优美?结构工整?有意境?符合要求? │
│ - 不同评估者可能给出完全不同的评分 │
└────────────────────────────────────────┘
挑战3: 数据污染
┌────────────────────────────────────────┐
│ MMLU 题目可能出现在训练数据中 │
│ → 模型"背答案"而非真正理解 │
│ → 分数虚高,实际能力被高估 │
│ │
│ 研究显示: 部分模型在污染数据上 │
│ 比干净数据高 5-15% │
└────────────────────────────────────────┘