"让模型变聪明靠预训练,让模型变乖靠对齐。但对齐这条路,有人走了三步,有人只走了一步。"
引言:为什么需要对齐?
大模型预训练后,虽然具备了海量知识,但有三个问题:
- 不对齐人类意图:你问"请帮我写一封邮件",它可能继续补全为"请帮我写一封辞职信的模板……"
- 可能产生有害内容:没有安全护栏,模型可能输出歧视、暴力等有害内容
- 不会拒绝:面对超出能力范围的请求,不会说"我不知道"
2026/7/3大约 16 分钟
"让模型变聪明靠预训练,让模型变乖靠对齐。但对齐这条路,有人走了三步,有人只走了一步。"
大模型预训练后,虽然具备了海量知识,但有三个问题:
"Garbage In, Garbage Out。微调效果 80% 取决于数据质量,20% 取决于训练方法。"
很多人把精力花在调学习率、选 LoRA rank、试不同优化器上,但忽略了最重要的事情:数据质量。
实践中,数据质量对微调效果的影响远超算法选择:
┌─────────────────────────────────────────────────┐
│ 微调效果影响因素分析 │
│ │
│ 数据质量 ████████████████████░░ 80% │
│ 数据配比 ████████░░░░░░░░░░░░░░ 15% │
│ 训练方法 ████░░░░░░░░░░░░░░░░░░ 3% │
│ 超参调优 ██░░░░░░░░░░░░░░░░░░░░ 2% │
│ │
│ 结论:把时间花在数据上! │
└─────────────────────────────────────────────────┘
大语言模型是AI领域的革命性技术,它为自然语言处理和智能应用提供了强大的能力。
本文介绍了大模型的核心概念和应用方式,帮助你进入AI应用开发领域。
基模越来越强,不是让 SFT、RLHF、RL 消失,而是让它们从"补能力"转向"控行为、控偏好、控成本、控风险"。
打个比方:基模就像一个越来越聪明的"通才大学生",以前你需要手把手教他客服话术、报告格式、业务流程。但现在这个大学生自学能力极强,你给他一份说明书(Prompt),他就能干得不错。甚至你花三个月培训出来的"专才",下一代基模一发布,直接就能追上。