后训练(Post-training)(2026.08.24)
概念编号:059
一句话理解
后训练是在模型底座之上继续“教它怎么做事”,让模型更会听指令、更符合目标场景和用户偏好。
苏苏的入门解释
后训练(Post-training):对一个模型底座再训练,相当于职业教育。
作用:定向调整模型的部分能力。
预训练像义务教育,先让模型掌握广泛的基础规律;后训练像职业教育,把它培养成更会对话、更会写代码、更遵守安全规则,或更适合某个行业的模型。
具体解释
后训练通常使用更有针对性的高质量数据和训练方法,让模型学会:
- 理解和遵循用户指令;
- 按指定格式、语气和步骤输出;
- 在特定领域完成问答、代码、数学或工具调用任务;
- 根据人类偏好调整回答质量;
- 遵守安全规范、拒绝不应执行的请求。
常见方法包括监督微调(SFT)、偏好优化、基于人类反馈或 AI 反馈的训练,以及面向特定任务的继续训练。具体方法会随模型公司和模型家族而变化。
它为什么重要
同一个预训练底座,经过不同后训练后,可能表现出不同的对话风格、推理能力、代码能力、工具调用方式和安全边界。用户实际使用的聊天模型,通常已经经过一个或多个后训练阶段。
边界与易混淆概念
- 后训练不等于重新从零训练:它通常在已有模型底座上继续调整。
- 后训练不等于只增加知识:它更多是在调整行为、偏好、格式和任务能力。
- 后训练不等于 RAG:后训练改变模型参数;RAG 是在使用时临时提供外部资料。
- 后训练不保证模型永远正确:模型仍可能产生幻觉,需要检索、推理和来源校验。
相关概念
- 预训练(Pre-training)(2026.08.24):后训练所依赖的模型底座。
- 蒸馏(Knowledge Distillation)(2026.08.24)
- Prompt(提示词)(2026.08.21):用户在使用阶段交代任务,不等于后训练。
- 大模型(LLM)(2026.08.24)
来源
- 什么是 LLM 大语言模型?:已有文章对模型训练与使用阶段的基础说明。
- 本轮 AI 概念清单原始笔记:提供“职业教育”和“定向调整能力”的比喻。
概念卡更新日志
- 2026.08.24|创建概念卡:依据已有 LLM 科普文章和用户提供的“职业教育/定向调整能力”解释,登记为 059。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…