蒸馏(Knowledge Distillation)(2026.08.24)
概念编号:057
一句话理解
蒸馏就是让一个“老师模型”把自己的解题方式或输出结果教给一个“学生模型”。
苏苏的入门解释
蒸馏(Distillation):把别人模型的回复当成自己模型的训练数据。
作用:省钱,找作业,快毕业。
这句话描述的是很容易理解的一种情况:从外部模型获得大量示范答案,再用这些答案训练自己的模型。它常被称为黑箱蒸馏或响应蒸馏,但“模型蒸馏”的范围比复制回复更大。
具体解释
蒸馏通常包含两个角色:
- 教师模型:能力较强、规模较大或训练成本较高,负责提供答案、概率分布、中间表示或解题示范;
- 学生模型:规模较小、速度更快或更容易部署,学习教师模型提供的信号。
学生模型并不是把教师模型的参数原样搬过来,而是在新的训练过程中学习教师的行为。蒸馏可以帮助模型降低部署成本、减少延迟、适应特定设备,或把某种解题风格迁移到更适合实际使用的模型中。
常见方式
- 响应蒸馏:把教师模型生成的答案作为训练样本。
- 概率蒸馏:学习教师对不同候选答案的概率分布,而不只看最终答案。
- 特征蒸馏:学习教师模型内部的表示或中间层信号。
- 任务蒸馏:围绕代码、数学、分类或对话等特定任务构造示范数据。
边界与风险
- 蒸馏不是简单复制文件,学生模型仍需要自己的训练过程。
- 教师模型答错、带偏见或产生幻觉时,学生模型可能把问题一起学走。
- 能否使用外部模型输出训练商业模型,还涉及服务条款、版权、隐私和合规边界。
- 学生模型通常会在成本、速度和能力之间做取舍,不一定完全等同于教师模型。
相关概念
- 预训练(Pre-training)(2026.08.24)
- 后训练(Post-training)(2026.08.24):蒸馏数据常被用于后训练,也可能参与其他训练阶段。
- 大模型(LLM)(2026.08.24)
- 幻觉(Hallucination)(2026.08.24):教师数据质量会影响学生模型的可靠性。
来源
- 本轮 AI 概念清单原始笔记:提供“把别人模型回复当训练数据”的入门解释。
- AI学习导航:本概念在 AI 基础与模型训练相关入口中的位置。
概念卡更新日志
- 2026.08.24|创建概念卡:依据用户提供的通俗解释和模型训练中的可复用边界,登记为 057。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…