预训练(Pre-training)(2026.08.24)
概念编号:058
一句话理解
预训练是让模型先在海量数据中学习语言、图像、代码等通用规律,形成一个可以继续培养的模型底座。
苏苏的入门解释
预训练(Pre-training):从 0 开始训练一个模型,相当于义务教育。
作用:生成一个模型底座。
“从 0 开始”和“义务教育”是很好的入门比喻。严格来说,预训练不一定是字面意义上的完全零知识,而是从随机或已有初始化参数开始,让模型通过大量数据学习通用模式。
具体解释
在预训练阶段,模型会反复读取海量数据,并通过预测、重建或匹配等任务学习数据中的规律。例如,语言模型会学习根据前面的内容预测后续 Token;图像模型会学习图像中的结构和视觉关系。
这一阶段通常需要大量数据、算力和时间。训练结束后,模型获得语言理解、内容生成、代码模式或视觉识别等较通用的能力,但还不一定擅长听从人的指令,也不一定符合特定产品的安全和表达要求。
它产出什么
- 一个可以继续训练或部署的基础模型;
- 对语言、图像、代码或其他数据形式的通用规律表示;
- 后续指令跟随、偏好对齐、领域适配和蒸馏的基础。
边界与易混淆概念
- 预训练不等于后训练:预训练建立通用底座,后训练针对任务、偏好和行为继续调整。
- 预训练不等于把所有事实永久记住:模型学到的是参数中的统计规律,事实仍可能过时或出错。
- 预训练不等于联网学习:模型训练数据和实时检索是两件事。
- 预训练数据越多不等于质量一定越高:数据质量、去重、版权、偏差和覆盖范围都重要。
相关概念
- 后训练(Post-training)(2026.08.24):在模型底座上继续塑造行为。
- 蒸馏(Knowledge Distillation)(2026.08.24):把教师模型能力迁移给学生模型。
- 词元(Token)(2026.08.24):语言模型处理数据时的基本单位。
- 大模型(LLM)(2026.08.24)
来源
- 什么是 LLM 大语言模型?:已有文章对预训练阶段的入门说明。
- 本轮 AI 概念清单原始笔记:提供“义务教育”和“模型底座”的比喻。
概念卡更新日志
- 2026.08.24|创建概念卡:依据已有 LLM 科普文章和用户提供的“义务教育/模型底座”解释,登记为 058。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…