预训练(Pre-training)(2026.08.24)

概念编号:058

一句话理解

预训练是让模型先在海量数据中学习语言、图像、代码等通用规律,形成一个可以继续培养的模型底座。

苏苏的入门解释

预训练(Pre-training):从 0 开始训练一个模型,相当于义务教育。

作用:生成一个模型底座。

“从 0 开始”和“义务教育”是很好的入门比喻。严格来说,预训练不一定是字面意义上的完全零知识,而是从随机或已有初始化参数开始,让模型通过大量数据学习通用模式。

具体解释

在预训练阶段,模型会反复读取海量数据,并通过预测、重建或匹配等任务学习数据中的规律。例如,语言模型会学习根据前面的内容预测后续 Token;图像模型会学习图像中的结构和视觉关系。

这一阶段通常需要大量数据、算力和时间。训练结束后,模型获得语言理解、内容生成、代码模式或视觉识别等较通用的能力,但还不一定擅长听从人的指令,也不一定符合特定产品的安全和表达要求。

它产出什么

  • 一个可以继续训练或部署的基础模型;
  • 对语言、图像、代码或其他数据形式的通用规律表示;
  • 后续指令跟随、偏好对齐、领域适配和蒸馏的基础。

边界与易混淆概念

  • 预训练不等于后训练:预训练建立通用底座,后训练针对任务、偏好和行为继续调整。
  • 预训练不等于把所有事实永久记住:模型学到的是参数中的统计规律,事实仍可能过时或出错。
  • 预训练不等于联网学习:模型训练数据和实时检索是两件事。
  • 预训练数据越多不等于质量一定越高:数据质量、去重、版权、偏差和覆盖范围都重要。

相关概念

来源

概念卡更新日志

  • 2026.08.24|创建概念卡:依据已有 LLM 科普文章和用户提供的“义务教育/模型底座”解释,登记为 058