Transformer(2026.08.25)

概念编号:073

一句话理解

Transformer 是一种用注意力机制处理序列关系的模型架构,是现代 LLM 的重要基础。

具体解释

它把输入 Token 转成向量,通过注意力机制计算不同位置之间的关系,再逐层形成更丰富的表示。与早期逐步处理序列的架构相比,Transformer 更适合并行训练和扩大规模。

边界与易混淆概念

  • Transformer 是架构,不是某个产品:GPT、Claude 等产品背后的具体实现还包括训练数据和其他工程设计。
  • Transformer 不等于 Attention:Attention 是其中的核心机制,Transformer 还包含层、前馈网络、位置编码等组件。
  • Transformer 不只用于文本:也可用于图像、语音和多模态数据。

例子

语言模型使用 Transformer 处理上下文中的 Token,并预测接下来可能生成的内容。

相关概念

来源

概念卡更新日志

  • 2026.08.25|创建概念卡:依据 Transformer 原始论文和 AI 概念框架,登记为 073