对齐(Alignment)(2026.08.25)

概念编号:080

一句话理解

对齐就是让模型“有能力做事”的同时,尽量按照人的目标、规则和安全边界做事。

具体解释

对齐可以涉及指令跟随、偏好学习、拒绝危险请求、诚实表达不确定性、遵守产品规则和保护用户权益。它既可能通过训练完成,也需要 Prompt、工具权限、护栏和人工监督共同实现。

边界与易混淆概念

  • 对齐不等于模型永远正确:符合偏好不代表事实准确。
  • 对齐不等于单次提示词:提示词只能影响当前交互,长期行为还依赖训练和系统设计。
  • 谁的目标需要说清楚:用户、开发者、平台和法律要求可能发生冲突。

例子

模型知道如何回答医学问题,还会提示风险、避免冒充医生并建议寻求专业帮助,是一种系统对齐表现。

相关概念

来源

概念卡更新日志

  • 2026.08.25|创建概念卡:依据后训练、偏好反馈和 AI 治理框架,登记为 080