对齐(Alignment)(2026.08.25)
概念编号:080
一句话理解
对齐就是让模型“有能力做事”的同时,尽量按照人的目标、规则和安全边界做事。
具体解释
对齐可以涉及指令跟随、偏好学习、拒绝危险请求、诚实表达不确定性、遵守产品规则和保护用户权益。它既可能通过训练完成,也需要 Prompt、工具权限、护栏和人工监督共同实现。
边界与易混淆概念
- 对齐不等于模型永远正确:符合偏好不代表事实准确。
- 对齐不等于单次提示词:提示词只能影响当前交互,长期行为还依赖训练和系统设计。
- 谁的目标需要说清楚:用户、开发者、平台和法律要求可能发生冲突。
例子
模型知道如何回答医学问题,还会提示风险、避免冒充医生并建议寻求专业帮助,是一种系统对齐表现。
相关概念
来源
- Training language models to follow instructions with human feedback
- NIST AI Risk Management Framework
概念卡更新日志
- 2026.08.25|创建概念卡:依据后训练、偏好反馈和 AI 治理框架,登记为 080。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…