RLHF与RLAIF(2026.08.25)
概念编号:079
一句话理解
RLHF 用人的偏好教模型什么回答更好,RLAIF 则让 AI 充当一部分评价者。
具体解释
模型先生成多个回答,再由人或 AI 比较它们的帮助性、准确性、安全性和表达方式,最后把这些偏好用于进一步训练。它是后训练和对齐中的一类方法。
边界与易混淆概念
- 反馈不是绝对真理:评价标准和评价者本身可能有偏差。
- RLHF/RLAIF 不等于让模型拥有意识或价值观:它是行为优化方法。
- 对齐不只有 RLHF/RLAIF:监督微调、直接偏好优化和规则约束也可能参与对齐。
例子
两个回答都正确时,评价者可以偏好更清晰、更安全、更加符合用户要求的版本。
相关概念
来源
概念卡更新日志
- 2026.08.25|创建概念卡:依据 InstructGPT 的人类反馈训练路径,并扩展 AI 反馈对应概念,登记为 079。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…