RLHF与RLAIF(2026.08.25)

概念编号:079

一句话理解

RLHF 用人的偏好教模型什么回答更好,RLAIF 则让 AI 充当一部分评价者。

具体解释

模型先生成多个回答,再由人或 AI 比较它们的帮助性、准确性、安全性和表达方式,最后把这些偏好用于进一步训练。它是后训练和对齐中的一类方法。

边界与易混淆概念

  • 反馈不是绝对真理:评价标准和评价者本身可能有偏差。
  • RLHF/RLAIF 不等于让模型拥有意识或价值观:它是行为优化方法。
  • 对齐不只有 RLHF/RLAIF:监督微调、直接偏好优化和规则约束也可能参与对齐。

例子

两个回答都正确时,评价者可以偏好更清晰、更安全、更加符合用户要求的版本。

相关概念

来源

概念卡更新日志

  • 2026.08.25|创建概念卡:依据 InstructGPT 的人类反馈训练路径,并扩展 AI 反馈对应概念,登记为 079