AI护栏(Guardrails)(2026.08.25)

概念编号:099

一句话理解

护栏就是给 AI 的输入、输出和行动加上可检查的边界,让它知道什么可以做、什么必须停下来。

具体解释

护栏可以检查敏感信息、危险请求、输出格式、引用证据、工具参数和权限范围,也可以要求审批、重试、降级或转人工。护栏通常是系统层控制,不只依赖模型自觉。

边界与易混淆概念

  • 护栏不等于模型对齐:对齐偏向模型行为训练,护栏偏向运行时控制。
  • 护栏不可能覆盖所有风险:需要评估、监控和人工监督共同工作。
  • 限制越多不一定越安全:误拦截也会损害可用性,需要按风险调试。

例子

工具调用前检查路径是否在允许目录内、金额是否超过阈值、是否获得用户确认,就是运行时护栏。

相关概念

来源

概念卡更新日志

  • 2026.08.25|创建概念卡:依据 AI 系统运行时安全、权限控制和人工审批边界,登记为 099