AI护栏(Guardrails)(2026.08.25)
概念编号:099
一句话理解
护栏就是给 AI 的输入、输出和行动加上可检查的边界,让它知道什么可以做、什么必须停下来。
具体解释
护栏可以检查敏感信息、危险请求、输出格式、引用证据、工具参数和权限范围,也可以要求审批、重试、降级或转人工。护栏通常是系统层控制,不只依赖模型自觉。
边界与易混淆概念
- 护栏不等于模型对齐:对齐偏向模型行为训练,护栏偏向运行时控制。
- 护栏不可能覆盖所有风险:需要评估、监控和人工监督共同工作。
- 限制越多不一定越安全:误拦截也会损害可用性,需要按风险调试。
例子
工具调用前检查路径是否在允许目录内、金额是否超过阈值、是否获得用户确认,就是运行时护栏。
相关概念
来源
概念卡更新日志
- 2026.08.25|创建概念卡:依据 AI 系统运行时安全、权限控制和人工审批边界,登记为 099。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…