AI 脉络GitHub ↗
术语库概念对比学习路径AI 雷达参与共建GitHub ↗
评测与安全进阶当前热门

Guardrail

护栏 · 安全护栏

在 AI 系统输入、推理过程或输出周围设置的规则、检测和控制,用来降低不允许行为与错误操作的风险。

最后核验 2026-09-04 · 已核验

用一个类比理解

像山路护栏:它能降低冲出边界的概率,但不能让驾驶员永远不犯错,也不能替代刹车和道路设计。
建议先看:LLMEvaluation

它解决什么

  • 拦截明显违规输入输出
  • 限制高风险操作
  • 为异常提供升级或人工审核路径

它不是什么

  • Guardrail 不是绝对安全保证
  • 文本检测不能替代真正的系统权限隔离

适合使用

  • 系统会处理敏感内容或执行动作
  • 需要把政策落实为可检查控制

暂时别用

  • 用自然语言规则替代操作系统或数据库权限

常见失败方式

  • 只在输出末端检测
  • 误报导致产品不可用
  • 没有针对绕过方式持续测试

分层控制

可靠系统通常同时使用输入检查、工具白名单、最小权限、参数验证、人工确认、沙箱、输出审查和审计日志。任何单层都可能被绕过或误判。

可信来源

进一步阅读

Anthropic · Trustworthy agents in practiceMCP · Architecture security boundaries