评测与安全进阶当前热门
Guardrail
护栏 · 安全护栏
在 AI 系统输入、推理过程或输出周围设置的规则、检测和控制,用来降低不允许行为与错误操作的风险。
最后核验 2026-09-04 · 已核验
用一个类比理解
像山路护栏:它能降低冲出边界的概率,但不能让驾驶员永远不犯错,也不能替代刹车和道路设计。它解决什么
- 拦截明显违规输入输出
- 限制高风险操作
- 为异常提供升级或人工审核路径
它不是什么
- Guardrail 不是绝对安全保证
- 文本检测不能替代真正的系统权限隔离
适合使用
- 系统会处理敏感内容或执行动作
- 需要把政策落实为可检查控制
暂时别用
- 用自然语言规则替代操作系统或数据库权限
常见失败方式
- 只在输出末端检测
- 误报导致产品不可用
- 没有针对绕过方式持续测试
分层控制
可靠系统通常同时使用输入检查、工具白名单、最小权限、参数验证、人工确认、沙箱、输出审查和审计日志。任何单层都可能被绕过或误判。
可信来源