评测与安全入门基础概念
Evaluation
Eval · 评测
用代表性样本、明确标准和可重复流程,判断 AI 系统在目标任务上是否足够好以及改动是否真的有帮助。
最后核验 2026-09-04 · 已核验
用一个类比理解
像驾照考试:不是问车看起来多先进,而是在规定场景和标准下检查它是否能安全完成任务。建议先看:LLM
它解决什么
- 把主观感觉变成可比较证据
- 防止优化一处却破坏另一处
- 监控上线后的质量变化
它不是什么
- 单一公开榜单不能替代业务评测
- LLM 评分也需要校准和抽查
适合使用
- 任何准备上线或迭代的 AI 功能
- 需要比较模型、提示、检索或架构
暂时别用
- 没有明确任务与成功标准时不应伪造一个总分
常见失败方式
- 测试集与真实流量不一致
- 指标与用户价值脱节
- 反复调参污染测试集
从错误分类开始
先收集真实案例并给失败分类,再决定自动指标、人工评审和模型评审如何组合。一个平均分很难告诉你该修检索、提示、工具还是产品流程。
可信来源