AI 脉络GitHub ↗
术语库概念对比学习路径AI 雷达参与共建GitHub ↗
评测与安全入门基础概念

Evaluation

Eval · 评测

用代表性样本、明确标准和可重复流程,判断 AI 系统在目标任务上是否足够好以及改动是否真的有帮助。

最后核验 2026-09-04 · 已核验

用一个类比理解

像驾照考试:不是问车看起来多先进,而是在规定场景和标准下检查它是否能安全完成任务。
建议先看:LLM

它解决什么

  • 把主观感觉变成可比较证据
  • 防止优化一处却破坏另一处
  • 监控上线后的质量变化

它不是什么

  • 单一公开榜单不能替代业务评测
  • LLM 评分也需要校准和抽查

适合使用

  • 任何准备上线或迭代的 AI 功能
  • 需要比较模型、提示、检索或架构

暂时别用

  • 没有明确任务与成功标准时不应伪造一个总分

常见失败方式

  • 测试集与真实流量不一致
  • 指标与用户价值脱节
  • 反复调参污染测试集

从错误分类开始

先收集真实案例并给失败分类,再决定自动指标、人工评审和模型评审如何组合。一个平均分很难告诉你该修检索、提示、工具还是产品流程。

可信来源

进一步阅读

OpenAI · Evaluation best practices