AI评估(Evals)(2026.08.25)

概念编号:094

一句话理解

AI 评估就是用一套可重复的测试,检查模型在准确性、帮助性、安全性、速度和成本等方面表现如何。

具体解释

评估需要明确任务、测试样本、评价标准和比较对象。Benchmark 是标准化测试集合或指标体系,Evals 也可以是针对个人工作流的自建测试。重要系统还要做上线前、上线后和版本更新后的持续评估。

边界与易混淆概念

  • 基准分数不等于真实体验:测试集可能不能代表你的任务。
  • 一次评估不等于永久可靠:模型版本、数据和用户行为会变化。
  • 评估不只看准确率:安全、偏差、隐私、延迟和成本也要纳入。

例子

用 100 个真实问题比较两个模型的引用准确率、幻觉率、响应时间和费用,是一组工作流评估。

相关概念

来源

概念卡更新日志

  • 2026.08.25|创建概念卡:依据 AI 生命周期中的测试、评估和持续验证要求,登记为 094