AI评估(Evals)(2026.08.25)
概念编号:094
一句话理解
AI 评估就是用一套可重复的测试,检查模型在准确性、帮助性、安全性、速度和成本等方面表现如何。
具体解释
评估需要明确任务、测试样本、评价标准和比较对象。Benchmark 是标准化测试集合或指标体系,Evals 也可以是针对个人工作流的自建测试。重要系统还要做上线前、上线后和版本更新后的持续评估。
边界与易混淆概念
- 基准分数不等于真实体验:测试集可能不能代表你的任务。
- 一次评估不等于永久可靠:模型版本、数据和用户行为会变化。
- 评估不只看准确率:安全、偏差、隐私、延迟和成本也要纳入。
例子
用 100 个真实问题比较两个模型的引用准确率、幻觉率、响应时间和费用,是一组工作流评估。
相关概念
来源
概念卡更新日志
- 2026.08.25|创建概念卡:依据 AI 生命周期中的测试、评估和持续验证要求,登记为 094。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…