首页 / 模型评估(Model Evaluation)

📖 模型评估(Model Evaluation) 是什么?

模型评估是 AI 的“期末考试”,用标准卷子检验它到底行不行。

核心概念AI 应用

⚡ 一句话秒懂

模型评估是 AI 的“期末考试”,用标准卷子检验它到底行不行。

📖 举个故事

老李想换个 AI 模型,销售都说自家最好。工程师小周没听广告,拿来 100 道真实业务题:20 道客服回复、30 道提取合同日期、50 道改写文案。两个模型各做一遍,一个答对 92 题,一个 76 题。老李看着成绩单说:“原来选模型跟选员工一样,得先考试,不能光看简历。”

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

给 Agent 建评估集:挑 30~50 条真实输入(含刁钻 case),定义通过标准(如 JSON 格式合法、关键字段正确)。每次改提示词或换模型就跑一遍,对比通过率和平均耗时。用脚本自动跑:把输入、输出、判定结果存表,分数下降立刻回滚。

📚 进阶原理

评估分两类:离线评估(测试集 + 指标,如准确率、BLEU、格式通过率)和在线评估(线上 A/B、用户反馈、日志分析)。LLM-as-Judge 用强模型给输出打分,需校验与人工标注的相关性。评估集要防泄漏:训练数据外的真实样本才有效,定期补充新 case。

继续学习相关术语