首页 / 模型评估(Model Evaluation)
📖 模型评估(Model Evaluation) 是什么?
模型评估是 AI 的“期末考试”,用标准卷子检验它到底行不行。
⚡ 一句话秒懂
模型评估是 AI 的“期末考试”,用标准卷子检验它到底行不行。
📖 举个故事
老李想换个 AI 模型,销售都说自家最好。工程师小周没听广告,拿来 100 道真实业务题:20 道客服回复、30 道提取合同日期、50 道改写文案。两个模型各做一遍,一个答对 92 题,一个 76 题。老李看着成绩单说:“原来选模型跟选员工一样,得先考试,不能光看简历。”
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
给 Agent 建评估集:挑 30~50 条真实输入(含刁钻 case),定义通过标准(如 JSON 格式合法、关键字段正确)。每次改提示词或换模型就跑一遍,对比通过率和平均耗时。用脚本自动跑:把输入、输出、判定结果存表,分数下降立刻回滚。
📚 进阶原理
评估分两类:离线评估(测试集 + 指标,如准确率、BLEU、格式通过率)和在线评估(线上 A/B、用户反馈、日志分析)。LLM-as-Judge 用强模型给输出打分,需校验与人工标注的相关性。评估集要防泄漏:训练数据外的真实样本才有效,定期补充新 case。