首页 / 基准测试

📖 基准测试 是什么?

基准测试就是给所有模型做同一张考卷,分高者强,简单粗暴。

评估测试基础

⚡ 一句话秒懂

基准测试就是给所有模型做同一张考卷,分高者强,简单粗暴。

📖 举个故事

学校期末统考,全年级同一张卷子、同时开考、统一改卷——这样比出来的名次才公平。AI 界的"统考"叫 benchmark:拿一套题让 GPT、Claude、Gemini 全去答,谁答对多、答得快,谁就是 SOTA(当前最强)。
MMLU 考通识,HumanEval 考写代码,GSM8K 考小学数学,Arena 让真人盲投票,分高的就是当下口碑之王。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

做 AI Agent 选基座时,别只看"哪个最火"。先去 HuggingFace Open LLM Leaderboard 看 MMLU、TruthfulQA;做代码看 HumanEval / SWE-bench;做中文看 C-Eval / CMMLU;做 Agent 看 AgentBench / GAIA。
再针对你的真实业务攒一个 50–200 条的小私有评估集,在候选模型上跑一遍——这一步比任何榜单都更能反映你场景的真实表现。

📚 进阶原理

基准测试分三类:
1) 知识/推理型(MMLU, ARC, GSM8K)多选或文本答案,用 accuracy;
2) 生成型(HumanEval, MT-Bench)用 pass@k 或 LLM-as-Judge;
3) 人类偏好型(Chatbot Arena Elo)。
常见陷阱:数据污染(模型见过原题)、过拟合特定格式、与真实业务相关性弱。生产前应自建评测集做端到端校验。

继续学习相关术语