首页 / 蒸馏

🧪 蒸馏 是什么?

让大模型「教」小模型,小模型学个大本事

实操进阶

⚡ 一句话秒懂

让大模型「教」小模型,小模型学个大本事

📖 举个故事

一个千亿参数的GPT-4级模型能力很强但运行成本太高。工程师们想:能不能让这个「大学老师」教出一个「小学生」版本?他们让大模型做了一大堆问答,然后用这些问答来训练一个小模型。训练完的小模型只有大模型1%的大小,但学到了80%的能力。就像特级厨师教徒弟——徒弟虽然做不到师傅100%的水平,但应付大多数客人已经绰绰有余了。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

蒸馏用来把小模型训练得更聪明。步骤:①用强模型(GPT-4、Claude)生成大量问答对。②用这些数据训练一个小模型(如Qwen2-0.5B、Phi-3-mini)。③小模型在手机上或低端硬件上运行。实践中很多小模型(如Phi-3、Gemma 2B)都是蒸馏产物。想自己做:用OpenAI的API生成训练数据,用LoRA微调一个小开源模型。

📚 进阶原理

知识蒸馏(Knowledge Distillation)将教师模型(Teacher Model)的知识迁移到学生模型(Student Model)。核心方法:软标签蒸馏(用教师模型输出概率分布作为训练目标,比硬标签包含更多暗知识)、特征层蒸馏(对齐中间层表示)、关系蒸馏(保持样本间关系)。蒸馏后的模型更小更快,适合边缘设备部署,是模型压缩的重要手段。

继续学习相关术语