首页 / 预训练

📖 预训练 是什么?

预训练像让孩子先读十年书,再让他上班——他还没干具体活,但已经啥都懂一点。

训练基础大模型

⚡ 一句话秒懂

预训练像让孩子先读十年书,再让他上班——他还没干具体活,但已经啥都懂一点。

📖 举个故事

小明要去当医生,但他先花十年读通识、生物、化学、解剖,这些"打底训练"就叫预训练。等真正到医院,他只要再看几个月病历就能上岗,不用从识字开始。大模型也是一样:先拿几万亿字的网页、书、百科让它读完,它就"啥都懂一点",后面做客服、写代码、当翻译,几千条样本就能调出来。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

做 AI Agent 时,如果你的任务很专(比如"读公司内部合同"),不需要从头训练。去找一个已经预训练好的开源基座(Qwen、Llama、GLM),再拿几百到几千条你业务的样本微调(SFT/LoRA),效果就够用了。这一步省掉的钱可能是 99%,时间从几个月压到几天。

📚 进阶原理

预训练目标以 Next-Token Prediction 为主(GPT 路线),或填空式 MLM(BERT 路线),近年普遍转向多任务混合。数据流水线:去重 → 去毒 → 质量打分 → 领域配比 → tokenizer 训练。算力门槛高(Billion 级参数需千卡·月),通常一次完成,产物是 base/pretrained checkpoint,可被下游 SFT、RLHF、蒸馏复用。

继续学习相关术语