首页 / 预训练
📖 预训练 是什么?
预训练像让孩子先读十年书,再让他上班——他还没干具体活,但已经啥都懂一点。
⚡ 一句话秒懂
预训练像让孩子先读十年书,再让他上班——他还没干具体活,但已经啥都懂一点。
📖 举个故事
小明要去当医生,但他先花十年读通识、生物、化学、解剖,这些"打底训练"就叫预训练。等真正到医院,他只要再看几个月病历就能上岗,不用从识字开始。大模型也是一样:先拿几万亿字的网页、书、百科让它读完,它就"啥都懂一点",后面做客服、写代码、当翻译,几千条样本就能调出来。
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
做 AI Agent 时,如果你的任务很专(比如"读公司内部合同"),不需要从头训练。去找一个已经预训练好的开源基座(Qwen、Llama、GLM),再拿几百到几千条你业务的样本微调(SFT/LoRA),效果就够用了。这一步省掉的钱可能是 99%,时间从几个月压到几天。
📚 进阶原理
预训练目标以 Next-Token Prediction 为主(GPT 路线),或填空式 MLM(BERT 路线),近年普遍转向多任务混合。数据流水线:去重 → 去毒 → 质量打分 → 领域配比 → tokenizer 训练。算力门槛高(Billion 级参数需千卡·月),通常一次完成,产物是 base/pretrained checkpoint,可被下游 SFT、RLHF、蒸馏复用。