首页 / 训练数据
📖 训练数据 是什么?
AI 的“课本”:喂什么,它就学成什么样。
⚡ 一句话秒懂
AI 的“课本”:喂什么,它就学成什么样。
📖 举个故事
小陈让 AI 帮他写本地小吃文案,结果 AI 张口就是“披萨与汉堡”。他纳闷:明明用中文提问。后来才明白,AI 见过的课本里西餐占了大头,它没吃过几碗馄饨。于是他改法:先给几段自家招牌菜的真实描述当例子,再让它照着写。这次文案终于有了烟火气。喂料不一样,长出来的东西就不一样。
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
想让 Agent 输出贴合业务,最省事的办法是“喂样本”:把三五条真实通过的案例放进提示词当范例,比堆一堆形容词有用。术语、口吻、禁用词都能靠示例固定下来。要做知识问答,就把内部文档切块后检索着一起喂,别指望模型自己记得你公司的事。
📚 进阶原理
训练数据决定模型的知识边界与偏好,分三层:预训练(海量通用语料,学语言规律)、微调(领域标注数据,学任务格式)、提示内上下文(RAG,不改权重)。数据质量比数量更关键,重复与噪声会导致输出退化。企业自建通常选 RAG 或轻量微调,成本远低于从零训练。