首页 / 数据清洗

📖 数据清洗 是什么?

数据清洗就像炒菜前洗菜切菜——脏菜进锅,再好的厨师也炒不出好菜。

数据工程基础

⚡ 一句话秒懂

数据清洗就像炒菜前洗菜切菜——脏菜进锅,再好的厨师也炒不出好菜。

📖 举个故事

老李开面馆,有天直接用带泥的葱下锅,客人全吃出沙子,给了一星差评。做 AI 也是同理:你喂给模型的语料里有错别字、广告、爬虫乱码、色情低俗、政治敏感——模型全学进去,吐出来的东西就像"带沙子"的菜。
所以正经团队会在训练前花 60% 的时间洗数据:去重、去脏、去毒、纠格式、抽质量分。这一步越扎实,后面训练越省力,效果还更好。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

做 AI Agent 的 RAG 或微调时,清洗清单照抄:
1) 去 HTML 标签 / 模板残留;
2) 文档分段(chunk)保证每段 200–800 字,带元数据;
3) 去掉与业务无关的广告页、登录页、404 页;
4) 中文做繁简统一、全半角统一;
5) 用 embedding 召回+人工抽样,发现幻觉源头往往就是脏文档。
经验:清洗一周,胜过调参一月。

📚 进阶原理

数据清洗流水线:原始语料 → 规则过滤(长度/语言/词频)→ 去重(MinHash/SimHash)→ 质量评分( perplexity / 分类器)→ 去毒(NSFW / PII / 毒性分类)→ 标准化(统一格式、繁简)→ 领域采样配比。
工具栈:Datatrove、dolma、jusText、trafilatura、FastText langid。
关键指标:Unique Token Ratio、文档长度分布、embedding 聚类纯度、与参考分布的 KL 散度。

继续学习相关术语