首页 / 分词(Tokenization)

📖 分词(Tokenization) 是什么?

分词是 AI 把一句话切成一粒粒“乐高积木”,再一块块拼出理解。

核心概念LLM

⚡ 一句话秒懂

分词是 AI 把一句话切成一粒粒“乐高积木”,再一块块拼出理解。

📖 举个故事

王阿姨问孙女:“AI 读中文,是不是一个字一个字读?”孙女摇头:“它有自己的‘积木块’,‘人工智能’可能是一整块,也可能拆成‘人工’‘智能’。这些块叫 token,按块收费。”王阿姨看到账单上写着“本次对话消耗 1,234 tokens”,恍然大悟:“原来我跟它聊天,它是在数积木块收钱啊!”

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

调用 LLM 时按 token 估算成本:中文 1 字约 1~2 token,英文 1 词约 1.3 token。Agent 里做长文档处理前先用 tiktoken 分词统计,超过预算就切片分批送。缓存和历史压缩也能省 token——把旧对话摘要成要点,比原样回传省一半以上。

📚 进阶原理

Tokenizer 用 BPE(Byte Pair Encoding)或 SentencePiece 把文本映射到词表 id,词表通常几万到几十万。相同文本不同分词器结果不同,跨模型比较 token 数要用同一分词器。注意:中文按字/词混合切分,生僻字可能拆成多个 token;token 数与计费、上下文窗口直接挂钩。

继续学习相关术语