首页 / 分词(Tokenization)
📖 分词(Tokenization) 是什么?
分词是 AI 把一句话切成一粒粒“乐高积木”,再一块块拼出理解。
⚡ 一句话秒懂
分词是 AI 把一句话切成一粒粒“乐高积木”,再一块块拼出理解。
📖 举个故事
王阿姨问孙女:“AI 读中文,是不是一个字一个字读?”孙女摇头:“它有自己的‘积木块’,‘人工智能’可能是一整块,也可能拆成‘人工’‘智能’。这些块叫 token,按块收费。”王阿姨看到账单上写着“本次对话消耗 1,234 tokens”,恍然大悟:“原来我跟它聊天,它是在数积木块收钱啊!”
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
调用 LLM 时按 token 估算成本:中文 1 字约 1~2 token,英文 1 词约 1.3 token。Agent 里做长文档处理前先用 tiktoken 分词统计,超过预算就切片分批送。缓存和历史压缩也能省 token——把旧对话摘要成要点,比原样回传省一半以上。
📚 进阶原理
Tokenizer 用 BPE(Byte Pair Encoding)或 SentencePiece 把文本映射到词表 id,词表通常几万到几十万。相同文本不同分词器结果不同,跨模型比较 token 数要用同一分词器。注意:中文按字/词混合切分,生僻字可能拆成多个 token;token 数与计费、上下文窗口直接挂钩。