首页 / Token(词元)

🔤 Token(词元) 是什么?

Token就是AI理解文本的最小单位——一个词或半个词,就像付停车费按小时算一样,AI收费按token算。

核心概念

⚡ 一句话秒懂

Token就是AI理解文本的最小单位——一个词或半个词,就像付停车费按小时算一样,AI收费按token算。

📖 举个故事

你把一句话「我喜欢吃苹果」写在一张纸条上。AI看之前,先把纸条撕成小块:「我」「喜欢」「吃」「苹果」。每一小块就是一个token。中文里一个词通常是一个token,英文一个单词可能拆成几个token——如「unbelievable」会变成「un」「believe」「able」。

为什么AI要拆开?因为如果每个字单独看,AI很难理解上下文;如果整句看,又太长了。拆成不大不小的token,AI既知道每个部分的意思,又能理解它们之间的关系。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

你注册了ChatGPT Plus,发现充值页面显示按token计费。你想写一封500字的邮件,会消耗多少token?

大约750个token——因为500个中文字约等于500个token,加上你的指令和AI的思考过程。换算一下:GPT-4的API价格约0.03元/1K输入token。所以写这封邮件大约花2分钱。你每次提问时心里有数了——不是你打字越多越贵,而是AI回复越长越贵。

📚 进阶原理

Token是大语言模型处理文本的基本单位。使用分词器(tokenizer)将原始文本映射成数字ID序列。不同类型的tokenizer:BPE(Byte-Pair Encoding)、WordPiece、SentencePiece。英文约1个单词=1.3个token,中文约1个汉字=1个token(取决于具体模型)。

模型的上下文窗口限制的就是token数量。例如8K上下文 = 8192个token。API按token计费:输入token和输出token分开计价。理解token对控制成本和理解模型能力边界很重要。

继续学习相关术语