首页 / 最大输出 Token 数
📖 最大输出 Token 数 是什么?
最大输出 Token 数像给 AI 答题纸“限页数”,写满就停笔。
⚡ 一句话秒懂
最大输出 Token 数像给 AI 答题纸“限页数”,写满就停笔。
📖 举个故事
小赵让 AI 写产品介绍,结果 AI 洋洋洒洒写了 3000 字,把预算花光还超时。他查文档发现有个参数 max_tokens,默认很大。他把值设成 300,AI 立刻变“惜字如金”,三句话讲完重点。小赵笑说:“原来 AI 也吃‘字数限制’这一套,给多长的纸,写多长的文。”
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
调用 LLM 接口时务必设置 max_tokens,防止模型失控输出耗尽成本或超时。估算技巧:中文约 1 字约 1~2 token,英文 1 词约 1.3 token。总结类调用设 500~1000,代码生成设 2000+;输出被截断时,可在提示词里要求“分两段输出”,或用流式(stream)提前拿结果。
📚 进阶原理
max_tokens 只限制输出长度、不限制输入,实际输出受上下文窗口约束(总窗口=输入+输出)。设置过小会截断内容,可通过 finish_reason==“length” 判断是否截断。推理模型建议用 max_completion_tokens(含思考 token),需预留思考空间,否则“想一半就被掐断”。