首页 / 延迟
⏱️ 延迟 是什么?
你问AI一句,它多久才回你——就是延迟
⚡ 一句话秒懂
你问AI一句,它多久才回你——就是延迟
📖 举个故事
小梅用两个AI翻译工具做对比。第一个你输入一句话,它两三秒就翻译出来了,体验很流畅。第二个要等十几秒才出结果,小梅等得着急,直接弃用了。第一个工具延迟低(快),第二个延迟高(慢)。延迟就像你去餐厅点菜——上菜快的餐厅你愿意再去,等一个小时的再好吃也受不了。
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
不同场景对延迟要求不同:实时对话要求延迟<1秒,翻译和摘要可以接受3-5秒,批量处理不关心延迟。降低延迟的方法:选更小的模型(7B比70B快很多)、用量化版、用专用推理框架(vLLM)、选择离你近的服务器区域。测试时用`time curl...`看总耗时,或在代码中记录开始和结束时间。
📚 进阶原理
延迟(Latency)指从发送请求到收到完整响应的时间,通常以首次Token延迟(TTFT)和Token间延迟(ITL/TPS)衡量。影响因素:模型大小(参数量)、硬件(GPU型号)、批处理大小(Batch Size)、输入/输出长度、量化级别和服务器负载。优化策略:KV Cache前缀缓存、推测解码(Speculative Decoding)、流式输出。