首页 / 吞吐量
📈 吞吐量 是什么?
AI单位时间能干多少活——就是吞吐量
⚡ 一句话秒懂
AI单位时间能干多少活——就是吞吐量
📖 举个故事
公司要上线AI客服,预计每天10万次对话。技术总监问:「我们的服务器能顶住吗?」工程师做了压力测试,发现这个方案每分钟只能处理100次对话,10万次要16小时——不够用。换了一个更好的方案,每分钟处理1000次,不到2小时就能干完。前者吞吐量低,后者吞吐量高。吞吐量就是AI的「工作效率」。
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
吞吐量决定AI服务能服务多少用户。提升吞吐量的方法:用更大的批处理(一次处理更多请求)、用更快的推理引擎(vLLM > 原生PyTorch)、用更多GPU并行处理、用更小的模型。做压力测试:用`hey`或`wrk`工具模拟并发请求,看系统能稳定处理多少QPS(每秒查询数)。
📚 进阶原理
吞吐量(Throughput)通常以每秒Token数(TPS)或每秒请求数(RPS)衡量。核心影响因素:GPU计算能力(FLOPS)、显存带宽(HBM)、批处理大小(通过Continuous Batching优化)、输入/输出序列长度、模型结构和量化精度。vLLM的PagedAttention通过优化显存利用显著提升吞吐量。