#批处理机制

按标签聚合查看文章内容。

LLM中的连续批处理:调度器如何把吞吐量拉高23倍AI教程

LLM中的连续批处理:调度器如何把吞吐量拉高23倍

vLLM等推理引擎为什么几乎都默认启用连续批处理?核心在于把“批次”从一次性打包,改成每一步动态重建,让GPU不再为已经结束的请求白白烧显存和算力。本文从传统批处理讲起,拆解连续批处理的调度细节、KV缓存与抢占机制,以及如何用几个关键参数在延迟和吞吐量之间做取舍。