#性能调优

按标签聚合查看文章内容。

LLM中的连续批处理:调度器如何把吞吐量榨干AI教程

LLM中的连续批处理:调度器如何把吞吐量榨干

vLLM等推理引擎为什么能把同一块GPU的吞吐量拉高到传统方案的数十倍?关键不在模型,而在连续批处理调度器。本文从传统批处理的误区讲起,拆解迭代级调度、选择性批处理和抢占机制背后的真实权衡。