#大模型推理

按标签聚合查看文章内容。

LLM中的连续批处理:调度器如何把吞吐量榨干AI教程

LLM中的连续批处理:调度器如何把吞吐量榨干

vLLM等推理引擎为什么能把同一块GPU的吞吐量拉高到传统方案的数十倍?关键不在模型,而在连续批处理调度器。本文从传统批处理的误区讲起,拆解迭代级调度、选择性批处理和抢占机制背后的真实权衡。

LLM中的连续批处理:调度器如何把吞吐量拉高23倍AI教程

LLM中的连续批处理:调度器如何把吞吐量拉高23倍

vLLM等推理引擎为什么几乎都默认启用连续批处理?核心在于把“批次”从一次性打包,改成每一步动态重建,让GPU不再为已经结束的请求白白烧显存和算力。本文从传统批处理讲起,拆解连续批处理的调度细节、KV缓存与抢占机制,以及如何用几个关键参数在延迟和吞吐量之间做取舍。

在 Azure AI Foundry 上快速上手 DeepSeek R1 推理大模型AI教程

在 Azure AI Foundry 上快速上手 DeepSeek R1 推理大模型

本文介绍如何在 Azure AI Foundry 上部署与使用 DeepSeek R1 推理大模型,包括模型特点、可视化向导部署步骤、Python 与 REST API 调用示例、公有云与企业私网配置要点、成本优化策略、典型业务集成场景,以及使用过程中的限制与最佳实践。

DeepSeek 在 Kubernetes 上的生产级部署全指南AI教程

DeepSeek 在 Kubernetes 上的生产级部署全指南

DeepSeek 不是普通的 Web 服务镜像放大版,而是一整套从小型蒸馏模型到 671B 参数 MoE 大模型的家族。本文给出在 Kubernetes 上部署 DeepSeek 的三条路径:Ollama 快速演示、vLLM 生产推理、Ray Serve + vLLM 分布式大模型服务,并覆盖 GPU 规划、命名空间与 Secret、PVC、暴露方式、安全与监控等关键细节。

DeepSeek Docker 部署全指南:5种方案一文吃透AI教程

DeepSeek Docker 部署全指南:5种方案一文吃透

很多人一提“DeepSeek Docker 部署”就只想到拉个镜像跑模型,其实这只是五种方案里的一个。本文用实战结构和配置示例,带你从最简单的“容器化应用 + 托管 DeepSeek API”,一路走到 vLLM / SGLang 自建 GPU 推理集群,并对成本、安全和性能做清晰取舍。