大模型推理部署:vLLM 与性能优化实践

大模型推理部署

训练完要让人用起来,模型必须“跑起来”。推理优化主要解决两个问题:吞吐低、显存贵。

一、为什么慢

自回归生成是逐 token 输出的,每步都要读一遍前文;历史 K/V 缓存若无法复用,计算会成倍浪费。

二、vLLM 做了什么

  • PagedAttention:像操作系统分页一样管理 KV Cache,显存利用率大幅提升
  • 连续批处理:一个 token 结束立即补位,不等整条序列完成
  • 开箱即用 OpenAI 兼容接口
pip install vllm
python -m vllm.entrypoints.openai.api_server --model Qwen/Qwen2-7B-Instruct --port 8000

三、量化:用精度换显存

INT8 / INT4 量化能把 70B 模型的显存需求压到单卡以内:

from vllm import LLM
llm = LLM(model="Qwen/Qwen2-7B-Instruct", quantization="awq")

四、效果与成本的平衡

加并发、开流式输出(SSE)、按场景调整 max_tokens 与上下文长度;先压测(--max-num-seqs、吞吐指标),再做容量规划。部署不是终点,而是工程优化的起点。

评论(18)