vLLM 命令速查表 - 高性能 LLM 推理与服务部署
vLLM 推理部署命令都在这里了,从安装到起 OpenAI 兼容服务、从张量并行到量化,按场景分类整理,复制即用。
安装 5
pip install vllm安装 vLLM(含 CLI 入口 vllm)
pip install vllm --upgrade升级到最新版
vllm --version查看已安装版本
python -c "import vllm; print(vllm.__version__)"确认包可用
vllm --help查看全部子命令
启动 OpenAI 兼容服务 5
vllm serve facebook/opt-125m起服务(默认 :8000,OpenAI 协议)
vllm serve <model> --host 0.0.0.0 --port 8080指定监听地址与端口
vllm serve <model> --api-key <key>启用 API Key 校验(或环境变量 VLLM_API_KEY)
vllm serve <model> --tensor-parallel-size 2多 GPU 张量并行(TP)
vllm serve <model> --gpu-memory-utilization 0.9调高显存利用率装更大模型
客户端调用 5
curl http://localhost:8000/v1/models列出已加载模型
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"...","messages":[...]}'发起 chat 请求
openai_api_base=http://localhost:8000/v1OpenAI SDK 指向本地 vLLM
vllm serve <model> --max-model-len 8192限制上下文长度省显存
vllm serve <model> --enforce-eager禁用 CUDA graph,调试更稳
量化与性能 5
vllm serve <model> --quantization awq加载 AWQ 量化权重
vllm serve <model> --quantization gptq加载 GPTQ 量化权重
vllm serve <model> --enable-prefix-caching开前缀缓存,重复前缀加速
vllm serve <model> --max-num-seqs 256调并发序列数上限
vllm serve <model> --dtype half用 fp16 省显存(默认 auto)
实用技巧 5
服务默认 :8000与 OpenAI 默认端口不同,注意改客户端 base_url
大模型先 --gpu-memory-utilization显存不够先调利用率
TP 数 = 显卡数张量并行按卡数设
调试开 --enforce-eager排除 CUDA graph 相关诡异问题
量化换吞吐/显存awq/gptq 在精度与成本间取舍
提示
- vLLM 是高吞吐 LLM 推理引擎(PagedAttention + 连续批处理),把开源模型以 OpenAI 兼容协议暴露出来,是自建推理服务的首选。
- 服务默认监听 :8000(不是 OpenAI 的 :8080),客户端改 `base_url=http://localhost:8000/v1` 即可无缝替换。
- 显存不够先调 `--gpu-memory-utilization`;多卡用 `--tensor-parallel-size` 按卡数设;调试诡异问题开 `--enforce-eager`。
- AWQ/GPTQ 量化能在精度与成本间取舍;`--enable-prefix-caching` 对多轮/重复前缀场景提速明显。
由 巧匠 维护
公开更新于 2026年8月23日,内容持续校对官方文档。