vLLM 命令速查表 - 高性能 LLM 推理与服务部署

vLLM 推理部署命令都在这里了,从安装到起 OpenAI 兼容服务、从张量并行到量化,按场景分类整理,复制即用。

AI 命令行·共 25 条命令·最后更新 2026-08-23

安装 5

pip install vllm
安装 vLLM(含 CLI 入口 vllm)
pip install vllm --upgrade
升级到最新版
vllm --version
查看已安装版本
python -c "import vllm; print(vllm.__version__)"
确认包可用
vllm --help
查看全部子命令

启动 OpenAI 兼容服务 5

vllm serve facebook/opt-125m
起服务(默认 :8000,OpenAI 协议)
vllm serve <model> --host 0.0.0.0 --port 8080
指定监听地址与端口
vllm serve <model> --api-key <key>
启用 API Key 校验(或环境变量 VLLM_API_KEY)
vllm serve <model> --tensor-parallel-size 2
多 GPU 张量并行(TP)
vllm serve <model> --gpu-memory-utilization 0.9
调高显存利用率装更大模型

客户端调用 5

curl http://localhost:8000/v1/models
列出已加载模型
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"...","messages":[...]}'
发起 chat 请求
openai_api_base=http://localhost:8000/v1
OpenAI SDK 指向本地 vLLM
vllm serve <model> --max-model-len 8192
限制上下文长度省显存
vllm serve <model> --enforce-eager
禁用 CUDA graph,调试更稳

量化与性能 5

vllm serve <model> --quantization awq
加载 AWQ 量化权重
vllm serve <model> --quantization gptq
加载 GPTQ 量化权重
vllm serve <model> --enable-prefix-caching
开前缀缓存,重复前缀加速
vllm serve <model> --max-num-seqs 256
调并发序列数上限
vllm serve <model> --dtype half
用 fp16 省显存(默认 auto)

实用技巧 5

服务默认 :8000
与 OpenAI 默认端口不同,注意改客户端 base_url
大模型先 --gpu-memory-utilization
显存不够先调利用率
TP 数 = 显卡数
张量并行按卡数设
调试开 --enforce-eager
排除 CUDA graph 相关诡异问题
量化换吞吐/显存
awq/gptq 在精度与成本间取舍

提示

  • vLLM 是高吞吐 LLM 推理引擎(PagedAttention + 连续批处理),把开源模型以 OpenAI 兼容协议暴露出来,是自建推理服务的首选。
  • 服务默认监听 :8000(不是 OpenAI 的 :8080),客户端改 `base_url=http://localhost:8000/v1` 即可无缝替换。
  • 显存不够先调 `--gpu-memory-utilization`;多卡用 `--tensor-parallel-size` 按卡数设;调试诡异问题开 `--enforce-eager`。
  • AWQ/GPTQ 量化能在精度与成本间取舍;`--enable-prefix-caching` 对多轮/重复前缀场景提速明显。

官方参考来源

命令整理自以下官方文档,点击核对最新用法。

由 巧匠 维护

公开更新于 2026年8月23日,内容持续校对官方文档。

联系我们

命令或描述有误?提交反馈、商务合作或产品建议都可发送邮件给我们。

联系我们

在 GitHub 编辑此页

直接修改源文件并提交 PR,优化这份速查表。