SGLang 命令速查表 - sglang.launch_server 推理服务 CLI 全参数

SGLang 是高吞吐大模型推理与服务框架,以 RadixAttention 复用 KV 缓存著称。python -m sglang.launch_server 是它的服务入口,支持张量并行、数据并行与多种量化。本表覆盖启动、量化与性能参数,读完即可在高显存机器上部署一个 OpenAI 兼容服务。

AI 命令行·共 20 条命令·最后更新 2026-09-10
sglanginferenceservergpullmcliserving

基础启动 5

python -m sglang.launch_server --model-path meta-llama/Meta-Llama-3-8B-Instruct
最简启动
python -m sglang.launch_server --model-path model --host 0.0.0.0 --port 30000
指定地址与端口
python -m sglang.launch_server --model-path model --tp 2
2 卡张量并行
python -m sglang.launch_server --model-path model --dp 2 --tp 2
数据+张量并行
python -m sglang.launch_server --model-path model --mem-fraction-static 0.7
降低 KV 缓存显存占比

量化与精度 5

python -m sglang.launch_server --model-path model --quantization fp8
权重 fp8 量化
python -m sglang.launch_server --model-path model --kv-cache-dtype fp8_e4m3
KV 缓存 fp8 量化
python -m sglang.launch_server --model-path model --dtype bfloat16
设置计算精度
python -m sglang.launch_server --model-path model --context-length 32768
扩展上下文长度
python -m sglang.launch_server --model-path model --trust-remote-code
允许自定义模型代码

性能与高级 10

python -m sglang.launch_server --model-path model --chunked-prefill-size 4096
长提示分块预填充
python -m sglang.launch_server --model-path model --enable-torch-compile
开启 torch.compile 加速
python -m sglang.launch_server --model-path model --max-running-requests 64
提高并发请求数
python -m sglang.launch_server --model-path model --schedule-policy lpm
最长前缀匹配调度
python -m sglang.launch_server --model-path model --config config.yaml
从配置文件启动
python -m sglang_router.launch_server --model-path model --dp 2 --tp 2
用 Router 做数据并行
python -m sglang.launch_server --help
列出全部参数
python -m sglang.launch_server --model-path model --nnodes 2
多节点张量并行
python -m sglang.launch_server --model-path model --enable-deterministic-inference
确定性推理
python -m sglang.launch_server --model-path model --disable-cuda-graph
关闭 CUDA Graph(调试用)

提示

  • --tp 按卡数拆分,单卡放不下就加卡或降 `--mem-fraction-static` / 量化。
  • RadixAttention 默认开启,重复前缀(系统提示、RAG 上下文)会被自动复用,无需额外配置。
  • 显存不足时优先试 `--quantization fp8` 或 `--mem-fraction-static 0.8`。

常见问题

SGLang 和 vLLM 有什么不同?

两者都是高吞吐推理框架;SGLang 以 RadixAttention 前缀复用与结构化生成见长,vLLM 以 PagedAttention 显存管理著称。都能起 OpenAI 兼容服务。

服务暴露什么协议?

OpenAI 兼容的 /v1/chat/completions 与 /generate,客户端切换 base_url 即可。

官方参考来源

下方为命令对应的官方权威文档,供你核对最新用法与深入查阅。

由 巧匠 维护

公开更新于 2026年9月10日,内容持续校对官方文档。

联系我们

命令或描述有误?提交反馈、商务合作或产品建议都可发送邮件给我们。

联系我们