SGLang 命令速查表 - sglang.launch_server 推理服务 CLI 全参数
SGLang 是高吞吐大模型推理与服务框架,以 RadixAttention 复用 KV 缓存著称。python -m sglang.launch_server 是它的服务入口,支持张量并行、数据并行与多种量化。本表覆盖启动、量化与性能参数,读完即可在高显存机器上部署一个 OpenAI 兼容服务。
基础启动 5
python -m sglang.launch_server --model-path meta-llama/Meta-Llama-3-8B-Instruct最简启动
python -m sglang.launch_server --model-path model --host 0.0.0.0 --port 30000指定地址与端口
python -m sglang.launch_server --model-path model --tp 22 卡张量并行
python -m sglang.launch_server --model-path model --dp 2 --tp 2数据+张量并行
python -m sglang.launch_server --model-path model --mem-fraction-static 0.7降低 KV 缓存显存占比
量化与精度 5
python -m sglang.launch_server --model-path model --quantization fp8权重 fp8 量化
python -m sglang.launch_server --model-path model --kv-cache-dtype fp8_e4m3KV 缓存 fp8 量化
python -m sglang.launch_server --model-path model --dtype bfloat16设置计算精度
python -m sglang.launch_server --model-path model --context-length 32768扩展上下文长度
python -m sglang.launch_server --model-path model --trust-remote-code允许自定义模型代码
性能与高级 10
python -m sglang.launch_server --model-path model --chunked-prefill-size 4096长提示分块预填充
python -m sglang.launch_server --model-path model --enable-torch-compile开启 torch.compile 加速
python -m sglang.launch_server --model-path model --max-running-requests 64提高并发请求数
python -m sglang.launch_server --model-path model --schedule-policy lpm最长前缀匹配调度
python -m sglang.launch_server --model-path model --config config.yaml从配置文件启动
python -m sglang_router.launch_server --model-path model --dp 2 --tp 2用 Router 做数据并行
python -m sglang.launch_server --help列出全部参数
python -m sglang.launch_server --model-path model --nnodes 2多节点张量并行
python -m sglang.launch_server --model-path model --enable-deterministic-inference确定性推理
python -m sglang.launch_server --model-path model --disable-cuda-graph关闭 CUDA Graph(调试用)
提示
- --tp 按卡数拆分,单卡放不下就加卡或降 `--mem-fraction-static` / 量化。
- RadixAttention 默认开启,重复前缀(系统提示、RAG 上下文)会被自动复用,无需额外配置。
- 显存不足时优先试 `--quantization fp8` 或 `--mem-fraction-static 0.8`。
常见问题
SGLang 和 vLLM 有什么不同?
两者都是高吞吐推理框架;SGLang 以 RadixAttention 前缀复用与结构化生成见长,vLLM 以 PagedAttention 显存管理著称。都能起 OpenAI 兼容服务。
服务暴露什么协议?
OpenAI 兼容的 /v1/chat/completions 与 /generate,客户端切换 base_url 即可。
由 巧匠 维护
公开更新于 2026年9月10日,内容持续校对官方文档。