MLC-LLM 命令速查表 - mlc_llm 编译推理 CLI 全参数
MLC-LLM 把主流开源大模型编译成可在本地 GPU(CUDA / Metal / Vulkan)高效运行的格式,mlc_llm 是其统一命令行入口:既能 chat 交互,也能 serve 起 OpenAI 兼容服务,还能 convert 把 HuggingFace 模型转成可部署权重。本表覆盖三大子命令与常用参数,读完即可在本地起一个推理服务。
交互式对话 5
mlc_llm chat HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC直接对话预编译模型
mlc_llm chat model --device cuda用 NVIDIA GPU 运行
mlc_llm chat model --device mac用 Apple Silicon 运行
mlc_llm chat model --device metal显式使用 Metal 后端
mlc_llm chat model --quantization q4f16_1指定量化方案
服务与模型转换 5
mlc_llm serve model启动本地 OpenAI 兼容服务
mlc_llm serve --device cuda以 CUDA 后端启动服务
mlc_llm convert model --quantization q4f16_1转换并量化模型
mlc_llm convert model --model-lib path指定已编译的模型库
mlc_llm serve --host 0.0.0.0 --port 8000对外暴露服务端口
参数与帮助 10
mlc_llm chat model --overrides "{}"用 JSON 覆盖生成参数
mlc_llm chat model --temperature 0.7设置采样温度
mlc_llm chat model --top-p 0.95设置 nucleus 采样
mlc_llm chat model --max-gen-len 1024限制最大生成长度
mlc_llm chat model --device vulkan用 Vulkan 后端运行
mlc_llm serve --port 8000自定义服务端口
mlc_llm convert --revision main指定转换的分支
mlc_llm chat --help查看 chat 全部参数
mlc_llm serve --help查看 serve 全部参数
mlc_llm --help查看顶层命令
提示
- 本地 GPU 推理优先用 `mlc_llm chat model --device cuda`(或 mac),性能远高于纯 CPU。
- 要对外提供 API 时走 `mlc_llm serve`,它兼容 OpenAI 协议,可直接接客户端工具。
- `convert` 把 HuggingFace 模型量化成 MLC 格式,转换一次后即可离线反复 serve。
常见问题
MLC-LLM 和 llama.cpp 有什么不同?
MLC-LLM 基于编译路线(TVM/Relax),强调跨硬件统一部署与量化编译;llama.cpp 是手写的 C++ 推理引擎。两者都能本地跑 GGUF/编译模型。
serve 出的接口兼容什么协议?
兼容 OpenAI 聊天补全协议,客户端把 base_url 指向 serve 地址即可直接调用。
由 巧匠 维护
公开更新于 2026年9月10日,内容持续校对官方文档。