MLC-LLM 命令速查表 - mlc_llm 编译推理 CLI 全参数

MLC-LLM 把主流开源大模型编译成可在本地 GPU(CUDA / Metal / Vulkan)高效运行的格式,mlc_llm 是其统一命令行入口:既能 chat 交互,也能 serve 起 OpenAI 兼容服务,还能 convert 把 HuggingFace 模型转成可部署权重。本表覆盖三大子命令与常用参数,读完即可在本地起一个推理服务。

AI 命令行·共 20 条命令·最后更新 2026-09-10
mlc-llmlocal-llmgpucompileclitvm

交互式对话 5

mlc_llm chat HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC
直接对话预编译模型
mlc_llm chat model --device cuda
用 NVIDIA GPU 运行
mlc_llm chat model --device mac
用 Apple Silicon 运行
mlc_llm chat model --device metal
显式使用 Metal 后端
mlc_llm chat model --quantization q4f16_1
指定量化方案

服务与模型转换 5

mlc_llm serve model
启动本地 OpenAI 兼容服务
mlc_llm serve --device cuda
以 CUDA 后端启动服务
mlc_llm convert model --quantization q4f16_1
转换并量化模型
mlc_llm convert model --model-lib path
指定已编译的模型库
mlc_llm serve --host 0.0.0.0 --port 8000
对外暴露服务端口

参数与帮助 10

mlc_llm chat model --overrides "{}"
用 JSON 覆盖生成参数
mlc_llm chat model --temperature 0.7
设置采样温度
mlc_llm chat model --top-p 0.95
设置 nucleus 采样
mlc_llm chat model --max-gen-len 1024
限制最大生成长度
mlc_llm chat model --device vulkan
用 Vulkan 后端运行
mlc_llm serve --port 8000
自定义服务端口
mlc_llm convert --revision main
指定转换的分支
mlc_llm chat --help
查看 chat 全部参数
mlc_llm serve --help
查看 serve 全部参数
mlc_llm --help
查看顶层命令

提示

  • 本地 GPU 推理优先用 `mlc_llm chat model --device cuda`(或 mac),性能远高于纯 CPU。
  • 要对外提供 API 时走 `mlc_llm serve`,它兼容 OpenAI 协议,可直接接客户端工具。
  • `convert` 把 HuggingFace 模型量化成 MLC 格式,转换一次后即可离线反复 serve。

常见问题

MLC-LLM 和 llama.cpp 有什么不同?

MLC-LLM 基于编译路线(TVM/Relax),强调跨硬件统一部署与量化编译;llama.cpp 是手写的 C++ 推理引擎。两者都能本地跑 GGUF/编译模型。

serve 出的接口兼容什么协议?

兼容 OpenAI 聊天补全协议,客户端把 base_url 指向 serve 地址即可直接调用。

官方参考来源

下方为命令对应的官方权威文档,供你核对最新用法与深入查阅。

由 巧匠 维护

公开更新于 2026年9月10日,内容持续校对官方文档。

联系我们

命令或描述有误?提交反馈、商务合作或产品建议都可发送邮件给我们。

联系我们