llama.cpp 命令速查表 - llama-cli 本地推理 CLI 全参数

llama.cpp 是用 C/C++ 重写的轻量推理引擎,能在纯 CPU、Apple Silicon 与各类 GPU 上跑 GGUF 量化模型。llama-cli 是它自带的命令行对话前端,适合在本地终端快速验证模型、做离线推理。本表覆盖模型加载、采样、上下文与性能调优的关键 flag,读完即可在笔记本上跑起对话。

AI 命令行·共 20 条命令·最后更新 2026-09-10
llama-cppllama-cligguflocal-llminferencecliquantized

基础推理 8

llama-cli -m model.gguf -p "你好"
以提示词一次性生成后退出
llama-cli -m model.gguf --interactive
进入交互式对话
llama-cli -m model.gguf -ngl 35
卸载 35 层到 GPU 加速
llama-cli -m model.gguf -c 4096
设置上下文窗口为 4096
llama-cli -m model.gguf -t 8
使用 8 个线程
llama-cli -m model.gguf --temp 0.7
设置采样温度
llama-cli -m model.gguf --top-p 0.9
设置 nucleus 采样阈值
llama-cli -m model.gguf --color
终端输出带颜色高亮

采样与上下文 6

llama-cli -m model.gguf --repeat-penalty 1.1
设置重复惩罚
llama-cli -m model.gguf -s 42
固定随机种子便于复现
llama-cli -m model.gguf --system "你是一名助手"
注入系统提示词
llama-cli -m model.gguf -cnv
开启多轮对话上下文
llama-cli -m model.gguf -f prompt.txt
从文件读取提示词
llama-cli -m model.gguf --flash-attn
启用 Flash Attention 加速

性能与高级 6

llama-cli -m model.gguf -ngl 99
尽可能多地卸载到 GPU
llama-cli -m model.gguf -t 16
提高线程数以加速 CPU 推理
llama-cli -m model.gguf -c 8192
扩大上下文到 8192
llama-cli -m model.gguf --mlock
锁定模型权重到内存防换出
llama-cli -m model.gguf -b 512
设置 prompt 批处理大小
llama-cli --help
列出全部可用参数

提示

  • `-ngl` 是性能关键:能全卸载到 GPU 就设大(如 99),纯 CPU 机器设 0。
  • 上下文 `-c` 越大越吃显存,按模型实际支持长度设置,不必盲目拉满。
  • GGUF 量化模型配合 `-ngl` + `--flash-attn` 在 Apple Silicon / CUDA 上体验最佳。

常见问题

llama-cli 和 ollama 有什么区别?

llama-cli 是 llama.cpp 的原生推理前端,偏底层、参数细;ollama 是更上层的模型管理+服务封装,开箱即用但可调项少。

GPU 不生效怎么办?

确认用 `-ngl` 设置了卸载层数,且构建版本包含对应后端(CUDA / Metal / Vulkan);纯 CPU 跑设 `-ngl 0`。

官方参考来源

下方为命令对应的官方权威文档,供你核对最新用法与深入查阅。

由 巧匠 维护

公开更新于 2026年9月10日,内容持续校对官方文档。

联系我们

命令或描述有误?提交反馈、商务合作或产品建议都可发送邮件给我们。

联系我们