llama.cpp 命令速查表 - llama-cli 本地推理 CLI 全参数
llama.cpp 是用 C/C++ 重写的轻量推理引擎,能在纯 CPU、Apple Silicon 与各类 GPU 上跑 GGUF 量化模型。llama-cli 是它自带的命令行对话前端,适合在本地终端快速验证模型、做离线推理。本表覆盖模型加载、采样、上下文与性能调优的关键 flag,读完即可在笔记本上跑起对话。
基础推理 8
llama-cli -m model.gguf -p "你好"以提示词一次性生成后退出
llama-cli -m model.gguf --interactive进入交互式对话
llama-cli -m model.gguf -ngl 35卸载 35 层到 GPU 加速
llama-cli -m model.gguf -c 4096设置上下文窗口为 4096
llama-cli -m model.gguf -t 8使用 8 个线程
llama-cli -m model.gguf --temp 0.7设置采样温度
llama-cli -m model.gguf --top-p 0.9设置 nucleus 采样阈值
llama-cli -m model.gguf --color终端输出带颜色高亮
采样与上下文 6
llama-cli -m model.gguf --repeat-penalty 1.1设置重复惩罚
llama-cli -m model.gguf -s 42固定随机种子便于复现
llama-cli -m model.gguf --system "你是一名助手"注入系统提示词
llama-cli -m model.gguf -cnv开启多轮对话上下文
llama-cli -m model.gguf -f prompt.txt从文件读取提示词
llama-cli -m model.gguf --flash-attn启用 Flash Attention 加速
性能与高级 6
llama-cli -m model.gguf -ngl 99尽可能多地卸载到 GPU
llama-cli -m model.gguf -t 16提高线程数以加速 CPU 推理
llama-cli -m model.gguf -c 8192扩大上下文到 8192
llama-cli -m model.gguf --mlock锁定模型权重到内存防换出
llama-cli -m model.gguf -b 512设置 prompt 批处理大小
llama-cli --help列出全部可用参数
提示
- `-ngl` 是性能关键:能全卸载到 GPU 就设大(如 99),纯 CPU 机器设 0。
- 上下文 `-c` 越大越吃显存,按模型实际支持长度设置,不必盲目拉满。
- GGUF 量化模型配合 `-ngl` + `--flash-attn` 在 Apple Silicon / CUDA 上体验最佳。
常见问题
llama-cli 和 ollama 有什么区别?
llama-cli 是 llama.cpp 的原生推理前端,偏底层、参数细;ollama 是更上层的模型管理+服务封装,开箱即用但可调项少。
GPU 不生效怎么办?
确认用 `-ngl` 设置了卸载层数,且构建版本包含对应后端(CUDA / Metal / Vulkan);纯 CPU 跑设 `-ngl 0`。
由 巧匠 维护
公开更新于 2026年9月10日,内容持续校对官方文档。