llamafile 命令速查表 - 单文件本地 LLM 运行与推理
llamafile 本地运行命令都在这里了,从单文件启动到 OpenAI 兼容服务、从 GGUF 加载到 GPU 加速,按场景分类整理,复制即用。
获取与运行 5
curl -L <release-url> > llamafile && chmod +x llamafile下载并赋予可执行权限
./mistral.llamafile直接运行(自带权重则起 Web UI :8080)
./llamafile --help查看全部参数
Windows 改名为 llamafile.exeWindows 需 .exe 后缀才能运行
sh -c ./llamafilezsh 老旧版本兜底启动方式
OpenAI 兼容服务 5
./xxx.llamafile --server --nobrowser起 OpenAI 兼容服务(默认 :8080)
./xxx.llamafile --server --port 8081指定端口
./xxx.llamafile --server --host 0.0.0.0允许局域网/外部访问
curl http://localhost:8080/v1/models列出服务暴露的模型
openai_api_base=http://localhost:8080/v1OpenAI SDK 指向本地服务
加载外部权重 5
./llamafile -m ~/weights/foo.gguf用外部 GGUF 权重运行
./llamafile -m model.gguf --temp 0.7 -p "..."设温度并给提示词
./llamafile -m model.gguf --n-gpu-layers 35开 GPU 加速(层数越多越快)
./llamafile -m model.gguf --image photo.jpg -p "描述这张图"多模态(需 mmproj)
./llamafile -m model.gguf --grammar 'root ::= "yes" | "no"'用 BNF 约束输出格式
嵌入与离线 5
./embed.llamafile --server --embedding --port 8081起嵌入模型服务(RAG 用)
offline 完全本地,无数据出网隐私/离线场景优势
./llamafile -m w.gguf --no-display-prompt脚本化时隐藏提示符噪声
zipalign 把 .args 嵌进可执行固化默认参数,双击即跑
单文件分发,跨平台(mac/win/linux/bsd)构建一次到处跑
实用技巧 5
服务默认 :8080与 vLLM 的 :8000 不同,注意客户端
--ngl 越多越快但吃显存按显卡显存设层数
自带权重版起 Web UI免命令行也能聊
离线优先选它无网/涉密环境最稳
--grammar 控输出脚本里要稳定结构用它
提示
- llamafile 把 llama.cpp + Cosmopolitan Libc 打包成"单文件可执行",构建一次跨 macOS/Windows/Linux/BSD 运行,是本地/离线跑 LLM 最省事的方案。
- 带权重的 server 版直接起 Web UI(:8080);用外部 GGUF 时 `-m` 指定路径,`--ngl` 控制 GPU 层数(越多越快但越吃显存)。
- OpenAI 兼容服务默认 :8080(注意不是 vLLM 的 :8000),客户端改 `base_url` 即可接入;嵌入模型用 `--embedding` 起服务做 RAG。
- 完全本地、数据不出网——隐私/涉密/无网环境首选;`--grammar` 能用 BNF 约束输出格式,脚本化调用更稳。
由 巧匠 维护
公开更新于 2026年8月23日,内容持续校对官方文档。