llamafile 命令速查表 - 单文件本地 LLM 运行与推理

llamafile 本地运行命令都在这里了,从单文件启动到 OpenAI 兼容服务、从 GGUF 加载到 GPU 加速,按场景分类整理,复制即用。

AI 命令行·共 25 条命令·最后更新 2026-08-23

获取与运行 5

curl -L <release-url> > llamafile && chmod +x llamafile
下载并赋予可执行权限
./mistral.llamafile
直接运行(自带权重则起 Web UI :8080)
./llamafile --help
查看全部参数
Windows 改名为 llamafile.exe
Windows 需 .exe 后缀才能运行
sh -c ./llamafile
zsh 老旧版本兜底启动方式

OpenAI 兼容服务 5

./xxx.llamafile --server --nobrowser
起 OpenAI 兼容服务(默认 :8080)
./xxx.llamafile --server --port 8081
指定端口
./xxx.llamafile --server --host 0.0.0.0
允许局域网/外部访问
curl http://localhost:8080/v1/models
列出服务暴露的模型
openai_api_base=http://localhost:8080/v1
OpenAI SDK 指向本地服务

加载外部权重 5

./llamafile -m ~/weights/foo.gguf
用外部 GGUF 权重运行
./llamafile -m model.gguf --temp 0.7 -p "..."
设温度并给提示词
./llamafile -m model.gguf --n-gpu-layers 35
开 GPU 加速(层数越多越快)
./llamafile -m model.gguf --image photo.jpg -p "描述这张图"
多模态(需 mmproj)
./llamafile -m model.gguf --grammar 'root ::= "yes" | "no"'
用 BNF 约束输出格式

嵌入与离线 5

./embed.llamafile --server --embedding --port 8081
起嵌入模型服务(RAG 用)
offline 完全本地,无数据出网
隐私/离线场景优势
./llamafile -m w.gguf --no-display-prompt
脚本化时隐藏提示符噪声
zipalign 把 .args 嵌进可执行
固化默认参数,双击即跑
单文件分发,跨平台(mac/win/linux/bsd)
构建一次到处跑

实用技巧 5

服务默认 :8080
与 vLLM 的 :8000 不同,注意客户端
--ngl 越多越快但吃显存
按显卡显存设层数
自带权重版起 Web UI
免命令行也能聊
离线优先选它
无网/涉密环境最稳
--grammar 控输出
脚本里要稳定结构用它

提示

  • llamafile 把 llama.cpp + Cosmopolitan Libc 打包成"单文件可执行",构建一次跨 macOS/Windows/Linux/BSD 运行,是本地/离线跑 LLM 最省事的方案。
  • 带权重的 server 版直接起 Web UI(:8080);用外部 GGUF 时 `-m` 指定路径,`--ngl` 控制 GPU 层数(越多越快但越吃显存)。
  • OpenAI 兼容服务默认 :8080(注意不是 vLLM 的 :8000),客户端改 `base_url` 即可接入;嵌入模型用 `--embedding` 起服务做 RAG。
  • 完全本地、数据不出网——隐私/涉密/无网环境首选;`--grammar` 能用 BNF 约束输出格式,脚本化调用更稳。

官方参考来源

命令整理自以下官方文档,点击核对最新用法。

由 巧匠 维护

公开更新于 2026年8月23日,内容持续校对官方文档。

联系我们

命令或描述有误?提交反馈、商务合作或产品建议都可发送邮件给我们。

联系我们

在 GitHub 编辑此页

直接修改源文件并提交 PR,优化这份速查表。