LocalAI 命令速查表 - local-ai 自托管推理服务 CLI 全参数

LocalAI 是开源、自托管的 OpenAI 兼容推理服务,可跑大模型、嵌入与语音,且无需 GPU 也能在 CPU 上跑。local-ai 是它的统一命令行入口:run / serve 启动服务,models 子命令管理模型,api 暴露标准端点。本表覆盖启动、模型管理与调用,读完即可自建一个私有 AI 后端。

AI 命令行·共 20 条命令·最后更新 2026-09-10

服务启动 6

local-ai run
以默认配置启动服务
local-ai serve
启动 API 服务(同 run)
docker run -p 8080:8080 localai/localai
用 Docker 启动
local-ai start
从资源文件启动资源
local-ai --help
列出全部命令
local-ai serve --models-path ./models
指定模型目录启动

模型管理 7

local-ai models list
列出已安装模型
local-ai models install gpt4all
安装官方画廊模型
local-ai models pull gpt4all
从仓库拉取模型
local-ai models install llama-3-instruct
安装指定模型
local-ai models apply
应用模型配置
local-ai models list --help
查看 models 子命令帮助
local-ai models install --help
查看安装参数

API 与微调 7

local-ai api
启动 API 服务
curl http://localhost:8080/v1/chat/completions -d '{"model":"gpt4all","messages":[{"role":"user","content":"hi"}]}'
调用聊天补全
curl http://localhost:8080/v1/models
列出可用模型
local-ai finetune
启动微调任务
local-ai api --help
查看 api 帮助
curl http://localhost:8080/v1/embeddings -d '{"input":"text"}'
调用嵌入接口
local-ai models apply --help
查看 apply 帮助

提示

  • LocalAI 兼容 OpenAI 协议,现有项目把 base_url 指向本机 8080 即可私有化。
  • 无 GPU 也能跑:在 CPU 机器上用较小量化模型即可提供基础补全能力。
  • `models install` 从官方画廊拉取,自定义模型放 `--models-path` 目录更易管理。

常见问题

LocalAI 和 Ollama 怎么选?

LocalAI 强调 OpenAI 协议兼容与自托管(含嵌入/语音),配置更全;Ollama 更轻量、上手快。两者都能本地跑模型。

没有 GPU 能跑吗?

能。LocalAI 支持纯 CPU 推理,只是速度较慢,建议用小量化模型。

官方参考来源

下方为命令对应的官方权威文档,供你核对最新用法与深入查阅。

由 巧匠 维护

公开更新于 2026年9月10日,内容持续校对官方文档。

联系我们

命令或描述有误?提交反馈、商务合作或产品建议都可发送邮件给我们。

联系我们