Ollama 命令速查表 - 本地大模型运行 CLI 全参数

Ollama 本地模型运行命令都在这里了,从拉取运行到自定义 Modelfile、从服务到多模型管理,按场景分类整理,复制即用。

AI 命令行·共 25 条命令·最后更新 2026-08-21

运行与交互 5

ollama run llama3.1
拉取并进入交互式对话
ollama run llama3.1 "一句话总结"
单次提问后退出
ollama run -m
指定运行参数(如上下文长度)
ollama serve
启动本地推理服务(默认 11434)
ollama ps
查看正在运行的模型

模型管理 5

ollama pull <model>
拉取模型到本地
ollama push <model>
推送模型到注册表
ollama list
列出已安装模型
ollama rm <model>
删除本地模型
ollama cp <src> <dst>
复制模型(改名/分支)

Modelfile 定制 5

FROM llama3.1
Modelfile 指定基础模型
PARAMETER temperature 0.7
设置采样温度
SYSTEM "你是一名严谨的助手"
设置系统提示词
TEMPLATE """{{ .Prompt }}"""
自定义对话模板
ollama create mymodel -f Modelfile
从 Modelfile 构建模型

服务与端口 5

ollama serve
前台启动推理服务
OLLAMA_HOST=0.0.0.0 ollama serve
允许局域网访问
curl http://localhost:11434/api/generate
调用生成 API
ollama show <model>
查看模型元数据/模板
ollama embeddings
生成文本嵌入向量

实用技巧 5

ollama run llama3.1 -c 4096
限制上下文窗口省显存
ollama list | head
快速预览已装模型
ollama run --verbose
显示 token 速度等诊断
多模型并行 ps 监控
用 ollama ps 看显存占用
ollama run <m> "翻译..."
把本地模型当离线翻译器

提示

  • Ollama 是本地推理事实标准,AI 表补"本地模型"入口能覆盖隐私/离线/零 API 成本场景,与云端 CLI 形成互补。
  • 用 Modelfile 的 SYSTEM/PARAMETER 固化行为,比每次在提示词里重复系统指令更稳、可版本化。
  • 显存紧张用 `-c` 限制上下文窗口,或用 `ollama ps` 监控多模型并行占用,避免 OOM。
  • 需要被代码调用时走 `ollama serve` + REST API,比交互式更适合服务化部署。

官方参考来源

命令整理自以下官方文档,点击核对最新用法。

由 巧匠 维护

公开更新于 2026年8月21日,内容持续校对官方文档。

联系我们

命令或描述有误?提交反馈、商务合作或产品建议都可发送邮件给我们。

联系我们