Ollama 命令速查表 - 本地大模型运行 CLI 全参数
Ollama 本地模型运行命令都在这里了,从拉取运行到自定义 Modelfile、从服务到多模型管理,按场景分类整理,复制即用。
运行与交互 5
ollama run llama3.1拉取并进入交互式对话
ollama run llama3.1 "一句话总结"单次提问后退出
ollama run -m指定运行参数(如上下文长度)
ollama serve启动本地推理服务(默认 11434)
ollama ps查看正在运行的模型
模型管理 5
ollama pull <model>拉取模型到本地
ollama push <model>推送模型到注册表
ollama list列出已安装模型
ollama rm <model>删除本地模型
ollama cp <src> <dst>复制模型(改名/分支)
Modelfile 定制 5
FROM llama3.1Modelfile 指定基础模型
PARAMETER temperature 0.7设置采样温度
SYSTEM "你是一名严谨的助手"设置系统提示词
TEMPLATE """{{ .Prompt }}"""自定义对话模板
ollama create mymodel -f Modelfile从 Modelfile 构建模型
服务与端口 5
ollama serve前台启动推理服务
OLLAMA_HOST=0.0.0.0 ollama serve允许局域网访问
curl http://localhost:11434/api/generate调用生成 API
ollama show <model>查看模型元数据/模板
ollama embeddings生成文本嵌入向量
实用技巧 5
ollama run llama3.1 -c 4096限制上下文窗口省显存
ollama list | head快速预览已装模型
ollama run --verbose显示 token 速度等诊断
多模型并行 ps 监控用 ollama ps 看显存占用
ollama run <m> "翻译..."把本地模型当离线翻译器
提示
- Ollama 是本地推理事实标准,AI 表补"本地模型"入口能覆盖隐私/离线/零 API 成本场景,与云端 CLI 形成互补。
- 用 Modelfile 的 SYSTEM/PARAMETER 固化行为,比每次在提示词里重复系统指令更稳、可版本化。
- 显存紧张用 `-c` 限制上下文窗口,或用 `ollama ps` 监控多模型并行占用,避免 OOM。
- 需要被代码调用时走 `ollama serve` + REST API,比交互式更适合服务化部署。
由 巧匠 维护
公开更新于 2026年8月21日,内容持续校对官方文档。