Skip to content

参考

基于 Ollama 官方文档编写 —— CLI 命令 / Modelfile 指令 / PARAMETER / API 端点 / 环境变量 / GGUF 量化 / 多模态

CLI 命令全表

命令用途示例
ollama run <model>拉取并进入交互对话ollama run llama3.2
ollama pull <model>仅下载模型ollama pull qwen2.5:7b
ollama push &lt;user&gt;/<model>推送到 registryollama push myuser/mybot
ollama create &lt;name&gt; -f <file>从 Modelfile 创建ollama create mybot -f Modelfile
ollama list列出本地模型ollama list
ollama ps列出运行中模型ollama ps
ollama show &lt;model&gt;显示模型详情ollama show llama3.2
ollama rm &lt;model&gt;删除模型ollama rm llama3.2
ollama cp &lt;src&gt; <dst>复制模型ollama cp llama3.2 myllama
ollama serve启动后台服务ollama serve
ollama --version显示版本ollama --version

ollama show 子命令

子命令用途
ollama show &lt;model&gt;显示完整信息
ollama show &lt;model&gt; --info模型元信息(架构、参数量、量化)
ollama show &lt;model&gt; --license许可证
ollama show &lt;model&gt; --modelfile导出 Modelfile
ollama show &lt;model&gt; --parameters默认参数
ollama show &lt;model&gt; --templatechat template
ollama show &lt;model&gt; --system默认 system message

ollama run 交互命令

命令用途
/?显示帮助
/bye退出
/show info显示模型信息
/show license显示许可证
/show modelfile显示 Modelfile
/show system显示 system message
/show stats显示 token 统计
/set system &lt;text&gt;设新 system message
/set parameter &lt;name&gt; <value>改参数
/save &lt;name&gt;保存当前会话为新模型
/clear清空对话历史
/load &lt;model&gt;加载另一模型
/list列出已加载模型
/help帮助
"""&lt;text&gt;"""多行输入

Modelfile 指令全表

指令必需语法说明
FROMFROM &lt;model&gt;FROM ./&lt;file&gt;.gguf基础模型
TEMPLATETEMPLATE """&lt;go template&gt;"""chat template
SYSTEMSYSTEM """&lt;text&gt;"""默认 system message
PARAMETERPARAMETER &lt;name&gt; <value>推理参数
ADAPTERADAPTER ./&lt;file&gt;.ggufLoRA adapter
MESSAGEMESSAGE &lt;role&gt; <content>few-shot 示例
LICENSELICENSE """&lt;text&gt;"""许可证

TEMPLATE 变量

变量含义
{{ .System }}system message
{{ .Prompt }}user 输入
{{ .Response }}模型响应(生成时其后截断)

MESSAGE 角色

角色用途
system系统提示(与 SYSTEM 指令等价)
user用户消息
assistant助手消息

PARAMETER 全表

参数默认类型说明
mirostat0intMirostat 模式(0/1/2)
mirostat_eta0.1float学习率
mirostat_tau5.0float目标熵
num_ctx2048int上下文窗口
num_predict-1int最大生成长度(-1 无限)
repeat_last_n64int重复惩罚窗口
repeat_penalty1.1float重复惩罚系数
seed-1int随机种子
stop[]string[]停止字符串
temperature0.8float温度
tfs_z1.0floatTail-free sampling
top_k40intTop-K
top_p0.9floatTop-P
min_p0.0floatMin-P
num_keep0intprompt 保留 token
num_threadautointCPU 线程数
num_gpuautointGPU offload 层数

API 端点全表

OpenAI 兼容端点(/v1/*

端点方法用途
/v1/modelsGET列出模型
/v1/chat/completionsPOST对话补全
/v1/completionsPOST文本补全
/v1/embeddingsPOST向量
/v1/filesPOST上传文件

原生端点(/api/*

端点方法用途
/api/generatePOST文本生成(基础模型)
/api/chatPOST对话生成
/api/embeddingsPOST向量(旧)
/api/embedPOST向量(新)
/api/pullPOST拉取模型
/api/pushPOST推送模型
/api/createPOST创建模型
/api/copyPOST复制模型
/api/deleteDELETE删除模型
/api/showPOST模型详情
/api/tagsGET列出本地模型
/api/psGET列出运行中模型
/api/versionGET版本

/api/chat 请求体

json
{
  "model": "llama3.2",
  "messages": [
    {"role": "system", "content": "..."},
    {"role": "user", "content": "...", "images": ["<base64>"]}
  ],
  "stream": true,
  "format": "json",
  "options": {
    "temperature": 0.7,
    "num_ctx": 4096,
    "seed": 42,
    "stop": ["</answer>"]
  },
  "tools": [...],
  "keep_alive": "5m"
}

响应字段

json
{
  "model": "llama3.2",
  "created_at": "2025-07-28T...",
  "message": {"role": "assistant", "content": "..."},
  "done": true,
  "done_reason": "stop",
  "total_duration": 1234567890,
  "load_duration": 1234567,
  "prompt_eval_count": 42,
  "prompt_eval_duration": 987654,
  "eval_count": 128,
  "eval_duration": 876543210
}

环境变量全表

变量默认说明
OLLAMA_HOST127.0.0.1监听地址
OLLAMA_PORT11434监听端口(用 OLLAMA_HOST=0.0.0.0:9000 一起设)
OLLAMA_ORIGINSlocalhostCORS 允许来源(* 全开)
OLLAMA_MODELS~/.ollama/models模型存储目录
OLLAMA_KEEP_ALIVE5m默认模型驻留时间
OLLAMA_NUM_PARALLEL视内存并发请求数
OLLAMA_MAX_LOADED_MODELS视内存最大同时加载模型数
OLLAMA_MAX_QUEUE512请求队列长度
OLLAMA_DEBUG0调试日志
OLLAMA_FLASH_ATTENTION0启用 flash attention
OLLAMA_KV_CACHE_TYPEf16KV Cache 精度(f16/q8_0/q4_0)
OLLAMA_LLM_LIBRARYauto强制指定计算库
CUDA_VISIBLE_DEVICES全部GPU 可见性
HIP_VISIBLE_DEVICES全部AMD GPU 可见性

GGUF 量化级别速查

量化7B 体积精度速度备注
Q8_0~7 GB几乎无损内存充足首选
Q6_K~5.5 GB极小高质量
Q5_K_M~4.8 GB很小推荐
Q4_K_M~4.1 GB默认/最常用
Q4_0~3.8 GB最快老格式
Q3_K_M~3.3 GB明显内存吃紧
Q2_K~2.7 GB较大极限压缩
F16~13 GB无损未量化

硬件支持

平台计算后端备注
macOS (Apple Silicon)MetalM1/M2/M3/M4 原生加速,最佳体验
macOS (Intel)CPU仅 CPU
Linux + NVIDIACUDA自动检测
Linux + AMDROCm / Vulkan
Windows + NVIDIACUDA
Windows + AMD/DirectMLDirectX
任意 + CPUCPU全平台兜底

官方推荐模型(2025.07)

模型命令参数量适合
Llama 3.2ollama run llama3.21B/3B通用对话
Qwen2.5ollama run qwen2.50.5B-72B中英文 / 代码
DeepSeek-R1ollama run deepseek-r11.5B-671B推理
Gemma 3ollama run gemma31B-27B通用
Mistralollama run mistral7B通用
Phi-4ollama run phi414B小而强
CodeLlamaollama run codellama7B-70B代码
Llavaollama run llava7B-13B多模态
nomic-embed-textollama run nomic-embed-text137Membedding
llama3.2-visionollama run llama3.2-vision11B/90B多模态

参考