关键词:Ollama / DeepSeek / 本地部署 / LLM

Ollama 是目前最流行的本地大模型运行工具,GitHub 累计 176,741 Star,底层基于 Georgi Gerganov 的 llama.cpp 项目,支持 macOS、Windows、Linux 三端一键安装,三条命令即可在本地跑起 DeepSeek-R1。本文基于 Ollama 官方文档和模型库,完整覆盖三端安装流程、NVIDIA / AMD GPU 驱动配置、DeepSeek 各版本显存需求对照、REST API 调用,以及 Open WebUI 可视化界面搭建,适合零基础到有经验的开发者。

 

先看硬件:你的显卡能跑哪个版本?

DeepSeek 模型按参数量分多个档位,选错了要么跑不动,要么速度极慢。以下是 Ollama 官方模型库的实际文件大小与推荐配置:

模型版本

文件大小

上下文

推荐显存

适合场景

deepseek-r1:1.5b

1.1 GB

128K

4 GB+

入门体验,M 系列 Mac / 低端 PC

deepseek-r1:7b

4.7 GB

128K

8 GB+

日常使用首选

deepseek-r1:8b(latest)

5.2 GB

128K

8 GB+

当前默认版本(Qwen3-8B 蒸馏)

deepseek-r1:14b

9.0 GB

128K

16 GB+

效果更好,RTX 3080 / M2 Pro

deepseek-r1:32b

20 GB

128K

24 GB+

高质量推理,RTX 4090 / M3 Max

deepseek-r1:70b

43 GB

128K

多卡或 48 GB+

接近满血效果

deepseek-r1:671b

404 GB

160K

多卡服务器

完整模型

deepseek-v3:671b 同样需要 404 GB,需 Ollama v0.5.5+,适合服务器部署。

GPU 兼容性快速检查:

 NVIDIA:计算能力 5.0+(GTX 750 Ti 及以上)、驱动版本 550+,RTX 20/30/40/50 全系支持

 AMD:Linux 需 ROCm v7,支持 RX 6000/7000/9000 系列;Windows 仅支持 RX 7000 系列

 Apple Silicon:M1 / M2 / M3 / M4 全系支持,统一内存直接当显存用,16 GB 内存可流畅跑 14b

 

macOS 安装

方法一:命令行(推荐)

curl -fsSL https://ollama.com/install.sh | sh

方法二:图形界面安装

前往 ollama.com/download 下载 Ollama.dmg,拖入应用程序文件夹,双击启动。

安装完成后,菜单栏出现 Ollama 图标即代表服务已在后台运行(默认监听 localhost:11434)。

拉取并运行 DeepSeek-R1:

# 拉取默认版本(8b,5.2 GB)
ollama pull deepseek-r1
 
# 直接运行(自动下载+启动交互对话)
ollama run deepseek-r1
 
# 指定版本
ollama run deepseek-r1:14b

下载完成后,终端出现 >>> 提示符即可直接对话。输入 /bye 退出交互模式,模型仍在后台保持加载状态。

 

Windows 安装

方法一:PowerShell 一键安装

irm https://ollama.com/install.ps1 | iex

方法二:图形界面安装

前往 ollama.com/download 下载 OllamaSetup.exe,双击安装,完成后系统托盘出现 Ollama 图标。

确认服务运行:

# 检查服务状态
curl http://localhost:11434
 
# 拉取模型
ollama pull deepseek-r1
 
# 运行
ollama run deepseek-r1

多 GPU 配置(NVIDIA):

如果有多张显卡,可以通过环境变量限制 Ollama 使用哪张:

# 查看 GPU UUID
nvidia-smi -L
 
# 指定使用第一张卡(在系统环境变量中设置)
$env:CUDA_VISIBLE_DEVICES = "0"

 

Linux 安装

一键安装脚本:

curl -fsSL https://ollama.com/install.sh | sh

安装完成后 Ollama 会自动配置为 systemd 服务。

NVIDIA GPU 配置

 

# 验证 GPU 驱动(需要 550+)
nvidia-smi
 
# 确认驱动版本
nvidia-smi --query-gpu=driver_version --format=csv,noheader

如果驱动版本低于 550,前往 NVIDIA 官网下载最新驱动后重新运行安装脚本。

Linux 休眠唤醒后 GPU 丢失问题: 重新加载驱动模块:

 

sudo rmmod nvidia_uvm && sudo modprobe nvidia_uvm

AMD GPU 配置(ROCm v7)

 

# 安装 ROCm(参考 AMD 官方 amdgpu-install 工具)
# 安装完成后下载 Ollama ROCm 扩展
curl -fsSL https://ollama.com/download/ollama-linux-amd64-rocm.tar.zst \
    | sudo tar x -C /usr

如果你的 AMD GPU 不在官方支持列表,可以尝试强制指定最近的 LLVM target,例如 RX 5400(gfx1034)可以尝试使用 gfx1030 的参数:

 

export HSA_OVERRIDE_GFX_VERSION="10.3.0"

配置为 systemd 服务(生产环境推荐)

安装脚本已自动创建服务,手动管理命令:

# 查看服务状态
sudo systemctl status ollama
 
# 设置开机自启
sudo systemctl enable ollama
 
# 重启服务
sudo systemctl restart ollama
 
# 查看日志
journalctl -u ollama -f

自定义配置(如修改监听端口或开启远程访问):

 

sudo systemctl edit ollama

在弹出编辑器中添加:

 

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"

 

常用命令速查

 

# 查看已下载的模型
ollama list
 
# 删除模型
ollama rm deepseek-r1:7b
 
# 更新模型
ollama pull deepseek-r1
 
# 查看模型详情
ollama show deepseek-r1
 
# 后台运行服务(不启动终端 UI)
ollama serve

REST API 调用

Ollama 在本地 11434 端口提供完整的 REST API,兼容 OpenAI 接口格式:

 

# 基础对话
curl http://localhost:11434/api/chat \
  -d '{
    "model": "deepseek-r1",
    "messages": [{"role": "user", "content": "用 Python 写一个快速排序"}],
    "stream": false
  }'

Python 调用:

 

pip install ollama

from ollama import chat
 
response = chat(
    model='deepseek-r1',
    messages=[{'role': 'user', 'content': '用 Python 写一个快速排序'}]
)
print(response.message.content)

JavaScript 调用:

npm i ollama

import ollama from 'ollama'
 
const response = await ollama.chat({
  model: 'deepseek-r1',
  messages: [{ role: 'user', content: '用 Python 写一个快速排序' }]
})
console.log(response.message.content)

本地资源不足时,也可以通过支持 OpenAI 兼容接口的云端服务补充——例如七牛云 AI 推理服务提供 DeepSeek 系列模型的 API 接入,只需将 base_url 替换即可,代码结构与本地调用完全一致。

 

搭一个可视化界面:Open WebUI

不想用命令行,可以用 Open WebUI,Docker 一条命令搞定:

 

docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

浏览器打开 http://localhost:3000,在设置中将 Ollama API 地址填入 http://host.docker.internal:11434,即可在 Web 界面与本地 DeepSeek 对话。

 

常见问题

Q:ollama run 后模型下载很慢,能加速吗?

Ollama 模型托管在 Cloudflare,国内直连速度因网络环境差异较大。可以在 ollama pull 命令前设置代理:

 

export https_proxy=http://127.0.0.1:7890
ollama pull deepseek-r1

或者在局域网内搭一台已经下好模型的机器,通过 OLLAMA_HOST=0.0.0.0 开启远程访问,其他机器直接用。

Q:CPU 能不能跑?

能,但很慢。Ollama 在没有 GPU 时自动回退 CPU 推理,7b 模型在 CPU 上大约每秒 3-8 个 token。1.5b 模型 CPU 体验相对可接受,14b 以上建议有 GPU 再运行。

Q:M 系列 Mac 怎么最大化利用统一内存?

Ollama 会自动调度 Apple Neural Engine + GPU,无需额外配置。M2 Pro(16 GB)跑 14b 问题不大;M3 Max(36 GB)可以流畅跑 32b。注意不要同时开其他内存占用大的应用。

Q:Ollama 更新后模型需要重新下载吗?

不需要,模型文件存储在独立路径(macOS/Linux:~/.ollama/models;Windows:C:\Users\<用户名>\.ollama\models),Ollama 版本更新不影响已下载的模型。

 

结语

Ollama 把本地大模型部署的门槛压到了极低——三端安装命令都在 1-2 行之内,DeepSeek-R1 的 8b 版本在任何有 8 GB 显存的机器上都能流畅运行。从 1.5b 到 671b,覆盖了从入门体验到生产部署的完整参数区间,MIT 协议可商用。

Ollama 官方 GitHub 最后更新于 2026 年 7 月,GPU 支持文档涵盖 NVIDIA RTX 50xx 最新架构和 AMD ROCm v7 全系支持,本文所有命令基于当前官方文档,建议定期访问 docs.ollama.com 获取最新信息。

 

延伸资源

 Ollama 官网:https://ollama.com

 DeepSeek-R1 模型库:https://ollama.com/library/deepseek-r1

 Open WebUI:https://github.com/open-webui/open-webui

 云端 DeepSeek API 接入:https://www.qiniu.com/ai/plan