首页
看点啥
插画图片
首页 科技看点 使用Ollama 一键部署 DeepSeek的流程:本地大模型从安装到调用实用指南

使用Ollama 一键部署 DeepSeek的流程:本地大模型从安装到调用实用指南

2026-09-23 0

平时做技术实践时,很多问题不是概念不会,而是细节没串起来。拿“采用Ollama 一键部署 DeepSeek的流程:本地大模型从安装到调……”来说,它看着像小点,放到项目里常会牵出环境、配置、兼容性和维护成本。下面按实际采用顺序,把思路、关键写法和容易踩坑的地方讲清楚,便于大家直接对照操作。

一、为什么选择 Ollama 部署 DeepSeek

实际处理时,DeepSeek 是当前很受欢迎的开源大语言模型,尤其以 DeepSeek-R1 系列为代表,在推理、代码和中文理解等场景表现突出。对开发者来说,想要更快在本地运行 DeepSeek,Ollama 是最省心的选择之一:

  • 一键安装:官方提供安装脚本和安装程序,几乎不用手动设置 CUDA 环境。
  • 模型即服务:一条命令即可拉取、运行模型,同时自动提供 HTTP API。
  • 多规格可选:DeepSeek 提供了从 1.5B 到 671B 多种规格的模型,可根据硬件自由选择。
  • 跨平台:兼容 Linux、macOS 和 Windows。

落到代码里,本文将以 Ollama 为核心,完整演示如何从零开始部署 DeepSeek,同时在命令行和 API 中调用。

二、环境准备与硬件要求

结合项目来看,开始之前,建议先确认自己的机器设置。Ollama 既能够采用 CPU 推理,也能够采用 GPU 加速。下面以 DeepSeek-R1 蒸馏版本为例,给出按量化后显存/内存估算的参考值:

模型规格适用场景大概资源需求
deepseek-r1:1.5b入门体验、低设置机器约 1.5GB 内存/显存
deepseek-r1:7b日常对话、代码辅助约 5GB 内存/显存
deepseek-r1:8b日常对话、性能更好约 6GB 内存/显存
deepseek-r1:14b更复杂推理任务约 9GB 至 10GB 显存
deepseek-r1:32b高质量推理约 20GB 显存
deepseek-r1:70b接近旗舰体验约 40GB 或更多显存
deepseek-r1:671b完整版最强推理需大显存多卡或高端服务器

普通笔记本或台式机建议从 7b8b14b 开始尝试;如果只有入门级设置,能够选择 1.5b。实际占用会因量化方式和上下文长度而有所浮动。

三、第一步:安装 Ollama

3.1 Linux 安装

在主流 Linux 发行版上,能够直接采用官方安装脚本:

curl -fsSL https://ollama.com/install.sh | sh

安装完成后,能够借助以下命令确认版本:

ollama --version

3.2 macOS 安装

结合项目来看,macOS 用户能够从 Ollama 官网下载安装包,也能够采用 Homebrew 安装:

brew install ollama

3.3 Windows 安装

从实现思路看,Windows 用户从 Ollama 官网下载 OllamaSetup.exe,双击安装即可。安装完成后,可在 PowerShell 或 CMD 中直接采用 ollama 命令。

四、第二步:拉取并运行 DeepSeek 模型

4.1 查看可用的 DeepSeek 模型

实际处理时,能够在 Ollama 官方模型库中搜索 deepseek,也能够直接采用下列常用模型名。这里以 deepseek-r1:7b 为例。

4.2 直接运行模型

采用 ollama run 命令时,如果本地没有该模型,Ollama 会自动先下载再启动对话:

ollama run deepseek-r1:7b

执行后会出现交互式提示符,输入问题即可开始对话。比如:

>>> 请用中文解释一下什么是大语言模型

输入 /bye 能够退出当前对话。

4.3 先下载模型,稍后再运行

结合项目来看,若想要提前把模型下载到本地,能够采用 pull 命令:

ollama pull deepseek-r1:7b

下载完成后,再采用 ollama run deepseek-r1:7b 启动即可。

五、第三步:Ollama 常用命令

掌握下面这些命令,基本能够完成日常管理:

  • ollama list:查看本地已下载的模型。
  • ollama show deepseek-r1:7b:查看模型详情,包括参数量、量化方式和模板信息。
  • ollama ps:查看当前正在运行的模型。
  • ollama stop deepseek-r1:7b:停止指定模型。
  • ollama rm deepseek-r1:7b:删除本地模型。

比如查看本地模型列表:

ollama list

六、第四步:借助 API 调用 DeepSeek

从实现思路看,Ollama 启动后默认会在本机 11434 端口提供 HTTP API,所以能够很便于地接入自己的程序。下面是一个采用 curl 的示例:

curl http://localhost:11434/api/ch@t -d '{
  "model": "deepseek-r1:7b",
  "messages": [
    {
      "role": "user",
      "content": "你好,请简单介绍一下自己"
    }
  ]
}'

实际处理时,也能够采用流式输出接口,适合需边生成边展示的场景,将 URL 中的 /api/ch@t 改为 /api/ch@t 同时设置 stream 字段为 true 即可。更完整的接口说明可参考 Ollama 官方 API 文档。

若你采用 Python,能够这样封装一个最简调用:

import requests
def ch@t(prompt):
    resp = requests.post(
        "http://localhost:11434/api/ch@t",
        json={
            "model": "deepseek-r1:7b",
            "messages": [{"role": "user", "content": prompt}],
            "stream": False,
        },
    )
    return resp.json()["message"]["content"]
print(ch@t("用一句话介绍 Ollama"))

七、进阶:搭建可视化 Web 界面

在这个场景下,若不想一直采用命令行,能够配合 Open WebUI 搭建一个类似 ChatGPT 的可视化界面。前提是已经安装 Docker,随后执行:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

启动完成后,在浏览器访问 (链接已移除),注册本地账号后即可选择已安装的 DeepSeek 模型进行对话。

八、常用问题排查

8.1 下载速度太慢或中断

实际处理时,模型体积较大时,下载可能需较长时间。能够换用更稳定的网络环境重试,也能够直接执行 ollama pull 重新拉取,Ollama 兼容断点续传。

8.2 生成速度比较慢

理解这一步时,CPU 推理会比 GPU 慢。能够检查 ollama ps 确认模型状态,同时优先选择参数规模更小的版本,或为机器增加可用内存、显存。

8.3 端口被占用

11434 端口冲突,能够借助设置 OLLAMA_HOST 环境变量调整地址和端口,再重启 Ollama 服务。

8.4 模型名称找不到

理解这一步时,建议采用带标签的完整名称,比如 deepseek-r1:7b。如果不写标签,可能无法匹配到预期版本。能够用 ollama list 核对本地实际名称。

九、总结

落到代码里,采用 Ollama 部署 DeepSeek 的流程能够概括为:安装 Ollama → 拉取模型 → 命令行体验 → API 接入应用。整个过程无需复杂的环境设置,几分钟内即可在本地跑起 DeepSeek。对于个人开发者、学习者或希望保护数据隐私的团队,这是一个很实用且低成本的本地大模型方案。

结合项目来看,到此这篇关于采用Ollama 一键部署 DeepSeek的流程:本地大模型从安装到调用的文章就介绍到这了,更多相关Ollama部署 DeepSeek内容请搜索脚本之家以前的文章或继续浏览下面的相关文章,希望大家以后多多兼容脚本之家!

喜欢(0)

上一篇

Claude Code高级使用教程:从Worktree并行到Dynamic Workflows实用指南

下一篇

C#构建Windows服务与IIS实时监测系统实用指南

猜你喜欢