Ollama本地部署大模型完全指南:安装、提速与模型目录规划
自己本地跑大模型这事儿这两年算是彻底从极客圈走向普通开发者了。而说到本地部署Ollama基本是绕不开的一个工具——它把“下载模型、启动服务、调用接口”这三件事压缩成了几条命令让一台普通电脑也能变身为私有化推理节点。但很多人卡在了第一步安装。倒不是安装本身难而是下载慢、装完不知道模型放哪儿、显存不够该选哪个模型这些问题网上的教程七零八落照着操作经常踩坑。这篇东西就是把我自己从零开始部署Ollama的完整过程、踩过的坑、以及最后的目录规划方案整理出来尽量做到看完就能照着抄懂一点命令行更好完全零基础也没问题。这篇文章适合这几类人想在本地体验大模型但不想碰复杂环境的普通用户需要在内网或离线环境部署私有模型的开发者以及刚入手NVIDIA显卡、想搞清楚自己显卡到底能跑多大模型的新手。1. 安装方案选型与前置检查1.1 三种安装方式的适用场景Ollama官方提供了三种主流的安装途径Windows安装包、macOS安装包、Linux脚本安装。我先后在Windows和Linux上都部署过简单说一下各自的特点。Windows安装包是最傻瓜化的从官网下载OllamaSetup.exe双击一路点下一步就行装完命令行直接能用。官方还贴心地设置了开机自启和托盘图标适合普通用户。Linux脚本安装目前是官方最推荐的方式原因在于Linux环境通常承载服务器、无头环境、容器场景脚本方式可以在纯命令行下完成安装和后续升级。命令只有一行curl -fsSL https://ollama.com/install.sh | sh这个脚本会自动完成三件事下载可执行文件到/usr/local/bin、创建系统用户ollama、注册systemd服务。脚本装完立刻就能用ollama run拉模型体验非常顺滑。macOS安装包其实就是个压缩包加图形化安装引导步骤和Windows类似不赘述。需要注意的一点是Apple Silicon芯片M系列的安装包是明确标注了优化的Intel芯片的老款Mac在跑模型时会明显吃力。先确认芯片型号再下载对应版本。除了这三种还出现过用Docker跑Ollama的方案这个适合本来就有Docker环境的用户但Docker本身又有体积和端口映射的管理成本对新手并不友好。我的建议是本地单机使用优先原生安装只有需要做容器化发布时才考虑Docker方式。1.2 硬件配置的底线要求模型推理最重要的是显存和内存尤其是显存。我的经验是6G显存是体验线8G够用12G以上舒服。如果不确定自己的显卡能不能带得动可以先看下面这张表显存大小建议模型规模推荐模型4G以下2B以下qwen2.5:1.5b, phi3:mini6G7B量化版qwen2.5:7b, llama3.1:8bQ4量化8G8B量化llama3.1:8b, qwen2.5:7b12G14B量化qwen2.5:14b24G32B量化qwen2.5:32b无独显只能CPU推理1.5b~4b 模型速度偏慢我说的量化版本意思就是模型文件被压缩过精度略降低但显存占用大幅下降。Ollama拉取模型时默认使用的就是量化版本不需要你自己手动选择这对新手很友好。但要注意的是如果你的机器只有核显或者纯CPU那么即使能装好Ollama运行大模型的体验也基本是“能出字但很慢”。如果想先用CPU体验一下建议选1.5B或3B这种小模型。磁盘空间也是个不容忽视的环节。很多新手装好Ollama之后拉了一个模型就把C盘塞满了因为这个工具默认会把模型文件存放在用户目录下。7B量级模型的体积通常在4GB到5GB之间14B在9GB上下32B则要奔着20GB去了所以安装前先看看自己的剩余空间至少预留20GB以上才比较从容。1.3 显存与内存的调优思路很多只看显存的人会忽略内存的作用但其实内存不够同样会让推理失败或崩溃。Ollama加载模型时会把模型权重加载到显存显存不够时它会尝试把部分层放在内存中。这种做法虽然能跑但会大幅拖慢推理速度因为内存和显卡之间的数据传输是瓶颈。以6G显存的机器为例跑一个7B量化模型时显存大约会占用5.5GB左右恰好接近上限如果你的电脑同时运行浏览器、代码编辑器等多个程序显存和内存都会产生竞争。我个人的做法是在启动Ollama之前关掉占用大的应用比如Chrome和Electron应用给模型留出充足的空间。如果你有条件升级内存双通道16GB是底线32GB会是当前阶段非常舒服的配置。原因是大模型推理时除了权重还涉及上下文KV Cache的存储上下文越长显存占用越高。Ollama在上文窗口不够时还会把部分KV缓存调度到内存内存容量越大支持的上下文长度就越高。2. 详细安装步骤与提速方案2.1 Windows下的安装全过程Windows端的安装确实是最省心的。去官网点Download后会下载到一个OllamaSetup.exe文件体积大概在500MB左右双击运行一路Next就完成了。但这里有个很多人都忽略的点官网下载的文件可能非常慢因为服务器在境外。这也是网上铺天盖地“Ollama下载太慢了”这类搜索热词出现的原因。官方安装包托管在GitHub Release上很多时候网络不通畅几十KB/s甚至直接卡死。一个很有效的提速思路是利用镜像站点也就是国内提供GitHub资源加速的几个公共镜像域名。当你把下载链接中的https://github.com/...地址复制到镜像站里会跳转到一个国内可高速访问的加速地址。我用下来可以稳定跑到几MB/s到十几MB/s。下载完成后双击安装安装过程中没有额外选项装完后系统PATH环境变量会自动加入ollama.exe路径。按Win R输入cmd再输入ollama -v如果输出了类似ollama version 0.x.x的信息说明安装已经成功。这时就可以直接拉模型了比如运行ollama run qwen2.5:7b这是我最推荐的国内入门组合模型体积小、中文能力强适合大多数人第一次体验。2.2 Linux下的脚本安装与自启动配置Linux下的安装脚本虽然是一行命令但有个前提是系统需要预装curl。如果你的Ubuntu是最小化安装的可能连curl都没有所以先在终端执行sudo apt update sudo apt install -y curl然后执行官方安装脚本curl -fsSL https://ollama.com/install.sh | sh同样的问题如果安装脚本下载很慢可以先在能访问GitHub的环境里把install.sh下载下来或者用镜像域名加速下载脚本内容再在本地执行。脚本跑完会自动把Ollama设置为系统服务用systemctl可以查看状态systemctl status ollama如果输出中有active (running)说明服务已经起来了。这时想跑模型直接执行ollama run即可。但与Windows不同的是Linux下默认不会自动停止服务它会常驻后台监听11434端口。如果想关闭自启动可以执行sudo systemctl disable ollama如果只是临时停止但不取消开机自启sudo systemctl stop ollama2.3 使用国内镜像源加速模型下载安装包下载快只是一半更大问题是拉取模型时同样会卡在“网络超时”或“几KB/s”。Ollama官方默认从registry.ollama.ai拉取模型这个域名在部分网络环境下并不好连。还好Ollama提供了一个环境变量思路把模型下载地址指向镜像站。在Windows下需要先打开设置中的“系统 - 系统信息 - 高级系统设置 - 环境变量”新建一个用户环境变量变量名变量值OLLAMA_BASE_URL镜像站地址部分镜像站的地址形如https://ollama镜像域名比如可以通过一些提供ollama镜像服务的站点获得。设置完成后重启Ollama相关进程再执行拉取模型就能明显看到下载速度提升。我的经验是这个环境变量对整机生效也就是说后续所有模型都会从镜像站拉取。如果镜像站不稳定可以把该变量删掉恢复默认。Linux下设置环境变量的方式是编辑~/.bashrc或~/.zshrc追加一行export OLLAMA_BASE_URLhttps://ollama镜像站地址然后重新加载配置source ~/.bashrc重启Ollama服务后生效sudo systemctl restart ollama2.4 macOS安装的注意事项macOS安装包下载后是一个Ollama-darwin.zip压缩包解压后会看到Ollama.app把它拖到“应用程序”文件夹即可。首次启动时系统会弹出“无法验证开发者”的警告需要在“系统偏好设置 - 隐私与安全性”中点击“仍要打开”。M系列芯片的Mac在跑7B或8B量级模型时速度尚可但14B以上就会明显吃力。如果你是Intel芯片的老Mac建议只尝试3B以下的小模型否则生成速度接近“看一个字等几秒”的体验。macOS下修改模型存放路径的方式和Windows环境变量类似在~/.zshrc中添加export OLLAMA_MODELS/你的路径重新加载后重启Ollama即可生效。3. 自定义安装路径与模型存放规划3.1 为什么默认装在C盘会是个坑Ollama默认把程序装在C:\Users\你的用户名\AppData\Local\Programs\Ollama而模型文件则存放在C:\Users\你的用户名\.ollama\models。如果你的C盘是256GB或512GB的系统盘拉几个大型模型就能把它塞爆。我在尝试32B量化模型时就有过惨痛教训——拉了一半就把C盘写满了系统直接卡死最后不得不删除模型文件释放空间。从那以后我养成了一个习惯安装后第一时间把模型存储路径改到非系统盘。改路径的核心是设置OLLAMA_MODELS环境变量。在Windows上操作步骤是右键“此电脑” - 属性 - 高级系统设置 - 环境变量 - 新建用户变量变量名填写OLLAMA_MODELS变量值填写你想要存放模型的目录比如D:\ai\ollama_models。设置完成后需要重启Ollama才能让新路径生效。如果Ollama已经启动了托盘图标右键点击退出然后重新打开或直接重启电脑。3.2 Linux下重定向模型目录Linux的默认模型路径为/usr/share/ollama/.ollama/modelsroot用户为/root/.ollama/models这通常位于系统盘区。如果你想改到/data这类挂载盘可以通过配置systemd服务环境变量实现sudo systemctl edit ollama在这个编辑窗口中写入[Service] EnvironmentOLLAMA_MODELS/data/ollama_models保存退出后应用配置sudo systemctl daemon-reload sudo systemctl restart ollama之后再执行ollama run拉模型实际的模型文件会被存放到/data/ollama_models下。可以通过以下命令确认最终路径ollama list一般ollama list会显示模型名称、大小和修改时间格式类似qwen2.5:7b。如果你想知道模型文件的确切位置还可以去设置的目录下直接查看。3.3 我为自己的机器规划的目录方案我的主力机器是一台Windows 一块6G显存的老显卡、外加32G内存的配置。经过多轮使用后我把目录规划成下面这样目录作用D:\ai\ollama_models存放所有模型文件D:\ai\ollama_cache存放临时下载的模型分片D:\ai\scripts存放我写的便捷启动脚本ollama_cache的配置方式和OLLAMA_MODELS类似通过OLLAMA_CACHE环境变量指定。这个目录不设的话下载过程中的临时文件会直接写在系统临时目录下体积很大所以单独分配一个目录对系统盘也是一种保护。4. 使用初体验第一个本地模型的完整流程4.1 拉取并运行你的第一个模型安装完成后最好马上做一个功能验证最简便的方式是运行一个小模型。在命令行执行ollama run qwen2.5:7b首次运行会先下载模型大小约4.7GB左右等进度条跑完后会自动进入交互式对话界面。这时你输入任何内容模型都会在本机进行推理并返回回复。如果一切正常你会看到类似下面这样的输出效果——一个符号出现在屏幕下方就像等待输入的聊天框。此时可以试一句“你好介绍一下你自己”等几秒钟模型就会输出一段中文回答。如果你用的是CPU推理或者显存不足回答速度可能会比较慢但至少说明整个链路已经通了。按Ctrl D或输入/bye可以退出对话界面。4.2 常用命令速查与管理技巧我整理了一份最常用的Ollama命令新手照着用完全够命令作用ollama list查看已下载的模型列表ollama run 模型名运行指定模型并进入对话ollama pull 模型名只下载模型不进入对话ollama rm 模型名删除指定模型ollama show 模型名查看模型详细信息ollama serve手动启动Ollama服务一般不需要ollama stop 模型名停止正在运行的模型模型的命名格式通常是名称:标签比如qwen2.5:7b中的7b就是标签代表模型规模。体积大小可以通过ollama list看到单位是GB。如果你只想拉取模型而不想进入交互对话就用ollama pull。这在服务器场景下特别常用你可以先一次性把需要用到的模型拉齐再通过API调用避免上线时现下载造成超时。4.3 API调用方式与编程对接Ollama不仅是命令行工具它还内置了一个HTTP服务默认监听http://localhost:11434。这意味着你可以在自己写的程序里通过HTTP请求直接调用本地模型不需要额外的SDK。最简单的方式是使用curl直接请求curl http://localhost:11434/api/generate -d { model: qwen2.5:7b, prompt: 用一句话解释什么是Python }返回结果会包含生成的文本、耗时、token数等元信息。更正式的做法是用Python的requests库发起请求并且在流式模式下逐段读取输出import requests response requests.post( http://localhost:11434/api/generate, json{model: qwen2.5:7b, prompt: 用一句话解释什么是Python, stream: True} ) for line in response.iter_lines(): if line: print(line.decode(utf-8))流式输出适合做打字机效果配合Web前端会有更好的体验。Ollama官方也维护了JavaScript和Python的客户端库进一步降低了集成成本。如果你有API调用的经验完全可以把Ollama当作一个本地的OpenAI兼容服务来使用只需在前端代码中把base_url和api_key做一下替换。5. 常见问题与排查技巧5.1 下载慢、一直卡在加载这是遇到最多的问题。安装包下载慢解决思路是换镜像下载模型拉取慢优先设置OLLAMA_BASE_URL环境变量。如果网络实在不行还有一个办法是在别的机器上下载好ollama pull过的模型目录拷贝到新机器的OLLAMA_MODELS目录下。在Windows下模型目录结构是这样的OLLAMA_MODELS目录下有一个blobs目录里面是很多没有扩展名的模型分片文件。把整个目录打包拷贝到目标机器并设置好环境变量即可完成离线部署。我在内网环境尝试过这个方法完全可行这样做还能避开网络限制。5.2 拉取模型超时或报错file does not exist这个错误在网络状况不稳定的情况下经常出现。常见原因有两个一是镜像站暂时不支持某个模型的某个tag二是模型下载过程中断导致本地缓存损坏。我的排查步骤是先确认模型名称和标签是否正确可以去模型官网看具体的tag。如果名称正确清除本地缓存后重试Windows下删除%TEMP%下以ollama开头的临时文件Linux下查看/tmp下有无残留。换个镜像站或换回官方源重试。如果用ollama run 模型名时报错可以先ollama pull显式触发下载观察具体的错误信息。实在解决不了时最后一步是从能联网的机器上完整下载模型目录打包拷贝过来。尺有所短但在网络条件恶劣的场景下这可能是最稳妥的方案。5.3 显存不足或模型加载失败显存不足时Ollama通常并不会直接崩溃它会自动尝试把部分层放到内存中但这会导致速度骤降。如果你是6G显存并且运行7B模型发现速度很慢那么说明模型已经在用内存做兜底了。此时你有三种选择换更小的模型比如qwen2.5:3b显存占用大约2GB速度会非常顺畅。使用OLLAMA_NUM_GPU环境变量控制参与推理的GPU层数例如设为-1表示全部由GPU处理设为0表示完全由CPU处理。如果只是想体验大模型可以把上下文长度调小减少KV Cache的内存占用比如通过参数设置较小的num_ctx值。这里有一种取舍显存不充裕时模型规模和输出质量直接矛盾。我的个人经验是先从小模型入手把整套流程跑通再逐步尝试更大的模型这样能更清晰地感知性能瓶颈。5.4 端口冲突原因排查当出现port is already allocated或无法访问服务时很可能是11434端口被其他程序占用了。可以用netstat -ano | findstr 11434查看占用进程如果确实是其他程序占用可以通过环境变量OLLAMA_HOST把服务地址修改为其他端口比如OLLAMA_HOST127.0.0.1:11435 ollama serve在实际部署中我还遇到过把地址设置为0.0.0.0时局域网内其他机器可以访问的情况这在团队内共享模型能力时非常有用。但要提醒一句对外网开放时要注意没有访问控制本地服务直接暴露在公网上存在被滥用的风险。5.5 实测下来最省心的几个习惯绕了这么多弯路之后我在实际使用中慢慢养成了一套习惯这里也分享给你。拉到模型后第一时间修改模型存放路径这是第一优先级否则C盘爆掉是早晚的事。其次是给Ollama预留一个独立目录我在D:\ai下区分了模型、缓存和脚本目录方便排查问题和备份。再有就是给常用命令写一个小脚本比如一键启动服务、一键拉取常用模型这样每次新装环境时不用重复敲命令。针对显存较小的机器还需要建立一个自己的模型清单意识。例如对我这台6G显存的机器我常驻的模型就这么几个qwen2.5:7b用于日常问答、qwen2.5:3b用于快速测试代码、nomic-embed-text用于文本向量化。真正理性的做法是只保留高频模型不要一口气下载几十个然后吃灰。6. 与Web界面工具的结合6.1 Ollama Web UI的快速启动命令行交互虽然好用但不够直观。如果你更习惯图形化界面Open WebUI是众多Ollama前端中最常用的一款。它的安装可以通过Docker完成也可以直接用pip安装。如果你没有Docker可以用pip方式安装pip install open-webui open-webui serve启动后浏览器访问http://localhost:8080注册一个本地账号然后在设置中选择模型即可像使用ChatGPT一样和本地模型对话。这套Web界面支持多轮对话、参数调节、模型切换界面设计和主流商业产品已经很接近了。6.2 LM Studio作为另一种选择热搜词里经常把Ollama和LM Studio放一起并列出现这两者的定位其实有差异。LM Studio也是一个本地大模型运行工具自带图形界面安装即用适合完全不想碰命令行的用户。而Ollama更偏向开发者适合需要与代码、服务、脚本深度集成的人。如果你只是想在本地体验一下不想折腾那么LM Studio会更友好。但如果你想把它作为一个本地的模型服务嵌进自己的应用、做接口调用那么Ollama的API设计和生态完备性要胜过LM Studio。6.3 模型市场的选择与下载在模型选择上官方模型库Ollama Library覆盖了主流模型包括llama3.1、qwen2.5、phi4、mistral等。可以通过ollama search在命令行搜索想要的模型也可以直接访问官网查看每个模型的详细信息。我个人的推荐思路是中文任务首选通义千问系列它在中文理解和生成上确实有优势代码任务首选CodeGemma或DeepSeek Coder系列英文通用任务可以用Llama 3.1系列。不追求极限效果的话小模型已经能覆盖大部分日常使用没必要盲目追求大模型。7. 进阶Ollama的配置与调优7.1 常用环境变量一览Ollama支持很多环境变量我把自己常用的整理到了表格中方便你直接查阅变量名作用OLLAMA_MODELS指定模型存放路径OLLAMA_HOST指定服务监听地址和端口OLLAMA_BASE_URL指定模型下载源OLLAMA_CACHE指定缓存目录OLLAMA_MAX_LOADED_MODELS限制同时加载的模型数量OLLAMA_NUM_GPU控制GPU层数OLLAMA_KEEP_ALIVE控制模型在内存中驻留时间其中OLLAMA_MAX_LOADED_MODELS对显存有限的机器特别有用。默认情况下再次切换模型时会自动卸载之前加载的模型设置为1可以保证每次只保留一个模型从而避免切换模型时显存爆掉。OLLAMA_KEEP_ALIVE的默认值为5分钟表示模型在5分钟内没有被调用就会从内存中卸载。如果你的内存比较大可以把这个时间调长一些因此切回同一模型时无需重新加载等待时间会明显缩短反之如果内存紧张建议缩短避免长期占用资源。7.2 推理参数调整与体验优化Ollama提供了几个核心的推理参数在API调用时可以通过options字段传参。比较常用的是temperature温度值越大生成的随机性越强、top_p核采样、num_ctx上下文长度等。这里用Python演示一个带参数的调用import requests response requests.post( http://localhost:11434/api/generate, json{ model: qwen2.5:7b, prompt: 写一段关于人工智能的短诗, stream: False, options: { temperature: 0.8, top_p: 0.9, num_ctx: 4096 } } ) print(response.json()[response])需要注意num_ctx越大占用的显存或内存越多。6G显存机器运行7B模型时num_ctx设置为4096已经接近上限继续增加到8192就很容易出现内存不足。如果遇到这个问题先检查已设置的上下文长度再决定是否加载。7.3 模型转换与格式说明如果你从Hugging Face上下载了GGUF格式模型但发现Ollama不识别通常是因为GGUF文件还缺少一个对应的Modelfile定义文件。Ollama支持通过Modelfile导入自定义模型。最简单的导入方式是创建一个文本文件内容如下FROM /path/to/your/model.gguf然后在同目录下执行ollama create mymodel -f Modelfile完成后就能通过ollama run mymodel直接使用。这个过程本身不需要联网因此在内网环境非常实用你可以提前下载好GGUF文件然后通过ollama create创建本地模型而无需访问官方模型仓库。7.4 Ollama运行常见错误与指令速查在实际使用中我还遇到过一些零碎但常见的问题这里按问题分类整理成速查表错误或现象原因与解法Error: pull model manifest: file does not existtag不存在或镜像源不完整换一个tag或重新pullError: load model: ... no such file or directory模型文件路径被移动用ollama rm删除后重新pull问问题时响应特别慢模型加载到内存了检查ollama ps查看是否只用CPU在推理局域网其他设备无法访问检查OLLAMA_HOST是否设置成0.0.0.0以及防火墙是否放行端口Windows控制台中文乱码在终端窗口标题栏右键选择“属性”把字体改为Lucida Console或新宋体ollama ps这个命令非常实用它能列出当前已加载的模型、显存占用、进程状态排查性能问题时第一件事就应该是它。8. 离线部署与多机协作8.1 完全离线环境的安装方案有朋友问过我在完全没有外网的机器上怎么装Ollama。提前准备好安装包和模型文件是可以完全离线部署的。具体做法是先在一台有网的机器上安装Ollama并下载好需要的模型然后找到模型目录默认路径或不设置的OLLAMA_MODELS路径把整个目录压缩打包。把压缩包传到目标机器上解压后通过环境变量OLLAMA_MODELS指向解压路径再重新启动Ollama即可。Windows下还可以直接利用OllamaSetup.exe安装包离线安装无需联网。安装完成后再拷贝模型目录。这一步要注意的是如果目标机器的用户目录不同必须提前设置OLLAMA_MODELS环境变量否则Ollama会按默认路径寻找模型导致找不到。8.2 局域网内的多机共享如果你有多台机器想让一台强大的GPU服务器作为推理节点其余机器通过网络访问它这个玩法很实用。在GPU服务器上设置export OLLAMA_HOST0.0.0.0:11434再启动Ollama服务然后其他机器就可以通过http://服务器IP:11434访问了。但这里要特别注意资源分配问题。如果多台机器同时调用显存和内存的压力会成倍增加如果没有做好并发控制服务很容易卡死。我给团队使用时的做法是在局域网内只允许小规模并发使用需要更稳定的并发能力时应考虑排队或任务调度机制。8.3 与私有知识库结合的一个思路本地部署大模型最大的价值是可以结合私有数据做知识问答。常见的思路是用向量库存储文档切片和向量检索到相关内容后把结果拼进Prompt再交给大模型生成回答。Ollama本身不提供向量数据库但它可以运行像nomic-embed-text这样的向量模型用来生成文本的向量表示。借助少量Python代码就可以实现一个简单的本地方档问答机器人。我自己的实验是给几十篇Markdown文档做了一个简易问答效果虽然离商用级有差距但胜在数据完全本地化和可定制化。9. 一个6G显存机器的实际体验记录最后聊聊我自己的体验。我的显卡是6G显存属于当前入门级偏上的水平。在安装Ollama和运行qwen2.5:7b模型之后第一感受是“终于体会到本地自由对话了”。回答速度大约在每秒生成10到20个token之间这个速度和人打字相比略慢但作为一款完全在本地运行的模型体验已经相当不错。如果切换成qwen2.5:3b输出速度会快很多适合日常快速问答场景。而在尝试14B模型时即使OLLAMA尝试把部分层放到内存中速度也明显下滑到了“看一行字要等好几秒”的程度。所以对大多数6G显存用户来说7B是甜点14B只是勉强能跑长期使用并不推荐。安装之初我也被“下载慢”折腾得够呛从安装包到模型全是瓶颈设置镜像后才真正顺畅起来。另外一个很深的体会是路径规划的重要把模型放到非系统盘既提升空间容量的灵活度也避免系统盘突然告警。如果你正在尝试第一次部署Ollama我的建议是先学会看ollama list和ollama ps这两个命令一个管你装了什么一个管你正在跑什么后续所有排查基本都围绕它们展开。装好之后先跑一个小模型把链路打通再逐步挑战更大的模型。方向走对了剩下的只是时间问题。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →