最近想离线部署一套AI编程工具,以提高生产力。首先研究离线部署LLM的方法,再研究离线部署AI Agent的方法。
Ollama 离线安装
目前LLM主流部署框架与工具主要有:Ollama、llama.cpp、vLLM、LM Studio、Xinference、Hugging Face Transformers。综合考虑,先从最简单的开始,离线部署Ollama。
根据机器的CPU指令集,从github官网下载 Ollama的安装包,这里选择绿色版的ollama-windows-amd64.zip。
安装过程
解压ollama-windows-amd64.zip到安装目录,并将 ollama 的安装目录添加到系统环境变量 PATH 中。
配置过程
- 修改 Ollama 下载模型保存位置
新建环境变量 OLLAMA_MODELS ,设置其值为 Ollama 下载模型保存位置。
启动过程
打开 cmd 窗口,启动 ollama 服务器实例,如下所示:
1 | ## 启动Ollama服务 |
再打开一个cmd窗口,执行 ollama 客户端命令,如下所示:
1 | ## 从模型文件创建模型 |
离线部署
- 拷贝ollama-windows-amd64.zip到离线电脑
- 拷贝 Ollama 下载模型文件夹
- 设置环境变量 PATH 和 OLLAMA_MODELS
问题记录
内存访问违规问题
- 问题描述
运行如下命令时报错:
1 | ollama create |
原因分析
原因: NVIDIA 显卡驱动过旧:这是非常常见的原因。Ollama 的新版本(如 v0.30.11 及以上)通常需要 NVIDIA 驱动版本在 550.x 或更高。旧版驱动可能与新版的 CUDA 后端不兼容,从而引发内存错误。解决方案
直接去 NVIDIA 官网,下载并安装最新稳定版驱动。安装后重启电脑。
大语言模型没有在GPU上运行的问题
- 问题描述
ollama run qwen3.6:9b 时,大模型没有运行在GPU上,这一点可以通过执行 ollama ps 查看。
- 原因分析
没有安装最新的显卡驱动
- 解决方案
安装好最新的显卡驱动之后,将 ollama.exe 添加到使用显卡执行的列表中去。
参考链接
- 手把手教你离线安装Ollama,by 张云飞.
- Ollama GPU 加速配置:CUDA、ROCm 与 Metal 全平台实战指南,by easton.
- 当使用 ollama 本地部署 Error: could not connect to ollama app, is it running?,by 系着秋天的落叶.
- 一文读懂大模型推理中的HTTP协议,by 游凯超.
- OpenAI API 协议完全指南 - 大模型应用开发的通用标准,by 不想起名字1111111.
- OpenAI API格式详解-Chat Completions,by 啤酒泡泡.
- 工具调用:OpenAI 工具调用从一到多函数调用,by JPPeng.
- 大模型 LLM 缓存机制:从原理到工程实践,by guangzhengli.