最近想离线部署一套AI编程工具,以提高生产力。首先研究离线部署LLM的方法,再研究离线部署AI Agent的方法。
Ollama 离线安装
目前LLM主流部署框架与工具主要有:Ollama、llama.cpp、vLLM、LM Studio、Xinference、Hugging Face Transformers。综合考虑,先从最简单的开始,离线部署Ollama。
根据机器的CPU指令集,从github官网下载 Ollama的安装包,这里选择绿色版的ollama-windows-amd64.zip。
安装过程
解压ollama-windows-amd64.zip到安装目录,并将 ollama 的安装目录添加到系统环境变量 PATH 中。
配置过程
- 修改 Ollama 下载模型保存位置
新建环境变量 OLLAMA_MODELS ,设置其值为 Ollama 下载模型保存位置。
启动过程
打开 cmd 窗口,启动 ollama 服务器实例,如下所示:
1 | ## 启动Ollama服务 |
再打开一个cmd窗口,执行 ollama 客户端命令,如下所示:
1 | ## 从模型文件创建模型 |
离线部署
- 拷贝ollama-windows-amd64.zip到离线电脑
- 拷贝 Ollama 下载模型文件夹
- 设置环境变量 PATH 和 OLLAMA_MODELS
问题记录
内存访问违规问题
- 问题描述
运行如下命令时报错:
1 | ollama create |
原因分析
原因: NVIDIA 显卡驱动过旧:这是非常常见的原因。Ollama 的新版本(如 v0.30.11 及以上)通常需要 NVIDIA 驱动版本在 550.x 或更高。旧版驱动可能与新版的 CUDA 后端不兼容,从而引发内存错误。解决方案
直接去 NVIDIA 官网,下载并安装最新稳定版驱动。安装后重启电脑。
参考链接
- 手把手教你离线安装Ollama,by 张云飞.
- Ollama GPU 加速配置:CUDA、ROCm 与 Metal 全平台实战指南,by easton.
- 当使用 ollama 本地部署 Error: could not connect to ollama app, is it running?,by 系着秋天的落叶.