GPU显存状态(4060Ti 16G是本地部署模型的高性价比选择)

安装Ollama(提供本地大模型服务)

下载地址

Download Ollama on Windows

官方下载地址是github提供的下载服务,务必保持网络与github的连通性。

国内加速地址

https://cnb.cool/hex/ollama/-/releases/latest/download/OllamaSetup.exe

原地起飞

安装

安装完成,自动弹出窗口

可以看到,ollama支持自动配置claude code等多种智能体程序,非常方面

安装模型到本地

切换到New Chat,输入qwen3.5:9b,等待出现选项,点击下载按钮

注意:需要发一条消息,才会出发真正的下载模型

输入消息:hi,发送,会切换到下载状态。

或者打开cmd、powershell,输入指令(传统方式,类似docker pull)

ollama pull qwen3.5:9b

下载速度可以

不持久,推荐命令行下载,可以中断重试

直接关闭窗口,打开cmd,指令下载(支持断点续传)

ollama pull qwen3.5:9b

完成

注意(尤其重启后)

由于默认没有做服务,每次使用后端模型,需要启动ollama

安装AnythingLLM

下载地址

AnythingLLM | The all-in-one AI application for everyone

如同报警,保留这个文件

开始安装,选择运行

执行安装

Metting Assitant model下载比较慢(可以考虑跳过)

如果中途报错,考虑切换到电信5G热点,核心是保持github的连通性,通常电信宽带,夜间比较稳定。

或者采用其他加速工具

故障表现如下:

完成安装

配置AnythingLLM

启动,允许防火墙

配置大语言模型

进入配置界面

导航到人工智能提供商->大语言模型(LLM)

如果找不到,鼠标滚轮向上翻

选择Ollama,模型选择刚才下载的qwen3.5:9b, 点击Save changes。

配置向量数据库

默认即可

配置嵌入器

默认即可

点击返回按钮

基础功能验证

此时后端ollama模型的GPU显存占用状态

上传文档到知识库(RAG)

点击默认工作区的上传按钮

拖拽文档,上传

等待完成文档分析,此时CPU消耗高

GPU没有负载

说明是在CPU上执行的分析,向量化。应该可以配置到GPU(后续再优化,使用ollama的嵌入模型)

消耗了约5分钟

分析完成后,移动到工作区

滚动鼠标,移动到下方,可以看到my工作区出现上传的文档,点击保存并嵌入

继续等待

此时依靠的是GPU,速度比较快。

滚动鼠标,回到上层,关闭窗口即可。

检索知识库

回到工作区my

提问,可以看到,显示了信息来源

展开思考过程,可以看到上传的文档。

响应速度不理想,4060Ti不给力。

思考了1m16s后,等待了几分钟还没有输出正式响应。

会话上下文上限设置

经过测试,推测是后端模型思考的内容已经达到会话的上下文内容长度上限,打开ollama,设置content length

然后调整AnythingLLM的长度限制

重试,CPU使用率满载,GPU显存满载

成功的测试

完成模型上下文长度调整后,顺利输出内容。但是qwen3.5:9b太弱了。输出质量太差。如果GPU显存足够,应当选择参数量更大的模型

模型大小参考如下:

如果是首次安装,弹出引导菜单,参考前面的配置进行

注意:点击→箭头,才是下一步。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐