【AI】Windows平台Nvidia GPU环境简版单机知识库搭建方案
GPU显存状态(4060Ti 16G是本地部署模型的高性价比选择)

安装Ollama(提供本地大模型服务)
下载地址
官方下载地址是github提供的下载服务,务必保持网络与github的连通性。
国内加速地址
https://cnb.cool/hex/ollama/-/releases/latest/download/OllamaSetup.exe
原地起飞

安装

安装完成,自动弹出窗口
可以看到,ollama支持自动配置claude code等多种智能体程序,非常方面

安装模型到本地
切换到New Chat,输入qwen3.5:9b,等待出现选项,点击下载按钮

注意:需要发一条消息,才会出发真正的下载模型
输入消息:hi,发送,会切换到下载状态。

或者打开cmd、powershell,输入指令(传统方式,类似docker pull)
ollama pull qwen3.5:9b
下载速度可以

不持久,推荐命令行下载,可以中断重试
直接关闭窗口,打开cmd,指令下载(支持断点续传)
ollama pull qwen3.5:9b

完成

注意(尤其重启后)
由于默认没有做服务,每次使用后端模型,需要启动ollama

安装AnythingLLM
下载地址
AnythingLLM | The all-in-one AI application for everyone


如同报警,保留这个文件

开始安装,选择运行

执行安装

Metting Assitant model下载比较慢(可以考虑跳过)


如果中途报错,考虑切换到电信5G热点,核心是保持github的连通性,通常电信宽带,夜间比较稳定。
或者采用其他加速工具
故障表现如下:

完成安装

配置AnythingLLM
启动,允许防火墙


配置大语言模型
进入配置界面

导航到人工智能提供商->大语言模型(LLM)
如果找不到,鼠标滚轮向上翻
选择Ollama,模型选择刚才下载的qwen3.5:9b, 点击Save changes。

配置向量数据库
默认即可

配置嵌入器
默认即可

点击返回按钮

基础功能验证

此时后端ollama模型的GPU显存占用状态
上传文档到知识库(RAG)
点击默认工作区的上传按钮

拖拽文档,上传


等待完成文档分析,此时CPU消耗高

GPU没有负载

说明是在CPU上执行的分析,向量化。应该可以配置到GPU(后续再优化,使用ollama的嵌入模型)

消耗了约5分钟

分析完成后,移动到工作区

滚动鼠标,移动到下方,可以看到my工作区出现上传的文档,点击保存并嵌入

继续等待

此时依靠的是GPU,速度比较快。


滚动鼠标,回到上层,关闭窗口即可。

检索知识库
回到工作区my
提问,可以看到,显示了信息来源

展开思考过程,可以看到上传的文档。

响应速度不理想,4060Ti不给力。

思考了1m16s后,等待了几分钟还没有输出正式响应。

会话上下文上限设置
经过测试,推测是后端模型思考的内容已经达到会话的上下文内容长度上限,打开ollama,设置content length


然后调整AnythingLLM的长度限制


重试,CPU使用率满载,GPU显存满载

成功的测试
完成模型上下文长度调整后,顺利输出内容。但是qwen3.5:9b太弱了。输出质量太差。如果GPU显存足够,应当选择参数量更大的模型

模型大小参考如下:

如果是首次安装,弹出引导菜单,参考前面的配置进行
注意:点击→箭头,才是下一步。
更多推荐



所有评论(0)