(内含一键安装包)Qwen3.6 35B 用 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent
先说结论:
短文本生成约 42.3 token/s Thinking 模式约 42.1 token/s
对一台 8GB 显存、32GB 内存的笔记本来说,这个结果我认为已经相当能打。
我自己的电脑配置:
RTX 4070 Laptop,8GB 显存
Intel i7-14650HX
32GB 内存
Windows 11
模型是 Qwen3.6-35B-A3B 的 Q4_K_M GGUF 版本,使用官方 llama.cpp CUDA 后端。
现在的版本就是完整 35B 模型直接工作。
一键安装,环境依赖全带
本地大模型最劝退人的往往不是模型,而是环境。
CUDA 版本不对、Python 包互相打架、编译器缺失、FFmpeg 找不到、启动参数抄错一个字符……半天就没了。
我把运行需要的东西都装进包里了:
llama.cpp b10355
CUDA 12.4 runtime
cuBLAS
GGML CPU/CUDA 后端
Microsoft VC++ 应用本地运行库
FFmpeg 和 FFprobe
完整模型与多模态 projector
本地对话 UI
目标电脑不需要再安装 Python、Node.js、CUDA Toolkit、Visual Studio 或 VC++ Redistributable。
只需要 Windows 10/11、兼容的 NVIDIA 驱动、8GB 级显存和 32GB 内存。
安装过程就是:
使用密码 123 解压安装包。
双击 INSTALL_QWEN35B.bat。
等待模型校验和加载。
浏览器自动打开后输入密码 123。
桌面会自动生成启动、停止和打开对话的快捷方式
UI 可以直接添加:
图片
视频
文本文件
我实际测试了发票 OCR、图表读取、一般图片问答和视频画面识别。
例如图表测试能够正确返回 BETA, 7,视频测试能够识别出画面中的验证码 8642。视频处理使用包内 FFmpeg,不需要用户另外配置。
当前 projector 不支持音频。PDF 和 Office 二进制文件也没有在浏览器端强行乱解析,建议转换成文本或页面图片后再上传。
Thinking 可以开,也可以关
UI 可以选择:
自动
8K
16K
32K
64K
128K
默认建议使用“自动”。短对话不会每次都背着 128K 历史跑,随着会话增长再逐步扩大预算。
可以直接接自己的本地 Agent
服务提供 OpenAI 兼容接口:
Base URL: http://127.0.0.1:8090/v1 API key: 123 Model: qwen35b-local
百度网盘:
https://pan.baidu.com/s/1ff1XmuJTeb_TZa2Q9vVEfw?pwd=auj7
提取码:auj7
完整安装包解压密码:123
UI 登录密码/API Key:123
安装包约 21.82 GiB,请确认磁盘空间,并务必完整解压后再运行安装程序。
这套东西的目标不是创造一个新的模型架构,也不是证明 8GB 显卡从此等于 24GB 显卡。
它解决的是更具体的问题:
让一台普通的 8GB 显存、32GB 内存 Windows 电脑,可以比较省心地跑起完整 35B、多模态、Thinking、128K 上下文,并能直接接本地 Agent。
模型、运行时和第三方组件遵循各自许可证。部署脚本和 UI 文件都在包内,可以查看和修改。
欢迎大家反馈不同显卡、CPU 和内存配置下的速度。尤其欢迎拿真实长文档、多模态任务和 Agent 工作流来测。
更多推荐


所有评论(0)