开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent
-
抡锤的大家都不是小白 就不废话了


真机演示视频(实际速度)在:https://live.csdn.net/v/539144?spm=1001.2014.3001.5501
我自己的电脑配置:- RTX 4070 Laptop,8GB 显存
- Intel i7-14650HX
- 32GB 内存
- Windows 11
模型是 Qwen3.6-35B-A3B 的 Q4_K_M GGUF 版本,使用官方 llama.cpp CUDA 后端。
现在的版本就是完整 35B 模型直接工作。
-
短文本生成约 42.3 token/s
-
Thinking 模式约 42.1 token/s
我把运行需要的东西都装进包里了: -
llama.cpp b10355
-
CUDA 12.4 runtime
-
cuBLAS
-
GGML CPU/CUDA 后端
-
Microsoft VC++ 应用本地运行库
-
FFmpeg 和 FFprobe
-
完整模型与多模态 projector
-
本地对话 UI
目标电脑不需要再安装 Python、Node.js、CUDA Toolkit、Visual Studio 或 VC++ Redistributable。
只需要 Windows 10/11、兼容的 NVIDIA 驱动、8GB 级显存和 32GB 内存。
安装过程就是:
- 使用密码
123解压安装包。 - 双击
INSTALL_QWEN35B.bat。 - 等待模型校验和加载。
- 浏览器自动打开后输入密码
123。
桌面会自动生成启动、停止和打开对话的快捷方式
UI 可以直接添加:- 图片
- 视频
- 文本文件
我实际测试了发票 OCR、图表读取、一般图片问答和视频画面识别。
例如图表测试能够正确返回
BETA, 7,视频测试能够识别出画面中的验证码8642。视频处理使用包内 FFmpeg,不需要用户另外配置。当前 projector 不支持音频。PDF 和 Office 二进制文件也没有在浏览器端强行乱解析,建议转换成文本或页面图片后再上传。
Thinking 可以开,也可以关
UI 可以选择:
- 自动
- 8K
- 16K
- 32K
- 64K
- 128K
默认建议使用“自动”。短对话不会每次都背着 128K 历史跑,随着会话增长再逐步扩大预算。
可以直接接自己的本地 Agent
服务提供 OpenAI 兼容接口:
Base URL: http://127.0.0.1:8090/v1 API key: 123 Model: qwen35b-local百度网盘:
https://pan.baidu.com/s/1ff1XmuJTeb_TZa2Q9vVEfw?pwd=auj7
提取码:auj7
完整安装包解压密码:123
UI 登录密码/API Key:123
安装包约 21.82 GiB,请确认磁盘空间,并务必完整解压后再运行安装程序。
-
上点图。兄弟。界面截图就行
-
上点图。兄弟。界面截图就行
@williamlouis 必须落实
-
@stxpnet 例如图表测试能够正确返回
BETA, 7,视频测试能够识别出画面中的验证码8642你说的实际问题还想问啥 我自己跑下给你结果就行 不麻烦
上下文方面
| 实际提示长度 | 验证位置 | 结果 | 预填充速度 |
| 32,748 token | 50% | 通过 | 356.1 token/s |
| 65,544 token | 8%、91% | 通过 | 350.1 token/s |
| 119,998 token | 4%、50%、96% | 通过 | 346.2 token/s |
速度反正能用 不吹玄学:120K 提示在测试机上预填充约 346.6 秒。128K 是需要的时候真能用,但是长上下文肯定没有那么流畅。不过咱们自己用不需要那么长吧,我自己上下文都是通过agent挂rag或者路由知识网解决。 -
,J johnnybegood 引用了 此主题