RTX3080 20g,qwen3.6 27B 60-40T/S 本地爽玩配置
-
记录一下自己RTX3080 20g的一些配置
WIN11安装:
git clone https://github.com/ggerganov/llama.cpp
cmake -B build -D GGML_CUDA=ON -D CMAKE_CUDA_ARCHITECTURES=86 -D LLAMA_BUILD_SERVER=ON -D LLAMA_BUILD_ALL_EXAMPLES=OFF -D LLAMA_BUILD_TESTS=OFF -D LLAMA_BUILD_EXAMPLES=OFF
cmake --build build --config Release --parallel 2启用集成显卡很有帮助,可以设置168960KV
初始60+T/S PREFILL1200 T/S,HERMES设置95%上下文才开始压缩,到压缩上下文之前还能有35T/S,PREFILL400T/S
实际工作体验中,实际上KV量化使用Q80和Q40精度损失几乎不可感知,所以就锁定Q40了
MTP命中基本都可以保持在0.85以上,偶尔会有一两次0.5左右的,实际收益非常高
本地爽玩大模型了.\hermeswork\llama.cpp\build\bin\Release\llama-server.exe -m D:\hermeswork\models\Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preserved.i1-IQ4_XS.gguf ` -c 168960 ` -ngl 99 ` -t 24 ` -tb 24 ` -b 2048 ` -ub 256 ` -np 1 ` --temp 0.15 ` --top-p 0.9 ` --top-k 40 ` --min-p 0.05 ` --presence-penalty 1.0 ` --repeat-penalty 1.05 ` --flash-attn on ` -ctk q4_0 ` -ctv q4_0 ` --reasoning off ` --kv-offload ` --spec-type draft-mtp ` --spec-draft-n-max 2 ` --checkpoint-every-n-tokens 16384 ` --ctx-checkpoints 64 ` --cache-reuse 4096 ` --no-context-shift ` --cache-ram 24576 ` --host 0.0.0.0 ` --port 11434 ` --mmap ` --mlock `删除了35B的配置,因为35B只有在很短的任务才能运行,任务一长就乱跑或者死循环,虽然飞快,但是感觉用不上
真是一张神卡啊
-
T terry 于 将此主题固定
-
vosrock 速度不错!3080 20G 跑 Qwen3.6 27B 能到 45-50 T/s 说明 llama.cpp 配置挺到位的。
关于 Hermes 联网搜索的问题,Windows 直接装 Hermes(非 WSL2)确实需要注意网络配置:
- 联网搜索依赖浏览器工具(browser_use 或 playwright),Windows 下需要确保安装了 playwright 的浏览器驱动:
playwright install chromium - 检查 Hermes 的配置文件里
enable_web_search是否设为 true - 如果用的是本地 Qwen 模型,确认 Hermes 的 model provider 配置正确指向了你的本地端点
你可以在 Hermes 终端里跑一下
hermes doctor看看网络组件的状态。如果 playwright 报错的话,试试重新装一下浏览器驱动。另外 35B 多模态能跑到 110 T/s 很猛,这个速度跑 Hermes 完全够用了。
- 联网搜索依赖浏览器工具(browser_use 或 playwright),Windows 下需要确保安装了 playwright 的浏览器驱动:
-
vosrock 速度不错!3080 20G 跑 Qwen3.6 27B 能到 45-50 T/s 说明 llama.cpp 配置挺到位的。
关于 Hermes 联网搜索的问题,Windows 直接装 Hermes(非 WSL2)确实需要注意网络配置:
- 联网搜索依赖浏览器工具(browser_use 或 playwright),Windows 下需要确保安装了 playwright 的浏览器驱动:
playwright install chromium - 检查 Hermes 的配置文件里
enable_web_search是否设为 true - 如果用的是本地 Qwen 模型,确认 Hermes 的 model provider 配置正确指向了你的本地端点
你可以在 Hermes 终端里跑一下
hermes doctor看看网络组件的状态。如果 playwright 报错的话,试试重新装一下浏览器驱动。另外 35B 多模态能跑到 110 T/s 很猛,这个速度跑 Hermes 完全够用了。
- 联网搜索依赖浏览器工具(browser_use 或 playwright),Windows 下需要确保安装了 playwright 的浏览器驱动:
-
测试一下prefill , MTP 开启还有多少上下文?
这卡估计要等到trubo quant 和MTP 同时能开并且 不影响prefill 的情况才算是神卡。现在太尴尬, 只能用pi 写写代码。



主要是这张,上下文多次尝试,别让专用显存炸了,我这里测试就是128000不掉速,别真输入128K,不然速度一下就掉到18T/S