【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。
-
单卡生产力不了,除非你只要96K上下文,单卡我最好的战绩就是35B A3B UNSLOTH的IQ4NL_XL 模型,用buun llama分支,可以跑150K上下文,勉强做做简单的开发,我有个帖子里面写过过程。 我目前是双卡,没有NVLINK, QWEN 3.8 27B勉强可跑150K左右上下文,速度会从初始的65t/s 掉到 100k时的30t/s左右,再往上就用不了了。 正在找别的方案。
跑27B的 尴尬在于,24G,差一点上32G,就能稳跑Q4-K-M。。
退到iq4 XS ,kld又冒头,长上下文显得没有用处。
iq4nl_xl这种量化格式似乎是它的甜点位,但是几乎没人给27B模型做这种量化。 可以尝试自己调用DEEPSEEK来制作这种量化格式试试。 这也是我在A3B上面试了几十个GGUF模型 得到的经验。 -
如题:3090单卡 32G ubuntu 华南金牌 硬件抄作业的。
目前干活都是deepseek 驱动hermes 。
部署过至少10个 llm ,论坛作业都抄了。
但是和deepseek完全无法比。根本无法像老特说的,可以替代。
现在qwen3.8也发布了。
希望论坛能人贴出自己的满意的启动参数。 -
先对齐一下预期:27B 本地模型和 DeepSeek V4(300B 级 MoE)比综合智力,任何参数都救不回来。老特说的"替代"是指特定场景——结构化工具调用、隐私数据、离线、窄任务——不是全面替代。3090 单卡的正确打开方式是"把几个窄任务跑到稳定够用",而不是"全面平替 API"。你 3 个月抄作业没成,大概率不是参数问题,是拿着 24G 卡的物理预算去跑 48G 卡的作业。
直接给一套能跑的(按 3090 标准 24G 给,你标的 32G 余量更大,参数直接套):
模型:Qwen3.8-27B Q4_K_M(约 16GB,选带 MTP head 的版本)。别用 FP8(28.5GB)——24G 上必 spill,速度直接掉到 20 以下。
llama-server 启动参数:
-ngl 99 --flash-attn --ctx-size 65536
-ctk q8_0 -ctv q4_1
--mtp <draft模型路径> --spec-draft-n-max 2
--host 127.0.0.1 --port 8080Hermes 侧(config.yaml):
context_length: 65536(64K 是 Hermes 的硬门槛,别小于这个)
temperature: 0.1-0.3
思考档位锁 low 或 medium(3.8 的 v22 模板 high 档会疯狂思考吞上下文,agent 场景锁低档)预期速度:3090 带宽 936GB/s,Q4_K_M 16GB 权重,上限约 55-58 t/s;短上下文实测 40-50,64K 上下文掉到 30 左右——这是物理,不是没调好。
抄作业失败的三个最常见原因:
- 量化选错:27B 的 FP8 是 28.5GB,24G 必 spill,换 Q4_K_M 约 16GB
- 上下文抄大:论坛一堆 128K/256K 的作业是 32G/48G 卡跑的;24G 卡 64K 就是甜点,128K+ 掉速加 OOM
- 思考模式没管:3.8 默认 thinking 吃速度吃上下文,关掉或锁 low/medium;另外 3.8 的工具调用有回归报告,如果 Hermes agent 干活不稳,换 3.6 27B Q4_K_M 更稳(论坛多个实测)
最后一句实话:本地 27B 的定位是隐私、离线、日常窄任务;复杂长链任务继续 DeepSeek API 反而省心。混合架构——本地跑常规、API 跑难题——才是 3090 单卡的"生产力"。
-
-
-
启动脚本【
REM 仅使用第一张 GPU (RTX 3090 Ti)
set CUDA_VISIBLE_DEVICES=0set SERVER_PATH=.\llama-server.exe
REM 设置模型路径:若提供了第一个参数则使用该参数,否则使用默认路径
if "%~1"=="" (
set MODEL_PATH=D:\MyModels\Qwen3.8-27B\Qwen3.8-27B-Q4_K_M.gguf
echo 未提供模型路径,使用默认路径: %MODEL_PATH%
) else (
set MODEL_PATH=%~1
echo 使用指定的模型路径: %MODEL_PATH%
)"%SERVER_PATH%" ^
-m "%MODEL_PATH%" ^
--host 0.0.0.0 ^
--port 3527 ^
--reasoning off ^
--n-gpu-layers -1 ^
--ctx-size 131072 ^
--batch-size 4096^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--spec-type draft-mtp ^
--spec-draft-n-max 5 ^
--spec-draft-n-min 1 ^
--temp 0.7 ^
--parallel 1 ^
--kv-unified ^
--mlock ^
--jinja ^
--threads 16 ^
--threads-batch 16 ^
--no-warmuppause
】

-
其实我也不懂何谓生产力。。。。只不过最近忙碌外面的生意,偶尔再电脑做一些东西,比如这个minimax director cut

然而我的生产力是外面的生意来补助我的玩耍。。。
