测试了两天,发现RTX PRO 4500 Blackwell 32GB这张卡真有点坑啊!有没有哪位大神在这张显卡上能稳定高速的27B-llama方案啊?
-
同样131K上下文, 35B A3B是40层,并且激活3B,它的K V CACHE比64-65层的 27B少了很多。 你这卡,我感觉,只能跑131-168K上下文? 我也觉得NVFP4+DSPARK可以起飞啊,毕竟你是SM120啊。 如果DDR5内存上128G的话,跑122B A10B感觉都可以哦。 不过这QWEN 3.5有点过时了。

35B A3B不太适合写程序,但是做调研写文章啥的爽得一P
一定要上27B的话, 再等几天dflash2应该成熟了。 如果真的是2X-3X速度,可以起飞
-
同样131K上下文, 35B A3B是40层,并且激活3B,它的K V CACHE比64-65层的 27B少了很多。 你这卡,我感觉,只能跑131-168K上下文? 我也觉得NVFP4+DSPARK可以起飞啊,毕竟你是SM120啊。 如果DDR5内存上128G的话,跑122B A10B感觉都可以哦。 不过这QWEN 3.5有点过时了。

35B A3B不太适合写程序,但是做调研写文章啥的爽得一P
一定要上27B的话, 再等几天dflash2应该成熟了。 如果真的是2X-3X速度,可以起飞
-
补充一个 A3B 的通用配置(stxpnet 本人在 TID:1199 提过:UNSLOTH 的 IQ4NL_XL + buun llama 分支,单卡能跑 150K 上下文):
Qwen3.6-35B-A3B 走 unsloth 的 IQ4NL_XL GGUF(约 19-20GB),llama.cpp 直接拉,--ctx-size 按需设 131072 或 150K;KV 建议 --cache-type-k q8_0 --cache-type-v q4_1(K 金贵 V 稀释,论坛共识)。跑满 150K 记得 KV 量化,否则 32G 必 spill。
A3B 激活参数只有 3B,解码是带宽瓶颈,速度比 27B 稠密快一大截;代价正如你说的智商差了点——干杂活(分类/抽取/改写/摘要)正合适,长链思考还是留给 27B 或 API。
-
补一个现在的测试结果,现在我已经很满意了!
测完了,真实数据(本机 127.0.0.1:8000,llama-server,Q4_K_M + MTP n-max 2 + FA + KV q4_0 + 256K ctx):
解码(decode)- 1024 token 长输出,三次复测:54.5 / 55.3 / 51.9 tok/s —— 稳定在 52-55,和 08-19 定案的 57-60 同一水平(略低 3-5%,属正常波动)
- 短输出(思考+回答 ~100 token):70 tok/s
预填充(prefill) - 2K prompt:1391 tok/s
- 8K:1724 tok/s
- 16K:2488 tok/s
- 32K:2304 tok/s —— 16K 后进入 plateau,~2.3-2.5K tok/s
TTFT - 冷启动首 token 1.4s,热 0.33-0.38s
- 32K 上下文 TTFT 6.5s,64K 约 14s(可接受,不算卡)
显存:25.3/32.6 GB,256K ctx 下留 ~7GB 余量,健康。
结论:修复后状态良好,解码 ~55 tok/s 达标(MTP 收益在),预填 16K+ 稳定 2.3-2.5K tok/s。日常 agent 场景(长 context + 中短输出)体感很顺。
-
给一个我的经验,就算用 rtxpro 4500 32gb, 不代表不会OOM
本身用着64gb, 后来面对oom 就升级去96gb,最近我都在处理视频,之前用着5060ti 16gb , 什么省vram的参数都用上了,生产了400个视频都不卡,也不曾oom
最大消化16b vram, 50gb dram后来换rtxpro 4500, 放开所有省vram参数, 消耗来到 32gb vram, 70gb dram, 后来放开dynamix vram 参数,让软件自己调节,起初消耗85gb dram, 后来瞬间冲破96gb dram oom..
后来在流程开始和结尾加入 ram cleanup 就至今稳定出视频整百个都不会oom
为什么我会岔开话题讲这个,因为我还没下载qwen3.8, 唯有说一说(32GB这张卡真有点坑啊) 这个话题,
还有我只是分享我现在已经解决的问题。。
如果我不去解决这个问题,就算我使用96gb vram 也会面对oom 的。。。
现在我很努力在下载qwen3.8, 奈何还是等着llmfan46 未发布的心情再来看看


-
给一个我的经验,就算用 rtxpro 4500 32gb, 不代表不会OOM
本身用着64gb, 后来面对oom 就升级去96gb,最近我都在处理视频,之前用着5060ti 16gb , 什么省vram的参数都用上了,生产了400个视频都不卡,也不曾oom
最大消化16b vram, 50gb dram后来换rtxpro 4500, 放开所有省vram参数, 消耗来到 32gb vram, 70gb dram, 后来放开dynamix vram 参数,让软件自己调节,起初消耗85gb dram, 后来瞬间冲破96gb dram oom..
后来在流程开始和结尾加入 ram cleanup 就至今稳定出视频整百个都不会oom
为什么我会岔开话题讲这个,因为我还没下载qwen3.8, 唯有说一说(32GB这张卡真有点坑啊) 这个话题,
还有我只是分享我现在已经解决的问题。。
如果我不去解决这个问题,就算我使用96gb vram 也会面对oom 的。。。
现在我很努力在下载qwen3.8, 奈何还是等着llmfan46 未发布的心情再来看看


@imbiplaza-ASUS 是的,之前还是32GB内存呢,后来忍痛才凑了64GB,看了下128GB内存的价,我忍了!
-
Sglang?
但是 这张卡就是高级版的5080@applejuice 4080S这个档次。pro 系列对标不了50系列,都是对标40系列