下手了 RTX Pro 4500 稳定与行了两周
-
不错。总额度这个6毛7分2 是谁的?
-
@Marco ZHANG RTX Pro 4500 (AD103/GB203) 跑 Qwen3.6-27B AWQ 在 vLLM 下 50 t/s 是符合预期的,甚至偏上游水平。具体分析:
-
带宽利用率:RTX Pro 4500 的显存带宽约 576 GB/s,Qwen3.6-27B AWQ (4bit) 显存占用约 15-16GB。50 t/s 的 prefill+decode 混合吞吐大约占理论带宽的 50-60%,对 vLLM 单卡来说是不错的水平。
-
对比基准:4070 Ti Super(类似核心)在同类模型下通常 35-45 t/s。Pro 4500 能到 50+ 说明 vLLM 的 AWQ kernel 在这代核心上调度比较好。
-
优化空间(小,因为已经接近天花板):
- 如果追求更低首 token 延迟,可尝试 --block-size=16(默认32),首 token 能再降 10-15%
- 如果追求峰值吞吐,试一下 --num-scheduler-steps=8(默认1),连续请求场景能提升 5-10%
- --enable-chunked-prefill=false(如果当前开启了)可以减少显存碎片
- MTP=2 已经是最佳设定了,不用再调
-
对比 llama.cpp:同样模型在 llama.cpp -b 4096 -ub 4096 下大概 40-55 t/s,差距不大。vLLM 的多batch优势在独占推理(单用户)时并不明显。
卡是好卡,稳定两周说明散热和供电都没问题。
@Xiaote 叫你爹出来看看我这还有没有优化空间
-
-
@Marco ZHANG 优化空间我在上面已经列了,核心的几个参数:
- --block-size=16(降首token延迟)
- --num-scheduler-steps=8(提连续请求吞吐)
- --enable-chunked-prefill=false(减显存碎片)
这三个调完基本就到单卡天花板了。RTX Pro 4500 的瓶颈在显存带宽(576 GB/s),不是核心算力,所以模型不变的前提下提不了太多。
你如果方便跑个 benchmark 贴一下 prefill 延迟和 decode 速度,我可以帮你看看是不是哪项参数还有漏。另外如果你用这卡跑 ComfyUI + video 类工作流,也可以另外讨论优化方案——那种场景的瓶颈分布和 LLM 推理不一样。
-
@Xiaote 叫你爹出来看看我这还有没有优化空间
-
,
T terry 固定了此主题
-
这玩意挺有趣的,是自己可以搭建一个AI算力供应接口对吧,值得有闲置算力的人尝试,其实弄个二维码,写个简单验证程序,小额度是可以玩玩的

-
有开源的 api 方案。直接去 GitHub 下载就行。
-
@Xiaote 叫你爹出来看看我这还有没有优化空间
-
@Marco-ZHANG 我对Pro 4500的算力不是很了解,按理说,你的数字不算低,但是肯定不亮眼,你开MTP的情况下才50t/s,我觉得是不是稍微低了点,还能和xtx一个水平吗?xtx过往的帖子似乎在60t/s左右。
Prefill的话,肯定xtx有优势了,因为带宽的问题,xtx是960g/s。
这问题你不该问我,是我要白嫖你的测试数据做视频。@Marco-ZHANG 我对Pro 4500的算力不是很了解,按理说,你的数字不算低,但是肯定不亮眼,你开MTP的情况下才50t/s,我觉得是不是稍微低了点,还能和xtx一个水平吗?xtx过往的帖子似乎在60t/s左右。
Prefill的话,肯定xtx有优势了,因为带宽的问题,xtx是960g/s。
这问题你不该问我,是我要白嫖你的测试数据做视频。感谢Up主解答,看来还有优化空间。
-
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
您的帖子我看了一下,感觉像看天书,请教一下如果我用NVFP4的模型在这块卡上还速度还能再快些吗?
-
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
您的帖子我看了一下,感觉像看天书,请教一下如果我用NVFP4的模型在这块卡上还速度还能再快些吗?
-
速度會更快, 代價就是模型在呼叫工具 (Hermes, OpenCode, Cline)會更容易有問題
Autoround, AWQ是單純針對精度作優化, 表現持平, 速度就沒有NVFP4快
用NVFP4模型就需要避開激活 (Activation) 層都被壓成NVFP4的模型, 尤其是linear_attn層
我目前也是用PrismaSCOUT配合OpenCode日常使用
@566656661 那有多少TOK/s呢?
-
@566656661 那有多少TOK/s呢?
-
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
-
@566656661 感谢指点,我换上了你说的NVFP4,最高能跑到70多tok/s了,还有个问题,这种模型有没有免审察的推荐。
-
@566656661 感谢指点,我换上了你说的NVFP4,最高能跑到70多tok/s了,还有个问题,这种模型有没有免审察的推荐。
-
Qwen3.6-27B-PrismaQuant-Heretic-5.25bit-vllm
這個模型比PrismaSCOUT還要多2GB權重, 變相Pro 4500就需要把上下文降低到130K ~ 150K左右, 降低太多對我編程來說不利所以我也沒用
日常使用估計問題不大
你也可以自己找找看AutoRound或者AWQ的免审察模型, 不過就沒有NVFP4加速了
@566656661 谢谢
-
,系统 取消固定了此主题