下手了 RTX Pro 4500 稳定与行了两周
-
这玩意挺有趣的,是自己可以搭建一个AI算力供应接口对吧,值得有闲置算力的人尝试,其实弄个二维码,写个简单验证程序,小额度是可以玩玩的

-
有开源的 api 方案。直接去 GitHub 下载就行。
-
@Xiaote 叫你爹出来看看我这还有没有优化空间
-
@Marco-ZHANG 我对Pro 4500的算力不是很了解,按理说,你的数字不算低,但是肯定不亮眼,你开MTP的情况下才50t/s,我觉得是不是稍微低了点,还能和xtx一个水平吗?xtx过往的帖子似乎在60t/s左右。
Prefill的话,肯定xtx有优势了,因为带宽的问题,xtx是960g/s。
这问题你不该问我,是我要白嫖你的测试数据做视频。@Marco-ZHANG 我对Pro 4500的算力不是很了解,按理说,你的数字不算低,但是肯定不亮眼,你开MTP的情况下才50t/s,我觉得是不是稍微低了点,还能和xtx一个水平吗?xtx过往的帖子似乎在60t/s左右。
Prefill的话,肯定xtx有优势了,因为带宽的问题,xtx是960g/s。
这问题你不该问我,是我要白嫖你的测试数据做视频。感谢Up主解答,看来还有优化空间。
-
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
您的帖子我看了一下,感觉像看天书,请教一下如果我用NVFP4的模型在这块卡上还速度还能再快些吗?
-
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
您的帖子我看了一下,感觉像看天书,请教一下如果我用NVFP4的模型在这块卡上还速度还能再快些吗?
-
速度會更快, 代價就是模型在呼叫工具 (Hermes, OpenCode, Cline)會更容易有問題
Autoround, AWQ是單純針對精度作優化, 表現持平, 速度就沒有NVFP4快
用NVFP4模型就需要避開激活 (Activation) 層都被壓成NVFP4的模型, 尤其是linear_attn層
我目前也是用PrismaSCOUT配合OpenCode日常使用
@566656661 那有多少TOK/s呢?
-
@566656661 那有多少TOK/s呢?
-
可以參考一下我發過的帖子
都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)
这问题你不该问我,是我要白嫖你的测试数据做视频。
有什麼需要我在空閒的時候再試試看嘛?
不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等
-
@566656661 感谢指点,我换上了你说的NVFP4,最高能跑到70多tok/s了,还有个问题,这种模型有没有免审察的推荐。
-
@566656661 感谢指点,我换上了你说的NVFP4,最高能跑到70多tok/s了,还有个问题,这种模型有没有免审察的推荐。
-
Qwen3.6-27B-PrismaQuant-Heretic-5.25bit-vllm
這個模型比PrismaSCOUT還要多2GB權重, 變相Pro 4500就需要把上下文降低到130K ~ 150K左右, 降低太多對我編程來說不利所以我也沒用
日常使用估計問題不大
你也可以自己找找看AutoRound或者AWQ的免审察模型, 不過就沒有NVFP4加速了
@566656661 谢谢
-
,系统 取消固定了此主题