加3080 20G 还是 7900XTX 24G?
-
我的是双3080 20G pcie4.0 8+8,说说感受给你参考:
1、这套跑llama.cpp\vllm\sglang目前都没问题,4bit量化,单并发推理50+t/s,加MTP,80t/s左右,prefill在1200上下。
2、用Qwen-image\minMax H3 生图和生视频都可以,分开用,跑两个comfyUI工作流进程,有效率。
说说缺点,prefill慢,散热需要到位。
没用过7900XTX,不好评论。
如果后面升级,我应该会考虑双4080 32G或4090 48G,提升才大。@neo 双卡用的多大的电源 30系的功耗也高吧
-
@neo 双卡用的多大的电源 30系的功耗也高吧
-
我的是双3080 20G pcie4.0 8+8,说说感受给你参考:
1、这套跑llama.cpp\vllm\sglang目前都没问题,4bit量化,单并发推理50+t/s,加MTP,80t/s左右,prefill在1200上下。
2、用Qwen-image\minMax H3 生图和生视频都可以,分开用,跑两个comfyUI工作流进程,有效率。
说说缺点,prefill慢,散热需要到位。
没用过7900XTX,不好评论。
如果后面升级,我应该会考虑双4080 32G或4090 48G,提升才大。@neo 给这哥们补充下,7900xtx用llamacpp跑的话q4量化,加mtp,初速是60tps。载入我没关注,上下文超过32k情况下,开始降速,也就是占用显存超过24g了,速度会到45左右,如果上下文超过64k,那么速度会降到30tps左右,如果是开128上下文的话,经过两轮压缩,qwen3.8的占用显存kv池会吧我剩下50多g内存全部吃完然后内存爆炸
然后关于minmah3的话实际测试下载512521图片40秒左右生成,视频的话也是512512是1秒1分钟16帧数,我不知道为啥生视频居然还更快
优缺点呢主要是看显存,7900xtx的带宽是960g,如果模型不超过显存24g的话那速度非常快
如果是部署ornith1.5-35b-a3b的话 128k上下文,初始速度95tps。64k上下文情况下会降速到80tps。上下文到130k的时候会降速到65~70tps附近
以上数据均用dsh实际场景测试出来,做一个网页ai新闻的收集,最后是qwen3.8完成了,ornith失败了 -
我测试过 7900xtx限制功耗 275W 和不限制303W 在输出速度上差别非常小,所以最近天热我都限制275W使用。
@坤坤 调整一下参数, 我昨天用ud-Q5_K_M 扫描修改一个c++库的潜在bug,并让它写了单元测试, 上下文 140k, 速度和效果都可以。 时长是因为DSH maxTokens 设置和后端不一致导致 中间很多次思考输出中断,修改一致就顺滑了。

-
@坤坤 帮 exllm 补个数字账:140K 不掉速是可能的,关键看 KV 是否还在显存里。
7900XTX 24G:27B 权重 Q4/Q5 约 15~16G,剩 8~9G 给 KV。q8_0 KV 每 token 约 37KB(27B 系),140K 约 5.2GB,塞得进显存,所以不掉速成立。你 128K 掉到 30tps,多半是权重用了更胖的量化,KV 溢出到内存,走内存带宽(~50GB/s)就掉到 30 这个量级——这是"溢出惩罚曲线",不是模型本身慢。
结论:想保住 140K 不掉速,权重量化压到 Q4_K_M/Q5_K_M + KV 用 q8_0,别开太胖的量化;或者开 llama.cpp 的 --cache-ram 让 KV 分层放置,溢出部分走内存但 prefill 仍走显存。