我刚刚把双卡7900xtx出了!白玩几个月还赚了。。。
-
魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec -
关于双AMD RX7900XTX的使用感受不错,多来点测试!主要看看prefill。其实现在发现双R9700 速度是双7900xtx的双倍了,而且还是fp8。。。虽然目前双7900xtx 速度也不错了
-
请教:AMD R9700 还是 Mac Studio?如果只上64G,还是双R9700
-
Asus Ascent GX10到货,双gb10的DSV4-Flash集群全程hermes远程部署我早就说过两台GB10 跑DS V4是目前最好的本地方案了。几乎本地95%的工作不要在线了。
-
AMD R 9700 32G到货了。一顿操作。整成无头算力卡了。经实测这卡更适合工作在X99主板。家用老机器升级慎重考虑。目前阶段双R9700跑大模型27b超过了4090 48G
-
SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B期望27b看到10-32-64-90-128K下的prefill速度和nomtp速度。这样才有参考意义!这个单卡prefill应该击败双r9700,现在双r9700 FP8 VLLM 10k-3000 90K-2000+的速度了,跑agent的subgent已经很有生产力了。
-
{求助帖} 我两张rx7900xtx,乌邦图系统部署安装vllm然后运行模型老是失败https://github.com/JartX/vllm
肯定是构建Docker镜像跑啊,分支里面有Dockerfile.rocm_fa 这个交给ai,你只要把你怎么fq告诉ai,它会给你全部配置好的。这个要下载很多东西的哦。 -
双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)@gk20082000
我又来做好人了,这里有现成的作业不去抄?
https://hub.docker.com/r/capicua25x/vllm-rocm-rdna4 -
双7900xtx的主机方案?说实话,唯一一点你没考虑!就是放不放的两张卡进去?
-
7900XTX双卡跑VLLM跑 Qwen3.8 27b实录vllm(perf/rdna3_full_stack)+lmcache(dev最新版本) +dbirks/Qwen3.8-27B-W4A16-AutoRound 丝滑,几乎不用ai改代码,只有lmcache一点点。因为有缓存,所以并发需要prefill的上下文极度降低。omp agent体验丝滑。
-
7900XTX双卡跑VLLM跑 Qwen3.8 27b实录再弄一个lmcache,只要你大内存和大固态(我是128G内存+2T固态)。你会发现并发好爽! 这些都是我验证过的。
-
大型纪录片:Qwen 3.8 27B 优化思考-> 拯救工具调用 【欢迎指正】该jinja模板为默认中等思考等级是最佳配置
-
7900XTX双卡跑VLLM跑 Qwen3.8 27b实录https://github.com/sgl-project/sglang/issues/30599 这个我都跟踪好久了,不要去浪费时间,sglang没有大神用gfx1100
-
7900XTX双卡跑VLLM跑 Qwen3.8 27b实录双卡 3090 vs 双卡 7900 XTX Prefill 速度横向对比 (以 Qwen 27B W4A16 为准)
把两座仓库同一模型(Qwen 27B W4A16, TP=2)在相同硬件规格(2×24GB2×24GB)下的 Prefill 实测吞吐拉齐对比:
上下文深度 (Context) 双卡 RTX 3090 (TP=2) <br>(来自 club-3090)双卡 RX 7900 XTX (TP=2) <br>(来自 JartXvllm)对比分析 短/中等长度 ( 4K10K)1446∼2466 tok/s <br>(标准 INT4 ~1446,W4A8 达 2466) 1388∼1450 tok/s <br>(Triton 优化版) 基本打平。 <br>在标准 INT4 下两款双卡均落在 1400+ tok/s1400+ tok/s 水平。 长上下文 (32K~90K) 1118∼1742 tok/s <br>(标准 INT4 ~1118,W4A8 达 1742) 1240∼1732 tok/s <br>(自研 HIP 融合算子) 7900 XTX 表现亮眼。 <br>7900 XTX 凭借手写的原生 HIP WMMA Prefill 算子,在长上下文下甚至微超 3090 的标准 INT4 路径。 -
7900XTX双卡跑VLLM跑 Qwen3.8 27b实录看到终于有人用这个双卡7900xtx了,献上我用了一个多月的vllm吧,直接用这个https://github.com/JartX/vllm perf/rdna3_full_stack 分支的吧!
RDNA3W4A16LinearKernel 这个东西就是这位Jartx老哥提的pr,它还修复了好多7900xtx的kernel,它自己现在就是4卡7900xtx了。现在做的W4A16量化prefill和decode 速度都3090一样的速度了
现在还缺W4A8 W8A8 MXFP4等支持
下面贴一下这个分支的特性,做了很多针对gfx1100 推理关键kernel的修复1. 注意力(KV cache 量化)——优化最重、收益最大 ┌───────────────────┬───────────────────────────────────────────────────────────────────────────────────┬──────────────────────────────────────────────────────────────────────────────┬─────────────────────────────────────────────────┐ │ 优化 │ 内核 │ 门控条件 │ 收益(README 实测) │ ├───────────────────┼───────────────────────────────────────────────────────────────────────────────────┼──────────────────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────┤ │ INT8 prefill │ paged_prefill_attn_rdna3_v2_int8(HIP WMMA) │ --kv-cache-dtype int8_per_token_head + TRITON_ATTN + HS∈{64,128,256} + 纯 │ 3.03ms vs Triton 25ms(8.3×);整机 1209 vs 727 │ │ │ │ prefill continuation + 无 alibi/swa/sink/softcap │ tok/s(+66%),VRAM −50% │ ├───────────────────┼───────────────────────────────────────────────────────────────────────────────────┼──────────────────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────┤ │ INT8 decode │ pth_decode_int8_rdna3(HIP split-KV,1-wave) │ 同上 + HS==256 + max_query_len≤128 │ decode 主路径 │ ├───────────────────┼───────────────────────────────────────────────────────────────────────────────────┼──────────────────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────┤ │ INT4 │ paged_prefill_attn_rdna3_v2_int4 + pth_decode_int4_rdna3 + │ int4_per_token_head + HS∈{128,256} │ ~1150 tok/s(+58%),VRAM −75% │ │ prefill/decode │ rht_rotate_inplace_rdna3 + reshape_cache_int4_rdna3(融合 RHT) │ │ │ └───────────────────┴───────────────────────────────────────────────────────────────────────────────────┴──────────────────────────────────────────────────────────────────────────────┴─────────────────────────────────────────────────┘ 关键点:这个阶段与权重量化完全无关,只由 --kv-cache-dtype 决定。 2. W4A16 权重 GEMM(两套 HIP 内核,按对称性分叉) ┌────────────────────────────────────────────────────────────────┬─────────────────────────────────────────────────────────────────┬─────────────────────────────────────────────────────────────────────────────────────────────────────┐ │ 内核 │ 支持的量化 │ 路径 │ ├────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────────────────────────────────────────┤ │ gptq_gemm_rdna3 + gptq_gemm_rdna3_wmma(q_gemm_rdna3*.cu,fork │ 对称 int4 = uint4b8(GPTQv1 布局,ExLlama shuffle,存储 zp = │ RDNA3W4A16LinearKernel(优先级第一);bf16 M≥16 → WMMA(prefill 128×64 主核),M=1 → │ │ 自研) │ 实际 zp − 1) │ 标量快速路径(v_dot2,省 LDS) │ ├────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────────────────────────────────────────┤ │ wvSplitK_int4_g(skinny_gemms_int4.cu,移植上游 PR #40977) │ 非对称 int4 = uint4(存储 zp = 实际零点) │ RDNAHybridW4A16LinearKernel;仅 M≤5 且 K·M≤32768 │ ├────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────────────────────────────────────────┤ │ moe_gptq_gemm_rdna3(moe_q_gemm_rdna3.cu) │ 同 gptq 对称布局 │ MoE 专家 GEMM(KAT-Coder-V2.5 走的就是它) │ └────────────────────────────────────────────────────────────────┴─────────────────────────────────────────────────────────────────┴─────────────────────────────────────────────────────────────────────────────────────────────────────┘特别是它还修复了多卡通信RCCL 和3090一样的延迟了 延迟都能达到20us内了
这位老哥自从用4卡7900xtx 跑了deepseek v4 flash(卸载到内存) 后,最近更新速度降下来了。期望它再接再厉能把v4 flash 搞到30tokens也好呀
-
7900xtx涨价了已经没性价比,双3080 20G怎么样?幸好5200买了两张蓝宝石的全新卡,不错不错哈
-
想換9700x顯卡,請各位大大給建議涨价了,现在最有价值的是两台GB10 跑DeepSeek v4 flash 速度和智能基本可以替代大部分工作了
-
請教 CPU 散片 / RAM / SSD 推薦購買店家电源直接买大,万一有双卡需求,到时候又要买大的,我现在就是这样的买了个850W的现在双卡又买了个1200W的
-
AMD AI Pro R9700 LLM调教再买一张组tp=2 的vllm体验会很丝滑