跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
I

iamvirus

@iamvirus
德高望重
取消关注 关注
关于
帖子
31
主题
0
分享
0
群组
1
粉丝
1
关注
0

帖子

最新 最佳 有争议的

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    I iamvirus

    我刚刚把双卡7900xtx出了!白玩几个月还赚了。。。

    AI硬件 7900xtx sg-lang 多卡部署

  • 关于双AMD RX7900XTX的使用感受
    I iamvirus

    不错,多来点测试!主要看看prefill。其实现在发现双R9700 速度是双7900xtx的双倍了,而且还是fp8。。。虽然目前双7900xtx 速度也不错了

    AI硬件 7900xtx amd 多卡部署

  • 请教:AMD R9700 还是 Mac Studio?
    I iamvirus

    如果只上64G,还是双R9700

    LLM讨论区 r9700 mac apple-m5

  • Asus Ascent GX10到货,双gb10的DSV4-Flash集群全程hermes远程部署
    I iamvirus

    我早就说过两台GB10 跑DS V4是目前最好的本地方案了。几乎本地95%的工作不要在线了。

    AI硬件 gb10 deepseek hermes

  • AMD R 9700 32G到货了。一顿操作。整成无头算力卡了。经实测这卡更适合工作在X99主板。家用老机器升级慎重考虑。
    I iamvirus

    目前阶段双R9700跑大模型27b超过了4090 48G

    AI硬件 r9700 amd x99

  • SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B
    I iamvirus

    期望27b看到10-32-64-90-128K下的prefill速度和nomtp速度。这样才有参考意义!这个单卡prefill应该击败双r9700,现在双r9700 FP8 VLLM 10k-3000 90K-2000+的速度了,跑agent的subgent已经很有生产力了。

    LLM讨论区 sg-lang qwen-27b

  • {求助帖} 我两张rx7900xtx,乌邦图系统部署安装vllm然后运行模型老是失败
    I iamvirus

    https://github.com/JartX/vllm
    肯定是构建Docker镜像跑啊,分支里面有Dockerfile.rocm_fa 这个交给ai,你只要把你怎么fq告诉ai,它会给你全部配置好的。这个要下载很多东西的哦。

    LLM讨论区 7900xtx ubuntu vllm

  • 双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)
    I iamvirus

    @gk20082000
    我又来做好人了,这里有现成的作业不去抄?
    https://hub.docker.com/r/capicua25x/vllm-rocm-rdna4

    LLM讨论区 7900xtx vllm mtp

  • 双7900xtx的主机方案?
    I iamvirus

    说实话,唯一一点你没考虑!就是放不放的两张卡进去?

    AI硬件 7900xtx 多卡部署

  • 7900XTX双卡跑VLLM跑 Qwen3.8 27b实录
    I iamvirus

    vllm(perf/rdna3_full_stack)+lmcache(dev最新版本) +dbirks/Qwen3.8-27B-W4A16-AutoRound 丝滑,几乎不用ai改代码,只有lmcache一点点。因为有缓存,所以并发需要prefill的上下文极度降低。omp agent体验丝滑。

    LLM讨论区 7900xtx vllm qwen-27b

  • 7900XTX双卡跑VLLM跑 Qwen3.8 27b实录
    I iamvirus

    再弄一个lmcache,只要你大内存和大固态(我是128G内存+2T固态)。你会发现并发好爽! 这些都是我验证过的。

    LLM讨论区 7900xtx vllm qwen-27b

  • 大型纪录片:Qwen 3.8 27B 优化思考-> 拯救工具调用 【欢迎指正】
    I iamvirus

    该jinja模板为默认中等思考等级是最佳配置

    LLM讨论区 qwen-27b

  • 7900XTX双卡跑VLLM跑 Qwen3.8 27b实录
    I iamvirus

    https://github.com/sgl-project/sglang/issues/30599 这个我都跟踪好久了,不要去浪费时间,sglang没有大神用gfx1100

    LLM讨论区 7900xtx vllm qwen-27b

  • 7900XTX双卡跑VLLM跑 Qwen3.8 27b实录
    I iamvirus

    双卡 3090 vs 双卡 7900 XTX Prefill 速度横向对比 (以 Qwen 27B W4A16 为准)

    把两座仓库同一模型(Qwen 27B W4A16, TP=2)在相同硬件规格(2×24GB2×24GB)下的 Prefill 实测吞吐拉齐对比:

    上下文深度 (Context) 双卡 RTX 3090 (TP=2) <br>(来自 club-3090) 双卡 RX 7900 XTX (TP=2) <br>(来自 JartXvllm) 对比分析
    短/中等长度 (4K10K) 1446∼2466 tok/s <br>(标准 INT4 ~1446,W4A8 达 2466) 1388∼1450 tok/s <br>(Triton 优化版) 基本打平。 <br>在标准 INT4 下两款双卡均落在 1400+ tok/s1400+ tok/s 水平。
    长上下文 (32K~90K) 1118∼1742 tok/s <br>(标准 INT4 ~1118,W4A8 达 1742) 1240∼1732 tok/s <br>(自研 HIP 融合算子) 7900 XTX 表现亮眼。 <br>7900 XTX 凭借手写的原生 HIP WMMA Prefill 算子,在长上下文下甚至微超 3090 的标准 INT4 路径。
    LLM讨论区 7900xtx vllm qwen-27b

  • 7900XTX双卡跑VLLM跑 Qwen3.8 27b实录
    I iamvirus

    看到终于有人用这个双卡7900xtx了,献上我用了一个多月的vllm吧,直接用这个https://github.com/JartX/vllm perf/rdna3_full_stack 分支的吧!
    RDNA3W4A16LinearKernel 这个东西就是这位Jartx老哥提的pr,它还修复了好多7900xtx的kernel,它自己现在就是4卡7900xtx了。现在做的W4A16量化prefill和decode 速度都3090一样的速度了
    现在还缺W4A8 W8A8 MXFP4等支持
    下面贴一下这个分支的特性,做了很多针对gfx1100 推理关键kernel的修复

     1. 注意力(KV cache 量化)——优化最重、收益最大
    
     ┌───────────────────┬───────────────────────────────────────────────────────────────────────────────────┬──────────────────────────────────────────────────────────────────────────────┬─────────────────────────────────────────────────┐
     │ 优化              │ 内核                                                                              │ 门控条件                                                                     │ 收益(README 实测)                             │
     ├───────────────────┼───────────────────────────────────────────────────────────────────────────────────┼──────────────────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────┤
     │ INT8 prefill      │ paged_prefill_attn_rdna3_v2_int8(HIP WMMA)                                      │ --kv-cache-dtype int8_per_token_head + TRITON_ATTN + HS∈{64,128,256} + 纯    │ 3.03ms vs Triton 25ms(8.3×);整机 1209 vs 727 │
     │                   │                                                                                   │ prefill continuation + 无 alibi/swa/sink/softcap                             │ tok/s(+66%),VRAM −50%                        │
     ├───────────────────┼───────────────────────────────────────────────────────────────────────────────────┼──────────────────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────┤
     │ INT8 decode       │ pth_decode_int8_rdna3(HIP split-KV,1-wave)                                     │ 同上 + HS==256 + max_query_len≤128                                           │ decode 主路径                                   │
     ├───────────────────┼───────────────────────────────────────────────────────────────────────────────────┼──────────────────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────┤
     │ INT4              │ paged_prefill_attn_rdna3_v2_int4 + pth_decode_int4_rdna3 +                        │ int4_per_token_head + HS∈{128,256}                                           │ ~1150 tok/s(+58%),VRAM −75%                  │
     │ prefill/decode    │ rht_rotate_inplace_rdna3 + reshape_cache_int4_rdna3(融合 RHT)                   │                                                                              │                                                 │
     └───────────────────┴───────────────────────────────────────────────────────────────────────────────────┴──────────────────────────────────────────────────────────────────────────────┴─────────────────────────────────────────────────┘
    
     关键点:这个阶段与权重量化完全无关,只由 --kv-cache-dtype 决定。
    
     2. W4A16 权重 GEMM(两套 HIP 内核,按对称性分叉)
    
     ┌────────────────────────────────────────────────────────────────┬─────────────────────────────────────────────────────────────────┬─────────────────────────────────────────────────────────────────────────────────────────────────────┐
     │ 内核                                                           │ 支持的量化                                                      │ 路径                                                                                                │
     ├────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────────────────────────────────────────┤
     │ gptq_gemm_rdna3 + gptq_gemm_rdna3_wmma(q_gemm_rdna3*.cu,fork │ 对称 int4 = uint4b8(GPTQv1 布局,ExLlama shuffle,存储 zp =    │ RDNA3W4A16LinearKernel(优先级第一);bf16 M≥16 → WMMA(prefill 128×64 主核),M=1 →                │
     │ 自研)                                                         │ 实际 zp − 1)                                                   │ 标量快速路径(v_dot2,省 LDS)                                                                      │
     ├────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────────────────────────────────────────┤
     │ wvSplitK_int4_g(skinny_gemms_int4.cu,移植上游 PR #40977)    │ 非对称 int4 = uint4(存储 zp = 实际零点)                       │ RDNAHybridW4A16LinearKernel;仅 M≤5 且 K·M≤32768                                                    │
     ├────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────┼─────────────────────────────────────────────────────────────────────────────────────────────────────┤
     │ moe_gptq_gemm_rdna3(moe_q_gemm_rdna3.cu)                     │ 同 gptq 对称布局                                                │ MoE 专家 GEMM(KAT-Coder-V2.5 走的就是它)                                                          │
     └────────────────────────────────────────────────────────────────┴─────────────────────────────────────────────────────────────────┴─────────────────────────────────────────────────────────────────────────────────────────────────────┘
    

    特别是它还修复了多卡通信RCCL 和3090一样的延迟了 延迟都能达到20us内了

    这位老哥自从用4卡7900xtx 跑了deepseek v4 flash(卸载到内存) 后,最近更新速度降下来了。期望它再接再厉能把v4 flash 搞到30tokens也好呀

    LLM讨论区 7900xtx vllm qwen-27b

  • 7900xtx涨价了已经没性价比,双3080 20G怎么样?
    I iamvirus

    幸好5200买了两张蓝宝石的全新卡,不错不错哈

    AI硬件 7900xtx rtx3080

  • 想換9700x顯卡,請各位大大給建議
    I iamvirus

    涨价了,现在最有价值的是两台GB10 跑DeepSeek v4 flash 速度和智能基本可以替代大部分工作了

    AI硬件 amd

  • 請教 CPU 散片 / RAM / SSD 推薦購買店家
    I iamvirus

    电源直接买大,万一有双卡需求,到时候又要买大的,我现在就是这样的买了个850W的现在双卡又买了个1200W的

    AI硬件

  • AMD AI Pro R9700 LLM调教
    I iamvirus

    再买一张组tp=2 的vllm体验会很丝滑

    LLM讨论区 r9700 ai-pro-r9700 amd
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组