跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 项目 AI 广场
zhenyu huangZ

zhenyu huang

@zhenyu huang
取消关注 关注
关于
帖子
51
主题
4
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4
    zhenyu huangZ zhenyu huang

    还是前缀缓存命中了?

    LLM讨论区 r9700 vllm qwen-27b

  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4
    zhenyu huangZ zhenyu huang

    @paul-hou profill速度怎么那么快 是因为量化等级小吗

    LLM讨论区 r9700 vllm qwen-27b

  • AMD R9700 實測:ROCm 10,Qwen38-27B-UD-Q6_K、128K context 和 MTP
    zhenyu huangZ zhenyu huang

    @heheimback 是这么回事 跑llm的话 不如7900xtx的960gb的带宽 快很多 跟4090的带宽是一个级别的

    AI硬件 r9700 rocm qwen-27b

  • 咨询一下,4090魔改卡风扇转速问题
    zhenyu huangZ zhenyu huang

    @terry vbios固件已经写死 没有使用率也是60%的风扇空转 要改只能刷固件 你那块卡明显就是低转速的vbios 出厂的厂家不一样

    AI硬件 rtx4090

  • X99+7900 XTX+7700 XT 跑 vLLM实测
    zhenyu huangZ zhenyu huang

    已改成精简版帖子,只保留 vLLM 操作和实测。注释 1


    X99+7900 XTX/7700 XT 跑 vLLM:128K、缓存及 MTP 实测

    配置:X99-AD4、E5-2686 v4、64GB、7900 XTX 24GB+7700 XT 12GB。

    模型:Vishva007/Qwen3.8-27B-W4A16-AutoRound-GPTQ,vLLM 0.28.0、ROCm 7.2.3 wheel。

    1. 做了哪些修改

    操作 实验结果
    开启 Above 4G Decoding、ReBAR 双卡进入 Ubuntu,大 BAR 生效
    给主机桥 8086:6f00 加 P2PDMA 白名单,编译实验内核 缺 gawk 失败一次,补齐后完成,累计编译约54分钟;HIP peer 双向由0变1,复制和IPC校验通过
    换用 AMD RCCL build 38,移除 LD_PRELOAD 解决原库双卡 AllReduce 段错误,集合通信通过
    修正 GPTQ 零点传参、按显卡读取CU数量、开启decode graph,并加入MTP3 TP2下1K输入TG从5.87提高到47.26
    移植 JartX 的 RDNA3 prefill 调度参数 16K PP提高21.4%,32K提高42.2%
    改为不等量分层,让XTX承担更多层 长上下文PP提高,跑通128K

    注意:最终 RCCL 仍走 SHM,不能宣称高速P2P已打通;也未证明实验内核是最终方案的必要条件。

    2. PP/TG 实测

    JartX prefill 调整前后,保持TP2+MTP3:

    输入 调整前PP 调整后PP 调整后TG
    16K 561.8 682.2 29.23
    32K 452.9 644.0 17.89

    之后改成 TP1+PP2、7700 XT前20层/XTX后44层,无MTP、无缓存。单请求生成256 token:

    实际输入token PP(tok/s) TG(tok/s)
    4,096 1,016.56 27.55
    16,384 995.61 24.94
    32,768 933.16 24.78
    130,816 670.88 18.06

    最后一项输入+输出共131,072,整次请求209.1秒。分层后短上下文TG不如早期TP2+MTP3,但PP更高,32K生成也更快。

    3. 最终使用配置

    接入视觉后重新平衡显存,改成 18/46分层、128K、前缀缓存、最多4并发。batch预算1024,显存预算0.948,无MTP。

    测试 结果
    约3K输入/256输出 TG 28.74/28.93 tok/s
    7,552 token文本首次/重复请求 首token 7.451秒/0.788秒
    图片首次/重复请求 首token 2.146秒/0.591秒,均识别出数码管Ab
    保留视觉编码器,131,008输入+64输出 满128K请求186.1秒完成

    并发调优阶段,约7.5K输入/160输出、缓存已热:

    并发 每路TG 首token延迟
    2 18.83–20.46 0.828–1.630秒
    4 15.02–18.59 0.928–3.092秒

    这组并发数据使用0.94显存预算。前面的完整长上下文表属于纯文本20/44方案,不是最终视觉配置的成绩。四并发也不代表能同时容纳四个独立满128K请求。

    4. 为什么最终没留MTP

    适配PP+MTP后,约3K输入、256输出:

    配置 两次TG(tok/s)
    无MTP 28.62/28.80
    MTP1 14.88/15.06
    MTP2 16.59/16.50
    MTP3 18.55/18.83

    MTP实验为8K、无缓存,基线为128K+缓存,是部署方案对比而非严格单变量实验。虽然成功运行,但TG下降,因此撤回。

    DFlash2也试过:1K输入TG从30.01到32.58,但受显存限制,完成测试的上下文上限只有2304;runner与缓存配置也不同,不能视为严格加速对照,最终放弃。

    目前保留无MTP的128K+视觉+缓存方案,DSH和公网接口均已接通。单流约3K上下文TG为29 tok/s,多会话主要依靠前缀缓存减少重复处理。

    以上均为短期实测:128K验证的是容量,不是长期稳定性或长上下文语义能力。

    LLM讨论区 x99 7900xtx vllm rx7700xt

  • 请教:AMD R9700 还是 Mac Studio?
    zhenyu huangZ zhenyu huang

    r9700我看京东自营又涨了1000 哈哈哈

    LLM讨论区 r9700 mac apple-m5

  • 昨天出了5090+Pro 6000。
    zhenyu huangZ zhenyu huang

    @张光璞 同问 这个又不是随便就能扩容的 得有vbios啊 而且得是官方“不小心” 泄露出来

    AI硬件 rtx5090 rtxpro6000

  • Asus Ascent GX10到货,双gb10的DSV4-Flash集群全程hermes远程部署
    zhenyu huangZ zhenyu huang

    好厉害 同问测试数据

    AI硬件 gb10 deepseek hermes

  • rtx8000 工作站卡 突然在闲鱼刷到 是我被信息差了吗
    zhenyu huangZ zhenyu huang

    @Kirin-H. 数据中心机房的环境肯定比挖矿的要好吧 挖矿是超频的

    AI硬件 nvidia rtx8000

  • rtx8000 工作站卡 突然在闲鱼刷到 是我被信息差了吗
    zhenyu huangZ zhenyu huang

    @李源 我还看到咸鱼卡贩子打包出170hx的 说单张不卖的 不敢想象都是谁在买

    AI硬件 nvidia rtx8000

  • rtx8000 工作站卡 突然在闲鱼刷到 是我被信息差了吗
    zhenyu huangZ zhenyu huang

    @terry 等一个大船靠岸A100 啊哈哈

    AI硬件 nvidia rtx8000

  • rtx8000 工作站卡 突然在闲鱼刷到 是我被信息差了吗
    zhenyu huangZ zhenyu huang

    算力是不是跟2080ti差不多 但是显存是48gb 有大佬锐评一下吗

    AI硬件 nvidia rtx8000

  • rtx8000 工作站卡 突然在闲鱼刷到 是我被信息差了吗
    zhenyu huangZ zhenyu huang

    07625eed-2bfd-4a9f-af02-be013cd558c5-9fd4f8a7a556154aba91551488de376c.jpg

    AI硬件 nvidia rtx8000

  • 关于升级显卡和添置第二张显卡的一点个人忠告!
    zhenyu huangZ zhenyu huang

    @williamlouis 同意观点 但是压根就找不到项目做呀 啊哈哈 只能折腾折腾本地 人赚不到认知以外的钱 大佬能不能给我们这些屌丝提升提升认知

    AI硬件 多卡部署 amd nvidia

  • 配置咨询 想4090D + 7900xtx 想插在一台电脑上,qwen27b+comfyui 分别跑语言模型和视频工作流这样好吗?
    zhenyu huangZ zhenyu huang

    @Nero丶畅畅 自营的 卡没问题 我测试了 就是风扇调度很激进 我买的是大勤智能

    AI硬件 7900xtx comfyui qwen-27b rtx4090

  • 配置咨询 想4090D + 7900xtx 想插在一台电脑上,qwen27b+comfyui 分别跑语言模型和视频工作流这样好吗?
    zhenyu huangZ zhenyu huang

    @Nero丶畅畅 我下单了 测试了一下 这块跟老特那块风扇调度不一样 老特那块是下限30%左右的 但是我那块下限是63%左右 跟楼主的一样 就是啥也没干 你就能听到很大的噪音 而且没法更改 是写死在vbios里的 我受不了 给退了

    AI硬件 7900xtx comfyui qwen-27b rtx4090

  • 双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)
    zhenyu huangZ zhenyu huang

    什么电源啊 双卡7900xtx有6个8pin口 我振华电源1200瓦是 4个8pin口加一个600瓦的12pin的口

    LLM讨论区 7900xtx vllm mtp

  • 买了两个9060xt 16gb
    zhenyu huangZ zhenyu huang

    是买完了才看的视频和论坛帖子吗 哈哈 难道这是大数据的威力

    AI硬件 amd 多卡部署 rx9060xt

  • 4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型
    zhenyu huangZ zhenyu huang

    @Takano-RR 这种就是没自营靠谱 这个人闲鱼和淘宝都有 问了核心挂了保不保 也说保的 但感觉毕竟是个人 淘宝店铺这种说没就没了 闲鱼更是没法管

    AI硬件 rtx4080s r9700

  • R9700 32GB 跑 Qwen3.8-27B:llama.cpp Vulkan + MTP 实测与踩坑记录
    zhenyu huangZ zhenyu huang

    r9700这个涡轮转速上去之后也很吵吗 是不是所有涡轮都一样吵

    LLM讨论区 r9700 qwen-27b llama.cpp
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组