@starryskyknight
我这边 162 是单路口径,而且单路下测出来跨度很大:
内容 单路解码
数字计数(高可预测) ~162-168 t/s
JSON/结构化 ~168 t/s
Python 代码 ~130 t/s
英文/中英混合 ~98-102 t/s
中文散文(典型) ~77-85 t/s
@starryskyknight
我这边 162 是单路口径,而且单路下测出来跨度很大:
内容 单路解码
数字计数(高可预测) ~162-168 t/s
JSON/结构化 ~168 t/s
Python 代码 ~130 t/s
英文/中英混合 ~98-102 t/s
中文散文(典型) ~77-85 t/s
@terry 村里刚通电
哦,Seedance, 第一次听说“即梦“这个名字
@imbiplaza-ASUS 即梦是什么?
我们南洋。。。也没那么落后吧
@stxpnet
CPU:i7-9700
板:技嘉 Z370XP SLI(双卡 PCIe x8/x8)
卡:2× 华硕 Turbo RTX 3090 24G + NVLink
内存:64G DDR4
@kos-or 淘宝买的,只能降个1,2度
@imbiplaza-ASUS 盗版我的解决方案,哈哈

对,250W在~150左右
设功率墙只要是涡轮卡太吵了
感谢分享,同双 3090 NVLink 4-link + SGLang 0.5.18,果断换去了AWQ。我同时测了 shawnw3i/Qwen3.8-27B-AWQ-MTP(标准)和 twolven/...-abliterated-AWQ-MTP(去审查):
实测对比(正确的 token 口径)

另外加一点:功率墙有甜点。 我的机器有功率限制,扫了一遍:180W→62 t/s、220W→116、260W→162、300W→170。260W 是甜点(往上只 +5%,往下掉 28%)。如果楼主那台想控温/控电,可以试 260W,几乎不掉速。
我正好也是双 3090 NVLink,看我的帖子:https://lcz.me/topic/466/双3090-ollama-加载-q8-视觉模型瞬间断电重启-求老哥们把脉
说下真实体验,我这边双 3090+NVLink,功率墙锁定260W,跑qwen3.8-27b-fp8模型
黄易的《寻秦记》小说, 穿越小说的开山鼻祖,有人没看过么?
还是我太老?
补充几个数据点,把楼里三个问题一起答了:
1)Quanta Magic 问的"全程20多分钟生成15秒"——是的,按楼主自己的数据:长上下文段约 190s/步,全程约 20 分钟(还含机械盘加载模型)。这个速度对"单卡计算"的 H3 满血模型属于正常水平:34B 模型、362 帧 + 音频 + lipfix,计算全压在 GPU0 一张 3090 上。想提速的方向:换 NVMe 省掉机械盘加载那部分;或者先用 pruned 21GB 变体跑预览定构图,确认后再上满血模型出片。
2)terry 问的"48G 明明够,为什么还剩 2.7G 放内存"——不是容量不够,是计算卡的激活显存必须留余量。31.7GB 权重拆成 10+19 之后,GPU0 峰值已经到 22.7GB/24GB(10GB 权重 + 约 12.7GB 激活),只剩 1.3GB 余量。要是把那 2.7GB 也塞进 GPU0,激活一冲高直接 OOM。而且楼主踩坑记录里写了:GPU1 塞满 24GB 连加载都过不去(要留 4-5GB 余量),所以 19GB 是"能稳定加载的上限"。这 2.7GB 本质是防 OOM 的安全垫,不是浪费。
3)kos or 的带宽判断方向是对的:NVLink(单条约 50GB/s)> PCIe 4.0 x16(约 32GB/s)> PCIe 3.0 x16 / 内存回读(约 16GB/s)。那 2.7GB 在 CPU 内存里,每轮要经 PCIe 搬进显存,理论上确实比 NVLink 慢。但算笔账:2.7GB 走 PCIe 3.0 x16 约 0.17 秒,而长上下文段单步要 190 秒——占比不到 0.1%,属于噪声级。真正的瓶颈是单卡算力,不是这 2.7GB 的搬运。
顺带说一句,DisTorch2 这个"权重仓库卡 + NVLink 流式搬运"的思路,跟 vLLM 的 expert offload、llama.cpp 的层 offload 是同一类 trade-off:用带宽换容量。对 H3 这种 34B 级别、激活又大的视频模型,比把权重全塞 CPU 内存(每层都走 PCIe 回读)要实用得多——前提是像楼主这样有 NVLink 或者至少 PCIe 4.0 x16。
还是小特聪明
这也非常牛逼了,你的意思是都能加载到显存中?
是拆到两张 3090 的显存里(24GB×2 = 48GB 总量),还有一小部分放 CPU 内存兜底:
GPU0(计算卡): 10GB 权重 + 激活,峰值 ~22.7GB,满载计算
GPU1(仓库卡): 19GB 权重,只存不计算,峰值 ~19.8GB
CPU 兜底: ~2.7GB
关键点:
之前 2×RTX 3090(24GB×2)只能跑 21GB pruned unet,34GB 满血 int8_convrot 一直放不下。这次用 ComfyUI-MultiGPU(pollockjj)的 UNETLoaderDisTorch2MultiGPU 把 34GB 模型拆到双卡,跑通了 15s 624×1104 视频+音频(362 帧@24fps,ref2va + lipfix 管线)。
🟢 方案
踩过的坑
️ 注意:这是能力提升(跑得动 34GB 满血),不是速度提升——计算全在 GPU0。长上下文段 ~190s/步,全程约 20 分钟(含机械盘加载)。
3 slot
对,3 slot
我的风冷方案

@Leon-Y prefill 呢?
忘了看了