跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
Leon YL

Leon Y

@Leon Y
德高望重
取消关注 关注
关于
帖子
44
主题
3
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 双 3090 NVLink 从vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开
    Leon YL Leon Y

    @starryskyknight
    我这边 162 是单路口径,而且单路下测出来跨度很大:

    内容 单路解码
    数字计数(高可预测) ~162-168 t/s
    JSON/结构化 ~168 t/s
    Python 代码 ~130 t/s
    英文/中英混合 ~98-102 t/s
    中文散文(典型) ~77-85 t/s

    AI Agent rtx3090 sg-lang qwen-27b

  • 假如我自己组建Qwen3.8 27b 服务器, 160 tps
    Leon YL Leon Y

    @terry 村里刚通电😢

    LLM讨论区 qwen-27b 服务器

  • 假如我自己组建Qwen3.8 27b 服务器, 160 tps
    Leon YL Leon Y

    哦,Seedance, 第一次听说“即梦“这个名字

    LLM讨论区 qwen-27b 服务器

  • 假如我自己组建Qwen3.8 27b 服务器, 160 tps
    Leon YL Leon Y

    @imbiplaza-ASUS 即梦是什么?

    LLM讨论区 qwen-27b 服务器

  • 假如我自己组建Qwen3.8 27b 服务器, 160 tps
    Leon YL Leon Y

    我们南洋。。。也没那么落后吧

    LLM讨论区 qwen-27b 服务器

  • 双 3090 NVLink 从vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开
    Leon YL Leon Y

    @stxpnet
    CPU:i7-9700
    板:技嘉 Z370XP SLI(双卡 PCIe x8/x8)
    卡:2× 华硕 Turbo RTX 3090 24G + NVLink
    内存:64G DDR4

    AI Agent rtx3090 sg-lang qwen-27b

  • 顯卡散熱墊(導熱矽膠片)
    Leon YL Leon Y

    @kos-or 淘宝买的,只能降个1,2度

    随便聊聊

  • 顯卡散熱墊(導熱矽膠片)
    Leon YL Leon Y

    @imbiplaza-ASUS 盗版我的解决方案,哈哈
    f18e51ee-c04f-431c-9fd7-3ce9e520f66b-image.jpeg

    随便聊聊

  • 双 3090 NVLink 从vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开
    Leon YL Leon Y

    对,250W在~150左右
    设功率墙只要是涡轮卡太吵了

    AI Agent rtx3090 sg-lang qwen-27b

  • 双 3090 NVLink 从vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开
    Leon YL Leon Y

    感谢分享,同双 3090 NVLink 4-link + SGLang 0.5.18,果断换去了AWQ。我同时测了 shawnw3i/Qwen3.8-27B-AWQ-MTP(标准)和 twolven/...-abliterated-AWQ-MTP(去审查):
    实测对比(正确的 token 口径)

    1e3fd906-67b6-42d6-a776-64a1dee6a5e2-image.jpeg

    另外加一点:功率墙有甜点。 我的机器有功率限制,扫了一遍:180W→62 t/s、220W→116、260W→162、300W→170。260W 是甜点(往上只 +5%,往下掉 28%)。如果楼主那台想控温/控电,可以试 260W,几乎不掉速。

    AI Agent rtx3090 sg-lang qwen-27b

  • 二张3090通过nvlink跑大模型,有人尝试过吗?
    Leon YL Leon Y

    我正好也是双 3090 NVLink,看我的帖子:https://lcz.me/topic/466/双3090-ollama-加载-q8-视觉模型瞬间断电重启-求老哥们把脉

    说下真实体验,我这边双 3090+NVLink,功率墙锁定260W,跑qwen3.8-27b-fp8模型

    • llama.cpp:27 tok/s
    • SGLang:~39 tok/s
    • vLLM:~10 tok/s
    AI硬件 rtx3090 多卡部署

  • SGLang HiCache 三层 KV 缓存实测:4090 48G 单卡跑通 Qwen3.8-27B 去审(256K + MTP + 视觉全占)
    Leon YL Leon Y

    黄易的《寻秦记》小说, 穿越小说的开山鼻祖,有人没看过么?
    还是我太老?

    LLM讨论区 sg-lang rtx4090 qwen-27b

  • 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分)
    Leon YL Leon Y

    @Xiaote 说:

    补充几个数据点,把楼里三个问题一起答了:

    1)Quanta Magic 问的"全程20多分钟生成15秒"——是的,按楼主自己的数据:长上下文段约 190s/步,全程约 20 分钟(还含机械盘加载模型)。这个速度对"单卡计算"的 H3 满血模型属于正常水平:34B 模型、362 帧 + 音频 + lipfix,计算全压在 GPU0 一张 3090 上。想提速的方向:换 NVMe 省掉机械盘加载那部分;或者先用 pruned 21GB 变体跑预览定构图,确认后再上满血模型出片。

    2)terry 问的"48G 明明够,为什么还剩 2.7G 放内存"——不是容量不够,是计算卡的激活显存必须留余量。31.7GB 权重拆成 10+19 之后,GPU0 峰值已经到 22.7GB/24GB(10GB 权重 + 约 12.7GB 激活),只剩 1.3GB 余量。要是把那 2.7GB 也塞进 GPU0,激活一冲高直接 OOM。而且楼主踩坑记录里写了:GPU1 塞满 24GB 连加载都过不去(要留 4-5GB 余量),所以 19GB 是"能稳定加载的上限"。这 2.7GB 本质是防 OOM 的安全垫,不是浪费。

    3)kos or 的带宽判断方向是对的:NVLink(单条约 50GB/s)> PCIe 4.0 x16(约 32GB/s)> PCIe 3.0 x16 / 内存回读(约 16GB/s)。那 2.7GB 在 CPU 内存里,每轮要经 PCIe 搬进显存,理论上确实比 NVLink 慢。但算笔账:2.7GB 走 PCIe 3.0 x16 约 0.17 秒,而长上下文段单步要 190 秒——占比不到 0.1%,属于噪声级。真正的瓶颈是单卡算力,不是这 2.7GB 的搬运。

    顺带说一句,DisTorch2 这个"权重仓库卡 + NVLink 流式搬运"的思路,跟 vLLM 的 expert offload、llama.cpp 的层 offload 是同一类 trade-off:用带宽换容量。对 H3 这种 34B 级别、激活又大的视频模型,比把权重全塞 CPU 内存(每层都走 PCIe 回读)要实用得多——前提是像楼主这样有 NVLink 或者至少 PCIe 4.0 x16。

    还是小特聪明

    AI音视频画图 minimax 视频生成 rtx3090 多卡部署

  • 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分)
    Leon YL Leon Y

    @terry 说:

    为什么不都放进去呢?这不是一共48G够吗?留一部分,是什么东西,这不妨碍推理吗?

    全放进去很容易就OOM

    AI音视频画图 minimax 视频生成 rtx3090 多卡部署

  • 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分)
    Leon YL Leon Y

    @terry 说:

    这也非常牛逼了,你的意思是都能加载到显存中?

    是拆到两张 3090 的显存里(24GB×2 = 48GB 总量),还有一小部分放 CPU 内存兜底:

    GPU0(计算卡): 10GB 权重 + 激活,峰值 ~22.7GB,满载计算
    GPU1(仓库卡): 19GB 权重,只存不计算,峰值 ~19.8GB
    CPU 兜底: ~2.7GB

    关键点:

    • 34GB 模型实际权重 31.7GB(int8 压缩),显存装得下 29GB,剩下的 2.7GB 放内存
    • GPU1 不参与计算,只当"权重仓库",层通过 NVLink 流式传到 GPU0 算
    • 所以本质是"显存拆分 + NVLink 搬运",不是"单卡全装"也不是"双卡并行计算"
    • GPU0 util 100% 满载,GPU1 util 0% 纯存储
    AI音视频画图 minimax 视频生成 rtx3090 多卡部署

  • 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分)
    Leon YL Leon Y

    之前 2×RTX 3090(24GB×2)只能跑 21GB pruned unet,34GB 满血 int8_convrot 一直放不下。这次用 ComfyUI-MultiGPU(pollockjj)的 UNETLoaderDisTorch2MultiGPU 把 34GB 模型拆到双卡,跑通了 15s 624×1104 视频+音频(362 帧@24fps,ref2va + lipfix 管线)。

    🟢 方案

    • 计算卡 GPU0 + 权重仓库 GPU1(DisTorch2 VRAM split,不是 compute split)
    • 分配:cuda:0 10GB / cuda:1 19GB / CPU 2.7GB 兜底
    • GPU1 只存权重不计算,层经 NVLink 流式传到 GPU0,GPU0 满载

    🔧 踩过的坑

    1. ComfyUI 0.30 默认 DynamicVRAM(aimdo)模式会让 DisTorch2 补丁失效 → 必须加 --disable-dynamic-vram 启动
    2. 0.30 核心删了 Triple/QuadrupleCLIPLoader → 节点报 KeyError,要给 init.py 打 guard 补丁
    3. GPU1 不能塞满 24GB(加载时 36MB 都挤不下,直接 OOM)→ 留 4-5GB 余量
    4. virtual_vram_gb 路径按展开尺寸算会误判(61.7GB vs 实际 31.7GB int8)→ 改用 expert_mode_allocations 字节分配才准

    ⚠️ 注意:这是能力提升(跑得动 34GB 满血),不是速度提升——计算全在 GPU0。长上下文段 ~190s/步,全程约 20 分钟(含机械盘加载)。

    AI音视频画图 minimax 视频生成 rtx3090 多卡部署

  • 大热的3090风冷改造方案 大幅降温稳定AI大脑
    Leon YL Leon Y

    @applejuice 说:

    3 slot

    对,3 slot

    AI硬件 rtx3090

  • 大热的3090风冷改造方案 大幅降温稳定AI大脑
    Leon YL Leon Y

    @applejuice 你看我的帖子 https://lcz.me/topic/466/双3090-ollama-加载-q8-视觉模型瞬间断电重启-求老哥们把脉

    AI硬件 rtx3090

  • 大热的3090风冷改造方案 大幅降温稳定AI大脑
    Leon YL Leon Y

    我的风冷方案
    IMG_7432.jpeg

    AI硬件 rtx3090

  • 双 3090(NVLink)跑 Qwen3.6-27B,128K 上下文实测
    Leon YL Leon Y

    @applejuice 说:

    @Leon-Y prefill 呢?

    忘了看了

    AI硬件 nvidia rtx3090 多卡部署
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组