跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
A

applejuice

@applejuice
技术大牛 劳动模范
取消关注 关注
关于
帖子
329
主题
10
分享
0
群组
2
粉丝
5
关注
0

帖子

最新 最佳 有争议的

  • 雙 4080 SUPER 32G + SGLang HiCache 實測:Qwen3.8-27B-FP8,256K context,agent 全程代操(GLM Zcode + GLM 5.3)
    A applejuice

    @terry 单卡没差别
    但是我觉得我们这种双卡跑大模型 平台还是越新越好

    而且我发现内存 越快也越好
    我一开始内存 插错槽
    decode/prefill 性能比x99 更差
    过后插对槽, decode/prefill 性能立刻提升20-30%
    所以内存速度应该有分别

    @johnnybegood 过分了 甚至主板那些也起价

    AI硬件 rtx4080s sg-lang qwen-27b

  • 雙 4080 SUPER 32G + SGLang HiCache 實測:Qwen3.8-27B-FP8,256K context,agent 全程代操(GLM Zcode + GLM 5.3)
    A applejuice

    现阶段 4080 32gb 价钱只高过3090 一点点
    感觉比3090 划算多了
    64gb
    也不需要nvlink 就有2000prefill

    AI硬件 rtx4080s sg-lang qwen-27b

  • 又下单了一张3090 24G, 但是还是有关于AI硬件的迷惑, 求解… …
    A applejuice

    如果玩 不试试 3090 x4 吗 😆

    AI硬件 rtx3090

  • 又下单了一张3090 24G, 但是还是有关于AI硬件的迷惑, 求解… …
    A applejuice

    我只是小白 但是我想说
    3090 x2 nvlink 应该只差在prefill
    照理说 decode 不应该差那么多
    之前我用nvlink decode 也没差很多
    prefill 很明显
    但是用p2p 照理说也速度也只是差100gb/s 跟 50gb/s的距离
    又照理说不应该会差很多

    可惜我都nvlink 用不到 不然可以测测

    AI硬件 rtx3090

  • 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
    A applejuice

    @starryskyknight 再来1m上下文 我就有借口 上4卡 3090 了

    LLM讨论区 rtx3090 sg-lang dflash

  • 显卡还会继续涨价,穷人会因AI被剥削更多,认知水平和经济现状决定了穷人很难通过AI翻身,但是有机会还是应该扑腾一下!
    A applejuice

    @imbiplaza-ASUS 穷到只剩gpu

    随便聊聊

  • 显卡还会继续涨价,穷人会因AI被剥削更多,认知水平和经济现状决定了穷人很难通过AI翻身,但是有机会还是应该扑腾一下!
    A applejuice

    @imbiplaza-ASUS 这种我接受不了 太丑

    随便聊聊

  • 显卡还会继续涨价,穷人会因AI被剥削更多,认知水平和经济现状决定了穷人很难通过AI翻身,但是有机会还是应该扑腾一下!
    A applejuice

    @imbiplaza-asus 全铜也不便宜
    而且我这种涡轮3090也不适合

    @johnnybegood 想把箱内温度压下来 现在动不动机箱都55+

    随便聊聊

  • 显卡还会继续涨价,穷人会因AI被剥削更多,认知水平和经济现状决定了穷人很难通过AI翻身,但是有机会还是应该扑腾一下!
    A applejuice

    @johnnybegood 既然改不上水冷吗?

    随便聊聊

  • 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
    A applejuice

    @Eric-Su 开放式 机箱吗 ?
    我也想玩 4张
    虽然说现阶段不需要

    LLM讨论区 rtx3090 sg-lang dflash

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    A applejuice

    @imbiplaza-ASUS 现在新加坡 马来西亚的2手 3090 都比淘宝便宜

    想买2手来改水冷玩4张3090 但是难度太高 钱要花太多

    AI硬件 7900xtx sg-lang 多卡部署

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    A applejuice

    @Mediali-Li 果然高手在民间

    1500prefill 我都感觉很不错了

    AI硬件 7900xtx sg-lang 多卡部署

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    A applejuice

    @Mediali-Li 如果你这个是稠密模型 那是真强

    AI硬件 7900xtx sg-lang 多卡部署

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    A applejuice

    @Mediali-Li 什么模型可1800?

    AI硬件 7900xtx sg-lang 多卡部署

  • 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
    A applejuice

    @starryskyknight

    350w 算是没功耗限制 3090 最高功耗好像就是350w
    平常都是245w限制

    这个就是 245w限制

    场景 ON (t/s) OFF (t/s) Δ decode tok/chunk ON tok/chunk OFF
    代码生成 147.6 258.1 +74.9% 3.64 6.32
    英文技术论述 109.2 147.2 +34.8% 2.69 3.63
    中文常规对话 80.5 103.5 +28.6% 1.99 2.56
    中文散文 67.0 64.3 −4.0% 1.67 1.60

    对比350w 后面100w, 30%的功耗, 只换来10%+ 的性能

    LLM讨论区 rtx3090 sg-lang dflash

  • 京东自营上架二手3090,标价8699,近期有自建本地AI算力的玩家可以给东哥走个面,单卡或者双卡TP都很有CP值,比7900XTX新卡更好!
    A applejuice

    @neo 我都想玩4张3090,无奈那个难度是几倍起跳
    散热 电源都是问题

    AI硬件 rtx3090 多卡部署

  • 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
    A applejuice

    @Don-zhu 我觉得差不多 一方面你没有nvlink 然后 pcie x8

    LLM讨论区 rtx3090 sg-lang dflash

  • 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
    A applejuice

    @Don-zhu prefill 多少

    楼主是nvlink pcie 也不重要了,因为都显卡数据交换 经过nvlink 不经过pcie

    你的是x8 我的是x16 分别就是这里

    单路 decode,rounds=3、max_tokens=512、temperature=0, NCCL_P2P_DISABLE=0, NCCL_P2P_LEVEL=SYS, disable_custom_all_reduce=true, 245w 功耗

    场景 ON (t/s) OFF (t/s) Δ decode tok/chunk ON tok/chunk OFF
    代码生成 147.6 258.1 +74.9% 3.64 6.32
    英文技术论述 109.2 147.2 +34.8% 2.69 3.63
    中文常规对话 80.5 103.5 +28.6% 1.99 2.56
    中文散文 67.0 64.3 −4.0% 1.67 1.60

    并发 2 路 aggregate decode(代码场景):

    并发模式 ON (t/s) OFF (t/s) Δ OFF 相对单路
    同 prompt(radix 命中) 232.2 463.7 +99.7% ×1.80
    不同 prompt 221.1 433.2 +95.9% ×1.68

    Prefill

    唯一随机 prompt(规避 radix 命中),max_tokens=1,rounds=2 取最快。
    固定开销标定 411 ms(极短 prompt 最小 TTFT,5 次取 min)。

    实际 prompt_tokens TTFT (s) 原始 t/s 扣除开销 t/s
    2,160 1.529 1413 1933 ⚠️
    8,502 5.167 1645 1788
    16,982 10.304 1648 1717
    33,703 21.657 1556 1586
    67,642 49.198 1375 1386
    137,835 124.093 1111 1114
    LLM讨论区 rtx3090 sg-lang dflash

  • 京东自营上架二手3090,标价8699,近期有自建本地AI算力的玩家可以给东哥走个面,单卡或者双卡TP都很有CP值,比7900XTX新卡更好!
    A applejuice

    真没想到
    才过3个月 显卡 从6000 冲上1万

    想当初卖家卖我7200 我都觉得他坑我

    AI硬件 rtx3090 多卡部署

  • 请教购买NVLINK硬件及注意事项
    A applejuice

    @terry 我之前就是盲猜

    所以交了学费

    AI硬件 多卡部署 nvidia
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组