跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI硬件
  4. 4090 48G用户选择副卡,3080/3090/7900XTX/R9700候选:SGLang、ComfyUI本地部署方案对比!

4090 48G用户选择副卡,3080/3090/7900XTX/R9700候选:SGLang、ComfyUI本地部署方案对比!

已定时 已固定 已锁定 已移动 AI硬件
r97007900xtxrtx3080
3 帖子 1 发布者 206 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 terry 编辑
    #1

    好,本期做一期视频,回答一下论坛观众的这个提问。要不然大家在论坛发帖,还不如在油管评论区发帖的待遇高,这样就不合理了。我们挑选这位叫 Lukun Ge 的幸运观众。他发的帖子是:

    背景: 服务器有一个 4090 48G,64G 内存,主板有两个 PCIe 5.0 ×16 的插槽。需求为再买一张显卡,解决千问 27B 越狱模型和 ComfyUI 同时运行的需求,有需要写视频剧本的需求,有编程的需求,Hermes 日常事务的需求。

    本地双显卡.jpeg

    选择有三个。第一,3080 20G。 缺点是 Qwen 27B 在 SGLang 的环境下上下文太小,价格 3,500 左右。从实际应用的场景,我判断应该是可以 pass。3080 20G 显存缺乏上下文的支持,模型串行部署在两张显卡上之后,Token 输出的速度应该过慢。

    你的判断基本上是对的,你可以排除。如果说你只是想买一张 3080 20G 的话,那么它是不足以支撑这个玩 SGLang 的。就是这个模型本来 4 比特量化之后大概是 16.5G,剩下 3.5G 的空间,扣除 SGLang 的开销,SGLang 的开销是不小的啊,你就基本上没有上下文了,这个不用想了。

    3080 20G.png

    第二就是 7900 XTX 24G。 千问 27B 模型应该能够运行,上下文应该可以到 64K,我感觉是刚刚过及格线,价格 5,500,比 3090 性价比要高。近期 3090 的价格是奔着 9,000 的区间在前进,但是 24G 显存还是过于鸡肋,或者有实际应用的朋友可以分享一下,24G 显存在我的需求场景下也是够的。

    怎么讲呢,如果说你是部署 llama.cpp 或者 vLLM,那么 7900 XTX 24G 可以跑 128K 上下文,而且我是确定测试过的,并且它不会降智、降速,它的速度还是相当不错的。但是如果说你要驱动 SGLang,那么 7900 XTX 它是生态地狱。总之,对于这个 7900 XTX,这个消费级的显卡,AMD 的 SGLang 生态支持不好。要配的话我觉得是比较麻烦的,反正之前我配过,挺难的。

    7900xtx蓝宝石.png

    第三就是 R9700 32G。 千问 27B 模型应该可以跑到 128K 左右的上下文,价格 11,000 左右。京东自营 R9700 32G 无疑是可以满足所有的需求,除了贵 5,500,显卡带宽没有 7900 高,其他的都挺好。

    那么对此我想说,就是 R9700 它比 7900 XTX 带宽小的这个问题,如果说是在跑 MoE 的小模型上,比如说 35B A3B 的模型上,这个体验差距是不大的。但是跑 27B 模型,这个差距还是蛮大的。而且即便是 7900 XTX,它 960G 的带宽,跑起来由于算力的问题,加上带宽的限制,它其实吐字的速度已经不够了。

    当然了,网上关于 R9700 32G 跑这个 SGLang,它由于是 RDNA 4 的架构,而且它本身是计算卡,所以说它的生态支持,这个镜像比较成熟,生态支持比 7900 XTX 要更好。这个需要大家自己去尝试一下吧,反正我没有这张卡,本来我是打算买的啊。

    蓝宝石AI Pro R9700.png

    下面再读一下他的实际问题。第一,从实际应用场景分享一下经验,A 卡和 N 卡同时在一起的时候,是否存在 Ubuntu 下的兼容性问题?我的查询结果是不会,还是要做一下真实应用的确认。

    那么我可以现在就确认,你这个问题不会啊,没有兼容性问题。因为我的服务器上就跑着 7900 XTX 跟这个 4090D 48G,那么我是同时装了 ROCm 跟这个 CUDA 的驱动,二者并不冲突,并且二者可以同时跑,而且我就同时跑过,一点问题都没有。

    机箱显卡2.jpg

    第二就是从实际应用的角度分享一下,大家如何兼顾本地模型和 ComfyUI 工作流同时在线的需求?是否这是一个伪需求,或者是一个低频的需求,其实没有必要配两张卡?

    这个东西叫仁者见仁,智者见智是吧。好比说你说买一个充气娃娃是不是一个伪需求?是不是如果说你有一个女朋友,身高一米六八,然后瓜子脸、鹅蛋脸是吧,长相清秀、肤白貌美,那你买充气娃娃的这个需求就是一个伪需求,是不是?可是如果说你是一个单身 15 年的猥琐男,练就了黄金麒麟臂,那我觉得买一个充气娃娃的需求就不是一个伪需求。就你的具体应用场景要怎么样。

    就像你刚才在开头说的,你又要去跑这个 Qwen 27B 的越狱模型,又要跟 ComfyUI 同时运行,又要写剧本,又要跑这个 Hermes,还要编程。我觉得按照你这个需求,可能两张显卡都未必够。当然了,两张显卡最低配啊是够的。

    关于你刚才说的三个方案,3080、7900 XTX 跟 R9700,我说实话,你买哪一张卡加上去都不够。对此呢,我有一个比较怎么说呢,小众的这个建议,就看你愿不愿意采纳。就是你现在把你这个两个 PCIe 5.0 ×16 的主板插槽空出来,把这个 4090 48G 给拿下来,去买两张 3080 20G,或者如果说你有钱的话,去买两张 3090 24G。

    因为你是 PCIe 5.0 ×16 的插槽,你两张卡 TP 的话,两张 N 卡 TP 跑 SGLang,它的效果是非常好的。就两张 3080 肯定是够了,它的吐字速度,包括这个 Prefill 的速度,应该都是非常不错的。两张 3090 的体验会更好,这个无论如何是要吊打 R9700 的。

    那么你空出来的 4090 48G 干什么呢?就像我一样,去买个 X99 的洋垃圾,配个 64G 内存,这个价格基本上可以忽略的,可能一千五六百块钱,总体一个平台给你搞定。这样子的话,你这个 4090 48G 专门用来做这个 ComfyUI,然后你以前配置不错的主板跟 CPU 去驱动两张 3080 20G,TP 跑这个 SGLang,这个体验应当会有质的飞跃。

    ubuntu洋垃圾双显卡机箱大.jpeg

    视频的最后,我还是要总结一下。 如果说我们没有什么本地抗审查的需求,比如说像这位 Lukun Ge 是吧,可能要写一些雅美蝶的文章、雅美蝶的剧本,那么我们就没有必要在本地部署 AI 大模型,尤其是文本大模型,这是一点必要都没有的。我们就用在线的 DeepSeek V4 Flash、混元 3,或者说是这个小米的 MiMo 模型,性价比都是非常高的。或者我们去订阅一个 GPT Plus,用它的这个什么 GPT Luna 这样的便宜模型,都是可以用的。

    如果说我们有抗审查的需求,那没办法,就必须要在本地部署模型。本地部署的话,如果说你已经有了两个 PCIe 5.0 ×16 的这种高端主板插槽,那么你买两张 3080,性价比应该是最高的。它用来跑这个 SGLang 双卡 TP 的话,效果是不会差的。如果是两张 3090,效果会更好一点。

    文本大模型说完,我们再说音视频本地部署。 ComfyUI 无论是你跑 Wan、LTX 去做数字人,还是跑 Minimax H3 来做这个短视频,讲实话,现在这个云端 API 还是太贵了,而且有这个废片存在,这个会进一步增加成本。在这种情况下,你如果能够花个两三万块钱,甚至更贵的钱去部署这个 4090 48G,或者说是 RTX Pro 5000、6000,它的性价比我认为是可以的。

    当然 RTX Pro 6000 有点太贵了。就是起码我认为 4090 48G 和 RTX Pro 5000 这两张显卡,如果你有大量的视频生成需求的话,它们的性价比还是非常高的。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    1
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • terryT 在线
        terryT 在线
        terry
        超级版主
        编写于 最后由 编辑
        #3

        时间搞错了,16点发布

        油管:https://www.youtube.com/@抡锤者

        1 条回复 最后回复
        0

        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

        有了你的建议,这篇帖子会更精彩哦 💗

        注册 登录
        回复
        • 在新帖中回复
        登录后回复
        • 从旧到新
        • 从新到旧
        • 最多赞同


        • 登录

        • 登录或注册以进行搜索。
        • 第一个帖子
          最后一个帖子
        0
        • 版块
        • 最新
        • 标签
        • 热门
        • 用户
        • 群组