跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型(160K,F16 KV CACHE?)

RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型(160K,F16 KV CACHE?)

已定时 已固定 已锁定 已移动 LLM讨论区
rtx3090量化qwen
5 帖子 4 发布者 248 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • stxpnetS 离线
    stxpnetS 离线
    stxpnet
    超凡大师
    发表于 最后由 stxpnet 编辑
    #1

    没买到第二张RTX 3090 (全新的要1万,黑猛禽也要9300),那就慢慢看吧。
    这两天顺便折腾了一下,把P100 16G放在第二个PCIE上面跟3090做 8X/8X拆分,拆分是拆分了,但是也跑不起来。
    最后索性把视觉塔卸载到P100上面,3090里面全部放权重。160K上下文+Q8 KVCACHE就这样跑着吧。

    6d93fd0d-6803-4c87-9ba2-d44ef58de346-image.jpeg
    今天逛X的时候有个新发现,眼前一亮。号称12G权重,另一个X用户说双F16 都可以跑,这也过于逆天了吧。 以下是那个实验室自己发布的评测数据:
    34557350-183a-481c-84c8-1f203799cf06-image.jpeg

    8b60ddbe-4b01-453b-bb7d-ce702772493a-image.jpeg

    另一个X用户发表的,F16 KV CACHE,164K上下文:
    53d22689-62b6-4f24-b017-bca24316eea1-image.jpeg

    按它这种算法 ,那RTX 4090 48G不得跑上480K上下文?

    首先从hf-mirror.com,依然无法下载,依然是xet问题,看来我大天朝还没人下载过这模型。
    然后modelscope居然已经有了(https://modelscope.cn/models/EschaLabs/Qwen3.6-35B-A3B-Escha-W2 https://huggingface.co/EschaLabs/escha-runtime-qwen3moe 可以把这两个URL丢 给HERMES,给它30G硬盘空间,然后坐等开玩),我让hermes自己折腾了 半小时:

    b53766ce-c896-4b68-a740-2703de90346a-image.jpeg
    安装阶段都是qwen 3.6 35b a3b搞掂的,后来有CUDA 13与CUDA 12.9的兼容性问题,切来切去太麻烦,就deepseek v4 flash搞掂的。
    赶紧开玩:
    ceb1cb97-5936-41da-a3b9-bfc940bc096f-image.jpeg
    起始有135左右,过了一会儿掉到了110多。 没有WEBUI还真不习惯,先拉个openwebui的镜像试试。

    tooleval 分数,掉分全部掉在了预填充上面:
    87431eef-cef1-4e1c-9eba-8c03b9a3b800-image.jpeg

    26-08-19
    双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
    8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

    J 1 条回复 最后回复
    0
    • stxpnetS 离线
      stxpnetS 离线
      stxpnet
      超凡大师
      发表于 最后由 stxpnet 编辑
      #2

      bce4c408-7a04-45b5-b294-79443ec7c927-image.jpeg
      WEBUI写出来的坦克大战,挺惊艳的,但是一动就卡死了。

      用hermes调用 它写出来的超级玛丽,画面相对惊艳,但是依旧进游戏之后,卡死动不了。感觉循环很严重:
      3adaba03-3098-4182-8ab0-3309d6f4fc13-image.jpeg

      另外这个模型需要单独的运行时和可执行程序,reddit有人质疑存在恶意软件风险:
      64b690ec-00dc-4bac-bd7d-d7e1426097cb-image.jpeg

      一句话总结:有一定潜力,但不多,给我的感觉很像那个bonsai 27B,可以留足够大的空间给K V CACHE,但感觉总差点意思,很可能是原始权重与 k/v cache之间量化等级差异过大(权重约2-3BPW,K V CACHE却是Q8-F16等级) 。
      缺点:1.没有视觉。 我还是回到我的初始方案。甚至让我想测一测UNSLOTH的Q3KM MTP的效果。
      2.可执行文件是闭源的,有恶意软件风险,没把握的要在关掉之前让HERMES自己排查一下系统,晚上睡觉关机。

      26-08-19
      双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
      8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

      1 条回复 最后回复
      1
      • 5 离线
        5 离线
        566656661
        超凡大师
        发表于 最后由 编辑
        #3

        要特意用自家東西的時候已經要打上一個大問號了

        1 条回复 最后回复
        1
        • terryT 离线
          terryT 离线
          terry
          超级版主
          发表于 最后由 编辑
          #4

          2比特这些都是垃圾,不具备可用性。黑盒存在不值得尝试,一秒钟都不值得浪费。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          1
          • stxpnetS stxpnet

            没买到第二张RTX 3090 (全新的要1万,黑猛禽也要9300),那就慢慢看吧。
            这两天顺便折腾了一下,把P100 16G放在第二个PCIE上面跟3090做 8X/8X拆分,拆分是拆分了,但是也跑不起来。
            最后索性把视觉塔卸载到P100上面,3090里面全部放权重。160K上下文+Q8 KVCACHE就这样跑着吧。

            6d93fd0d-6803-4c87-9ba2-d44ef58de346-image.jpeg
            今天逛X的时候有个新发现,眼前一亮。号称12G权重,另一个X用户说双F16 都可以跑,这也过于逆天了吧。 以下是那个实验室自己发布的评测数据:
            34557350-183a-481c-84c8-1f203799cf06-image.jpeg

            8b60ddbe-4b01-453b-bb7d-ce702772493a-image.jpeg

            另一个X用户发表的,F16 KV CACHE,164K上下文:
            53d22689-62b6-4f24-b017-bca24316eea1-image.jpeg

            按它这种算法 ,那RTX 4090 48G不得跑上480K上下文?

            首先从hf-mirror.com,依然无法下载,依然是xet问题,看来我大天朝还没人下载过这模型。
            然后modelscope居然已经有了(https://modelscope.cn/models/EschaLabs/Qwen3.6-35B-A3B-Escha-W2 https://huggingface.co/EschaLabs/escha-runtime-qwen3moe 可以把这两个URL丢 给HERMES,给它30G硬盘空间,然后坐等开玩),我让hermes自己折腾了 半小时:

            b53766ce-c896-4b68-a740-2703de90346a-image.jpeg
            安装阶段都是qwen 3.6 35b a3b搞掂的,后来有CUDA 13与CUDA 12.9的兼容性问题,切来切去太麻烦,就deepseek v4 flash搞掂的。
            赶紧开玩:
            ceb1cb97-5936-41da-a3b9-bfc940bc096f-image.jpeg
            起始有135左右,过了一会儿掉到了110多。 没有WEBUI还真不习惯,先拉个openwebui的镜像试试。

            tooleval 分数,掉分全部掉在了预填充上面:
            87431eef-cef1-4e1c-9eba-8c03b9a3b800-image.jpeg

            J 离线
            J 离线
            joker_chang
            德高望重 劳动模范
            编写于 最后由 编辑
            #5

            @stxpnet 说:

            没买到第二张RTX 3090 (全新的要1万,黑猛禽也要9300)

            我就不信还能买到全新的......

            1 条回复 最后回复
            1

            你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

            厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

            有了你的建议,这篇帖子会更精彩哦 💗

            注册 登录
            回复
            • 在新帖中回复
            登录后回复
            • 从旧到新
            • 从新到旧
            • 最多赞同


            • 登录

            • 登录或注册以进行搜索。
            • 第一个帖子
              最后一个帖子
            0
            • 版块
            • 最新
            • 标签
            • 热门
            • 用户
            • 群组