跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 单3090Ti(三风扇版本)跑Qwen3.8-27B,llama.cpp和NInfer对比

单3090Ti(三风扇版本)跑Qwen3.8-27B,llama.cpp和NInfer对比

已定时 已固定 已锁定 已移动 LLM讨论区
rtx3090llama.cppninfer
8 帖子 2 发布者 203 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • J
    J
    joker_chang
    德高望重 劳动模范
    编写于 最后由 joker_chang 编辑
    #1

    在看了论坛中大佬的帖子,
    自己在X99洋垃圾+3090Ti上做了测试:
    第一轮:llama.cpp加载Unsloth的Qwen3.8-27B_q4_k_m.gguf
    第二轮:Ninfer-3090加载默认的v2版本模型https://huggingface.co/neroued/Qwen3.8-27B-NInfer/resolve/main/qwen3_8_27b.ninfer

    这里有一个坑,不能用download-qwen38.bat直接下,默认会下v3版本,这个版本和Ninfer-0.6.1windows版不兼容。

    用Hermes agent完成我自己的日常任务的日志做对比分析,上结论:
    0acab8bf-30b2-4f39-8819-517c18579155-image.jpeg

    1 条回复 最后回复
    1
    • J
      J
      joker_chang
      德高望重 劳动模范
      编写于 最后由 编辑
      #2

      补充一个我的发现:在windows10操作系统上,ninfer-serve.exe比llama-server占用的物理内存少很多。

      在其他应用不变的情况下,我用llama-server加载模型后,物理内存超过50GB;而用ninfer-serve.exe加载模型后的物理内存不到30GB。

      1 条回复 最后回复
      0
      • J
        J
        joker_chang
        德高望重 劳动模范
        编写于 最后由 joker_chang 编辑
        #3

        一轮33 个请求的较长任务执行情况:

        image.jpeg

        总体上提升很多,但是在MTP 3 投机解码表现我不太满意:

        image.jpeg

        计划MTP设置成2再试试。

        1 条回复 最后回复
        0
        • J
          J
          joker_chang
          德高望重 劳动模范
          编写于 最后由 编辑
          #4

          验证完了:

          image.jpeg

          1 条回复 最后回复
          0
          • J
            J
            joker_chang
            德高望重 劳动模范
            编写于 最后由 编辑
            #5

            典型的长上下文 agent 工具调用任务

            image.jpeg

            image.jpeg

            DeepSeek总结的问题:
            1、内存余量极小,free-after-startup=131 MiB,headroom=0,风险高。
            2、full_reset 冷启动长上下文非常慢:120K prompt TTFT 约 168 秒。
            3、缓存检查点不够新,后期 cache 停在 74,659,导致增量 prefill 仍要 60~80 秒。
            4、单并发串行,长任务总延迟会累积。
            5、独立小请求/探针请求可能触发 full_reset,打断长会话缓存,进一步拉高后续 TTFT。

            1 条回复 最后回复
            0
            • PrioP
              PrioP
              Prio
              编写于 最后由 编辑
              #6

              NInfer好像容易陷入循环思考。对了,你的方案可以打包分享一下不。

              J 1 条回复 最后回复
              0
              • PrioP Prio

                NInfer好像容易陷入循环思考。对了,你的方案可以打包分享一下不。

                J
                J
                joker_chang
                德高望重 劳动模范
                编写于 最后由 joker_chang 编辑
                #7

                @Prio https://github.com/Don-Chad/ninfer-3090这个项目的预编译包NInfer-3090 v0.6.1(https://github.com/Don-Chad/ninfer-3090/releases)

                启动脚本就是改了包中的bat文件,参数如下:
                --max-context 163840 --kv-capacity 163840 --max-concurrency 1 --max-pending-requests 2 --pending-timeout-ms 5000 --prefill-chunk 1024 --kv-dtype int8 --spec mtp --draft-tokens 3

                唯一的坑就是:
                HF 仓库 main 分支 9/15 被更新为 v3 版,v2 版(16.96GiB)在 8/19 的 commit 18dfc887423f,已验证该 commit 的 SHA256SUMS 与官方 model card 完全一致:eec39564...b80199514bf3e
                NInfer-3090 v0.6.1能使用的正确版本模型要下载这个:【https://hf-mirror.com/neroued/Qwen3.8-27B-NInfer/resolve/18dfc887423fa5aabf3cb56fac41490e462b3fab/qwen3_8_27b.ninfer】

                对了补充一句,unsloth的版本Hermes agent经常出现死循环,但是NInfer版本我从开始用到现在,还真没遇到过之前的死循环。

                PrioP 1 条回复 最后回复
                0
                • J joker_chang

                  @Prio https://github.com/Don-Chad/ninfer-3090这个项目的预编译包NInfer-3090 v0.6.1(https://github.com/Don-Chad/ninfer-3090/releases)

                  启动脚本就是改了包中的bat文件,参数如下:
                  --max-context 163840 --kv-capacity 163840 --max-concurrency 1 --max-pending-requests 2 --pending-timeout-ms 5000 --prefill-chunk 1024 --kv-dtype int8 --spec mtp --draft-tokens 3

                  唯一的坑就是:
                  HF 仓库 main 分支 9/15 被更新为 v3 版,v2 版(16.96GiB)在 8/19 的 commit 18dfc887423f,已验证该 commit 的 SHA256SUMS 与官方 model card 完全一致:eec39564...b80199514bf3e
                  NInfer-3090 v0.6.1能使用的正确版本模型要下载这个:【https://hf-mirror.com/neroued/Qwen3.8-27B-NInfer/resolve/18dfc887423fa5aabf3cb56fac41490e462b3fab/qwen3_8_27b.ninfer】

                  对了补充一句,unsloth的版本Hermes agent经常出现死循环,但是NInfer版本我从开始用到现在,还真没遇到过之前的死循环。

                  PrioP
                  PrioP
                  Prio
                  编写于 最后由 编辑
                  #8

                  @joker_chang 我遇到过泰文思考的时候死循环,而且概率还是80%左右,有时候处理多语言还是不太方便

                  1 条回复 最后回复
                  0

                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您下次访问时都将自动回到上次浏览的位置,并可选择接收新回复的通知(通过电子邮件或推送通知)。您还可以收藏帖子、为帖子点赞,以此向其他社区成员表达您的感谢。

                  有了你的建议,这篇帖子会更精彩哦 💗

                  注册 登录
                  回复
                  • 在新帖中回复
                  登录后回复
                  • 从旧到新
                  • 从新到旧
                  • 最多赞同


                  • 登录

                  • 登录或注册以进行搜索。
                  • 第一个帖子
                    最后一个帖子
                  0
                  • 版块
                  • 最新
                  • 标签
                  • 热门
                  • 用户
                  • 群组