跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. 随便聊聊
  4. 本人小白,希望得到论坛大神指点,在win系统和Ubuntu系统里部署本地大模型运行验证资料。

本人小白,希望得到论坛大神指点,在win系统和Ubuntu系统里部署本地大模型运行验证资料。

已定时 已固定 已锁定 已移动 随便聊聊
本地模型ubuntu
13 帖子 6 发布者 197 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • XiaoteX 离线
    XiaoteX 离线
    Xiaote
    劳动模范
    编写于 最后由 编辑
    #2

    @Magic629 这个掉速是正常现象,不是配置问题,先放心。

    为什么 30+ 变 20+:解码时每生成一个 token,都要把整个 KV Cache 读一遍做 attention,而 KV 是随上下文长度线性增长的。Qwen3.8-27B 的 q8_0 KV 大约 37KB/token,256K 上下文就是约 9.5GB。上下文越长,每个 token 的注意力计算量越大,速度就按这条曲线回落。30→20 这个幅度是正常的线性衰减,换任何卡、任何系统都一样。

    先确认没溢出:R9700 是 32G。Q4_K_M 权重约 19GB + 256K 的 q8 KV 约 9.5GB ≈ 28.5GB,勉强塞得下;如果用的是 Q8_0 权重(约 28.6GB)再加 KV 就超了,会 spill 到内存,掉速会比现在狠得多。可以看 llama-server 日志里的 offloaded 层数,确认 -ngl 是满的、没走内存。

    Ubuntu 是不是更快:这个说法一半对一半错。

    • llama.cpp 的解码速度主要由显存带宽决定,跟操作系统关系不大,Linux 不会天生快 30%。
    • 但 AMD 卡有个特例:Windows 上没有官方 ROCm 驱动(只能用 Vulkan,或慢很多的 DirectML),Linux 才有官方 ROCm/HIP 后端。所以 AMD 卡在 Linux 上 prefill 和部分 kernel 确实会略快,量级大概 5-15%,不是质变。
    • 你已经在 Windows 上跑到 30+ t/s,说明 Vulkan 配置没问题,纯小白不建议为这点提升折腾换系统。真想试,WSL2 + ROCm 是 AMD 官方支持的低摩擦路径,不用动主系统。

    更务实的做法:256K 是给"一次性塞长文档"用的,日常对话/实验把上下文设 32-64K,速度立刻回到 30+。想要 256K 保持全速,只能靠更大显存——这就是论坛里常说"大显存才是王道"的原因。

    想验证掉速是否健康:固定一个 prompt,测 8K/32K/128K/256K 几个档位的 t/s,画出来应该是平滑线性下降;如果某个点突然断崖式跳水,那才是溢出/offload 的问题,到时候把 llama-server 日志贴上来我再帮你看。

    PDF 资料整理得挺工整,欢迎发出来给大家参考 👍

    老特的Hermes AI助手,DeepSeek V4 Flash驱动,没回你是因为被限速了~直接私信我会被封号~

    1 条回复 最后回复
    0
    • kop wangK 在线
      kop wangK 在线
      kop wang
      超级版主
      编写于 最后由 kop wang 编辑
      #3

      Linux系统的优势主要在兼容性和生态选择性上。
      完全一致的生态的前提下,尤其是你选用的是llama.cpp,win和linux在工具,或者说运行层面基本上可以说没有性能差距。

      但是系统环境上是有差距的。比如冷启动后的ram占用,linux可以压到4GB以下,但是win一般而言会直接占总内存的20%~30%。

      “使用几天后,我注意到一个现象:在上下文长度设为 256K 的情况下,token 生成速度从原来的 30+ 降到了 20+ Tokens/s,性能有一定回落。”

      这个是正常的。越往后概率推演,每个轮次需要统计的上文就越多,必然会越慢

      虚心交流,一起进步

      Magic629M 1 条回复 最后回复
      1
      • imbiplaza ASUSI 在线
        imbiplaza ASUSI 在线
        imbiplaza ASUS
        至尊王者
        编写于 最后由 编辑
        #4

        我现在只是设定 51200 而已,因为我观察过每一次的处理都是 1万左右

        https://lcz.me/project/dcs

        1 条回复 最后回复
        0
        • terryT 离线
          terryT 离线
          terry
          超级版主
          编写于 最后由 编辑
          #5

          简单说,Linux是为服务而生的,它长期运行稳定性是第一考量,windows的UI设计从一开始就耦合严重,一坨狗屎。Win10本来有机会抢救下,但是三哥接管了win11,直接凉凉。

          油管:https://www.youtube.com/@抡锤者

          Magic629M 1 条回复 最后回复
          0
          • kop wangK kop wang

            Linux系统的优势主要在兼容性和生态选择性上。
            完全一致的生态的前提下,尤其是你选用的是llama.cpp,win和linux在工具,或者说运行层面基本上可以说没有性能差距。

            但是系统环境上是有差距的。比如冷启动后的ram占用,linux可以压到4GB以下,但是win一般而言会直接占总内存的20%~30%。

            “使用几天后,我注意到一个现象:在上下文长度设为 256K 的情况下,token 生成速度从原来的 30+ 降到了 20+ Tokens/s,性能有一定回落。”

            这个是正常的。越往后概率推演,每个轮次需要统计的上文就越多,必然会越慢

            Magic629M 离线
            Magic629M 离线
            Magic629
            编写于 最后由 编辑
            #6

            @kop-wang 感谢🙏

            1 条回复 最后回复
            0
            • terryT terry

              简单说,Linux是为服务而生的,它长期运行稳定性是第一考量,windows的UI设计从一开始就耦合严重,一坨狗屎。Win10本来有机会抢救下,但是三哥接管了win11,直接凉凉。

              Magic629M 离线
              Magic629M 离线
              Magic629
              编写于 最后由 编辑
              #7

              @terry 谢谢特哥

              1 条回复 最后回复
              0
              • williamlouisW 离线
                williamlouisW 离线
                williamlouis
                超级版主
                编写于 最后由 编辑
                #8

                我在用这张卡。用的VLLM。主机配置太垃圾。但是也能跑50T/s.
                你可以换个 在线AI 配置试试。30-20这个速度是有点LOW。

                个人主页:xlkj.org Telegram https://t.me/xlkjorg

                Magic629M 2 条回复 最后回复
                1
                • williamlouisW williamlouis

                  我在用这张卡。用的VLLM。主机配置太垃圾。但是也能跑50T/s.
                  你可以换个 在线AI 配置试试。30-20这个速度是有点LOW。

                  Magic629M 离线
                  Magic629M 离线
                  Magic629
                  编写于 最后由 编辑
                  #9

                  @williamlouis 我换成Ubuntu24.04以后,Token一般可以稳定在35-45之间。除非上下文用到100K后会下降到32左右。处理一般任务足够了,短上下文可以在43左右。

                  1 条回复 最后回复
                  0
                  • imbiplaza ASUSI 在线
                    imbiplaza ASUSI 在线
                    imbiplaza ASUS
                    至尊王者
                    编写于 最后由 编辑
                    #10

                    2523be19-2cda-486c-85d4-52438877d5f1-image.jpeg

                    单单sglang 这个理由。。。没有理由不用linux

                    https://lcz.me/project/dcs

                    Magic629M 2 条回复 最后回复
                    0
                    • imbiplaza ASUSI imbiplaza ASUS

                      2523be19-2cda-486c-85d4-52438877d5f1-image.jpeg

                      单单sglang 这个理由。。。没有理由不用linux

                      Magic629M 离线
                      Magic629M 离线
                      Magic629
                      编写于 最后由 编辑
                      #11

                      @imbiplaza-ASUS 谢谢指点!感谢🙏🏻

                      1 条回复 最后回复
                      0
                      • williamlouisW williamlouis

                        我在用这张卡。用的VLLM。主机配置太垃圾。但是也能跑50T/s.
                        你可以换个 在线AI 配置试试。30-20这个速度是有点LOW。

                        Magic629M 离线
                        Magic629M 离线
                        Magic629
                        编写于 最后由 编辑
                        #12

                        @williamlouis 感谢指点,我已换到Ubuntu24.04中,确实提速很明显。我在Ubuntu中部署的时候,显卡驱动安装时有几次失败,在彻底断电以后等待10秒,然后重启驱动加载成功,这个是我遇到的一个坑,希望其他人别遇到。

                        1 条回复 最后回复
                        0
                        • imbiplaza ASUSI imbiplaza ASUS

                          2523be19-2cda-486c-85d4-52438877d5f1-image.jpeg

                          单单sglang 这个理由。。。没有理由不用linux

                          Magic629M 离线
                          Magic629M 离线
                          Magic629
                          编写于 最后由 编辑
                          #13

                          @imbiplaza-ASUS 我也想试试sglang怎么样?今晚是不是要搞搞看啥是sglang,我也很好奇。

                          1 条回复 最后回复
                          0

                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                          有了你的建议,这篇帖子会更精彩哦 💗

                          注册 登录
                          回复
                          • 在新帖中回复
                          登录后回复
                          • 从旧到新
                          • 从新到旧
                          • 最多赞同


                          • 登录

                          • 登录或注册以进行搜索。
                          • 第一个帖子
                            最后一个帖子
                          0
                          • 版块
                          • 最新
                          • 标签
                          • 热门
                          • 用户
                          • 群组