跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. 随便聊聊
  4. 小白熬夜瞎折腾、瞎写,后期补齐验收报告,请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻

小白熬夜瞎折腾、瞎写,后期补齐验收报告,请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻

已定时 已固定 已锁定 已移动 随便聊聊
8 帖子 3 发布者 82 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Magic629M 离线
    Magic629M 离线
    Magic629
    编写于 最后由 编辑
    #1

    一、部署
    1、硬件与系统环境
    9b4d56d2-e412-4b8c-9490-6c36da8c9683-image.jpeg

    2、部署基础资料
    97149613-2e17-4542-aa70-6be8842dfbdd-image.jpeg

    3、显存依据
    ce8f5c7f-b882-4cf3-b273-8afed14bbc30-image.jpeg

    4、部署方案
    1.)Docker方式(首选,完全不懂系统ROCm7.2.4)
    4b7fb593-9b4f-4e31-98ab-2e3c06b959d2-image.jpeg

    pip方式(备选:需Python3.14虚拟环境)
    b1d0d2a6-8ac2-4e23-8bcd-ae67fc5ad30a-image.jpeg

    2.)Ollama / llama.cpp(单用户 / 桌面体验)
    fc268483-159b-4b1f-bf3d-b54d66be4289-image.jpeg

    3.)LM Studio(图形界面速开)
    c527e89e-06a9-4d59-806b-a581ea682574-image.jpeg

    5、 性能预期
    7b604f5b-9ef7-42ad-b8a5-b99a26aa1e95-image.jpeg

    6、本机的特定事项
    e34020d6-8d0a-4d6c-9a52-e42e51aedac2-image.jpeg

    二、本机四项硬指标定制的最终方案

    1、 单用户使用:单用户 decode 是纯显存带宽瓶颈,正是 llama.cpp 系最擅长的场景。

    2、 128K+ 上下文:32GB 正好是社区公认「长上下文 + MTP + 视觉」全都要的起点档。

    3、 ≥30 t/s:短/中上下文(≤64K)轻松 40~55 t/s;128K 全程填满时约 25~35 t/s,属R9700 的 640 GB/s 带宽物理上限决定的临界区,须靠 MTP 与量化压线。

    4、稳定 + 准确:关键在量化档位 + reasoning effort + 采样温度三个设置

    三、 关键数字分析
    310954d5-e44c-40bd-8e90-24a2c4c543bb-image.jpeg

    四、搭建步骤

    ① 环境保持

    保持 amdgpu.runpm=0(已修复的 SMU 挂起问题,是长期稳定运行的命根子)

    rocm-smi --showproductname # 确认显示 gfx1201

    ② 编译 llama.cpp(ROCm 7.2.4 直接可用)
    git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp
    cmake -B build -DGGML_HIP=ON -DAMDGPU_TARGETS=gfx1201 -DCMAKE_BUILD_TYPE=Release
    cmake --build build -j20

    兜底:官方 AMD 实测 51.8 t/s 就是用 Vulkan 后端跑的;HIP 编译遇阻时,直接下官方预编译 Vulkan 版二进制同样达标。

    ③ 下载模型
    huggingface-cli download unsloth/Qwen3.8-27B-GGUF UD-Q5_K_XL.gguf
    --local-dir /home/magicz890/models/qwen3.8 (我的部署文件夹)

    备选:AtomicChat/Qwen3.8-27B-GGUF 的 AD-Q5_K_M(20.2GB,质量再高半档)

    需视觉:加下 DhruvalLabs 的 mmproj

    ④ 启动服务(核心参数全在这条命令里)

    ./build/bin/llama-server
    -m /home/magicz890/models/qwen3.8/Qwen3.8-27B-UD-Q5_K_XL.gguf
    -c 131072 \ # 128K 上下文
    -ctk q8_0 -ctv q8_0 \ # KV 缓存量化:省一半显存+提速,质量几乎无损
    --spec-type draft-mtp \ # ★ MTP 投机解码(对应 LM Studio 的 MTP=2),必开
    -fa on \ # FlashAttention:长上下文提速关键
    -lm none \ # 对应 LM Studio 的「取消勾选 Try mmap」,权重钉死显存
    --reasoning-effort medium \ # ★ 控制思考链长度,省上下文+提速+不掉质量
    -ngl all \ # 全部层进显存
    -np 1 \ # 单用户 1 个槽位,KV 池全归你
    --temp 0.4 --top-p 0.9 \ # 低温采样:准确度↑ + MTP 草稿接受率↑(双重提速)
    --host 127.0.0.1 --port 8080

    ⑤ 网页前端 + 开机自启
    docker run -d --name open-webui --restart unless-stopped -p 3000:8080
    -e OPENAI_API_BASE_URL=http://127.0.0.1:8080/v1
    -e OPENAI_API_KEY=dummy
    -v open-webui:/app/backend/data
    ghcr.io/open-webui/open-webui:main

    systemd 单元( /etc/systemd/system/qwen38.service )要点: User=magicz890 、 ExecStart=上述完整命令 、Restart=on-failure 、 RestartSec=5 。

    ⑥ 部署后验收
    ./build/bin/llama-bench -m 模型路径 -c 8192 -n 64 # 先看短上下文速度
    rocm-smi # 跑推理时盯着 GPU 频率,确认没卡在 idle 时钟

    五、速度预期
    9e68a1c6-1ec8-4d27-bdcb-e2aa5b1b9f2f-image.jpeg

    六、 准确度保障清单(按重要性排序)
    a6ddf4b3-4b74-42cb-a67e-9845e38c1b5c-image.jpeg

    七、7 稳定性保障清单(RDNA4 两个已知坑均已规避)
    a155efd9-9eb3-49e0-8845-c75ba2e4f278-image.jpeg

    八、关于 256K 上下文的说明
    917f61d3-a138-4db7-8cc9-5e1c6b4bbeb6-image.jpeg

    九、注意事项
    bb71f757-8da3-4fe6-9401-648ff43fd8e1-image.jpeg

    三、 多模态(视觉)方案
    1、知识点
    9ec83683-849a-43a9-800c-a3a7f8d36ebf-image.jpeg

    2、工作原理与显存账
    7d933919-34f5-4ef1-930f-17ca59fb404c-image.jpeg

    结论:视觉不用降量化档,Q5_K_M 主力地位不变;只有 Q6_K 因余量不足被排除。

    3、下载

    DhruvalLabs 的 VLM 版 GGUF 仓库(主权重 + mmproj 配套,官方架构同源)

    huggingface-cli download DhruvalLabs/Qwen3.8-27B-GGUF
    Qwen3.8-27B-Q5_K_M.gguf Qwen3.8-27B-mmproj-f16.gguf
    --local-dir /home/magicz890/models/qwen3.8
    mmproj 必须与主权重配套(同一仓库、同一架构),不同作者混用会导致图像输出乱码或崩溃。

    4、 最终启动命令
    ./build/bin/llama-server
    -m /home/magicz890/models/qwen3.8/Qwen3.8-27B-Q5_K_M.gguf
    --mmproj /home/magicz890/models/qwen3.8/Qwen3.8-27B-mmproj-f16.gguf \ # ★ 视觉投影
    -c 131072 \ # 128K 上下文
    -ctk q8_0 -ctv q8_0 \ # KV 缓存量化
    --spec-type draft-mtp \ # MTP 投机解码(必开)
    -fa on \ # FlashAttention
    -lm none \ # 权重钉死显存
    --reasoning-effort medium \ # ★ 思考强度(默认 xhigh,必须压)
    -ngl all -np 1 \ # 全层进显存、单槽位
    --temp 0.4 --top-p 0.9 \ # 低温采样(图像 OCR/图表理解也受益)
    --host 127.0.0.1 --port 8080
    懒人方式: --hf-repo DhruvalLabs/Qwen3.8-27B-GGUF:Q5_K_M 会自动下载主权重和 mmproj(llama-server 内置支持)。

    5、使用方式
    ① Open WebUI(推荐,零成本)
    OpenAI 兼容接口原生支持 image_url ,对话框直接拖图上传即可:OCR、图表分析、截图问 bug 都能用。

    ② 直接调 API
    curl http://127.0.0.1:8080/v1/chat/completions
    -H "Content-Type: application/json"
    -d '{
    "model": "qwen3.8",
    "messages": [{
    "role": "user",
    "content": [
    {"type": "text", "text": "这张电路图里有什么问题?"},
    {"type": "image_url", "image_url": {"url": "data:image/png;base64,<BASE64>"}}
    ]
    }]
    }'

    ③ 视频
    模型本身支持小时级长视频,但 llama.cpp 对该模型的视频采样支持属于前沿(官方长视频建议走 vLLM/
    SGLang 调 video_preprocessor_config )。建议:图片路线先用 llama.cpp 主力,有长视频刚需再单独起官方vLLM 容器。

    6、 多模态场景注意事项
    1)图像 tokens 计入 128K 预算:连续贴图的长对话比纯文本更快填满上下文,控制单轮贴图数量;
    reasoning-effort medium 在此更重要(省下的思考长度就是图像空间)。
    2)默认思考强度是 xhigh:不设 --reasoning-effort 会「雷霆大思考」烧掉几十 K 上下文;medium 是底
    线,图多时用 low;也可透传 chat_template_kwargs: {"enable_thinking": true, "reasoning_effort":"medium"} 。
    3)低温采样对视觉任务同样重要:OCR/图表/数学题在 temp 0.3~0.5 下准确率明显更高,还顺带提高 MTP 草稿接受率。
    4)别上 Q6_K 开视觉:余量只有 ~2GB,多图并发容易 OOM;Q5_K_M 是视觉场景的天花板档。
    5)KV 缓存保持 q8_0:图像 tokens 会进 KV,q4_0 对长文档/图表问答有可测退化。
    6)MTP 与视觉无冲突:32GB 档验证过「视觉+MTP+128K」同开;个别版本 mmproj 报错时优先升级最新llama.cpp(RDNA4 修复一直在进)。

    7、最终档位表
    051a2133-c927-42bd-9fd1-4ff94b2d3ed7-image.jpeg

    8、本机硬件参考
    93675211-6a6c-43ba-a78d-789c188a50b3-image.jpeg

    四、验收

    1、总结:直接走「llama.cpp HIP 自编译 + DhruvalLabs Q5_K_M + mmproj + MTP(=2) + KVq8_0 + FlashAttention + 128K + reasoning-effort medium + 低温采样(temp
    0.3)」, 前端 Open WebUI,systemd 常驻——这是针对「单用户、128K+、≥30 t/
    s、稳定准确、多模态」全部需求、 在 R9700 32GB 上经过社区实测验证并已在本机实
    测复核的最优组合; 128K 填满时的速度临界点按「压线四招」处理。

    2、需求对标
    02110a97-69e6-41c4-8e7f-50ad4d4055a6-image.jpeg

    3、快照
    a366aefd-998e-4956-bcc0-1ee86aafbf65-image.jpeg

    1 条回复 最后回复
    1
    • Magic629M 离线
      Magic629M 离线
      Magic629
      编写于 最后由 编辑
      #2

      第一张图贴错了,我现在用的系统是Ubuntu24.04,不好意思,现在不知道还能修改不?目前使用比Win11运行中Token输出快10%-15%。

      terryT 1 条回复 最后回复
      0
      • Magic629M Magic629

        第一张图贴错了,我现在用的系统是Ubuntu24.04,不好意思,现在不知道还能修改不?目前使用比Win11运行中Token输出快10%-15%。

        terryT 离线
        terryT 离线
        terry
        超级版主
        编写于 最后由 编辑
        #3

        @Magic629 自己的帖子不能修改吗?发帖之后可以修改的吧。只要没超时。另外你不用赌钱拿不发截图啊,你复制让AI整理成markdown就可以了。跑的时候有些日志,实拍显卡之类的,才需要图片。

        油管:https://www.youtube.com/@抡锤者

        Magic629M J 3 条回复 最后回复
        0
        • terryT terry

          @Magic629 自己的帖子不能修改吗?发帖之后可以修改的吧。只要没超时。另外你不用赌钱拿不发截图啊,你复制让AI整理成markdown就可以了。跑的时候有些日志,实拍显卡之类的,才需要图片。

          Magic629M 离线
          Magic629M 离线
          Magic629
          编写于 最后由 编辑
          #4

          @terry 好的,我慢慢学习补充,感谢特哥指正。

          1 条回复 最后回复
          0
          • terryT terry

            @Magic629 自己的帖子不能修改吗?发帖之后可以修改的吧。只要没超时。另外你不用赌钱拿不发截图啊,你复制让AI整理成markdown就可以了。跑的时候有些日志,实拍显卡之类的,才需要图片。

            Magic629M 离线
            Magic629M 离线
            Magic629
            编写于 最后由 编辑
            #5

            @terry 好的特哥,我在研究研究,后期补图。

            1 条回复 最后回复
            0
            • terryT terry

              @Magic629 自己的帖子不能修改吗?发帖之后可以修改的吧。只要没超时。另外你不用赌钱拿不发截图啊,你复制让AI整理成markdown就可以了。跑的时候有些日志,实拍显卡之类的,才需要图片。

              J 离线
              J 离线
              johnnybegood
              劳动模范 技术大牛
              编写于 最后由 johnnybegood 编辑
              #6

              @terry 这位道友可能碰到了跟我一样的问题, 发帖后我的时间显示是“8小时后”, 不知道为啥, 应该是时区的问题, 所以刚发完贴, 只能等8小时之后才能修改帖子, 因为“不能修改还未发表的帖子” (未来的帖子)。

              Magic629M terryT 2 条回复 最后回复
              0
              • J johnnybegood

                @terry 这位道友可能碰到了跟我一样的问题, 发帖后我的时间显示是“8小时后”, 不知道为啥, 应该是时区的问题, 所以刚发完贴, 只能等8小时之后才能修改帖子, 因为“不能修改还未发表的帖子” (未来的帖子)。

                Magic629M 离线
                Magic629M 离线
                Magic629
                编写于 最后由 编辑
                #7

                @johnnybegood 🤝 🤝 🤝

                1 条回复 最后回复
                0
                • J johnnybegood

                  @terry 这位道友可能碰到了跟我一样的问题, 发帖后我的时间显示是“8小时后”, 不知道为啥, 应该是时区的问题, 所以刚发完贴, 只能等8小时之后才能修改帖子, 因为“不能修改还未发表的帖子” (未来的帖子)。

                  terryT 离线
                  terryT 离线
                  terry
                  超级版主
                  编写于 最后由 编辑
                  #8

                  @johnnybegood 时区卡BUG了。

                  油管:https://www.youtube.com/@抡锤者

                  1 条回复 最后回复
                  0

                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                  有了你的建议,这篇帖子会更精彩哦 💗

                  注册 登录
                  回复
                  • 在新帖中回复
                  登录后回复
                  • 从旧到新
                  • 从新到旧
                  • 最多赞同


                  • 登录

                  • 登录或注册以进行搜索。
                  • 第一个帖子
                    最后一个帖子
                  0
                  • 版块
                  • 最新
                  • 标签
                  • 热门
                  • 用户
                  • 群组