跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 7900XTX+Qwen 3.8 27B Q4 + DeepSeek Harness 实测

7900XTX+Qwen 3.8 27B Q4 + DeepSeek Harness 实测

已定时 已固定 已锁定 已移动 AI硬件
7900xtxqwen-27bdeepseek
8 帖子 5 发布者 721 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Phuong NgoP 离线
    Phuong NgoP 离线
    Phuong Ngo
    编写于 最后由 编辑
    #1

    我的配置

    项目 配置
    系统 Ubuntu 26.04 LTS
    CPU i5-12600KF
    内存 32 GB
    显卡 AMD RX 7900 XTX 24G
    推理后端 llama.cpp
    模型 Qwen 3.8 27B,Q4_K_M 量化
    Agent 框架 DeepSeek Harness(@deepseek-ai/dsh v0.1.0-rc.6)

    模型文件约 16G,24G 显存能全部塞进 GPU

    速度实测

    场景 输入长度 输出 token 首字延迟 生成速度
    简单问答 67 tok 128 0.29s 33.4 tok/s
    写代码 127 tok 512 0.15~0.31s 33.0 tok/s
    长文档问答(9K 上下文) 9,392 tok 160 0.17~0.22s 29 tok/s
    冷启动预填充(2.8K 新提示) 2,815 tok — 4.25s ~663 tok/s

    具体让它干了什么

    手上有一个电机工程的技能包(一个 .skill 文件,里面是算法脚本),功能是把电机 MAP 长表转成四象限二维 Lookup Table,给 MATLAB/Simulink 用。

    任务是:把它工程化成一个符合 MCP 规范的 Server,让 Claude Desktop、Cursor、Kimi 这些支持 MCP 的客户端都能直接调用。它自己用了快20分钟,生成了交付物,我测了一下,效果确实是我想要的效果,看起来实现的非常不错。它自己开发,测试脚本自己写自己测,整个流程都是它自己在优化,全程没有在指导过什么。
    总结:非常好用,能力很强的稠密模型再加上harness工程,确实是一把干活的利器。

    1 条回复 最后回复
    0
    • terryT 离线
      terryT 离线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      有实测截图吗,挺有意思的,速度还挺快的

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • Phuong NgoP 离线
        Phuong NgoP 离线
        Phuong Ngo
        编写于 最后由 编辑
        #3

        这个截图到没有,晚上快快的部署了,用了用,qwen3.8 27B的思考链太长了,有时候还会重头思考,3.6 27B好像没有出现过这个问题。上面那个任务它跑了20多分钟。花在思考上的时间非常多,明天准备把思考链关了试试,看看输出有没有太大区别。

        1 条回复 最后回复
        0
        • wwcd2016W 离线
          wwcd2016W 离线
          wwcd2016
          编写于 最后由 编辑
          #4

          这玩意直接下载。然后把模型名字一改。跑起来 和原来的3.6 没有感觉有变化。

          1 条回复 最后回复
          0
          • wwcd2016W 离线
            wwcd2016W 离线
            wwcd2016
            编写于 最后由 编辑
            #5

            日常改个程序,驱动hermes ,还是qwen35b的那种更丝滑。

            1 条回复 最后回复
            0
            • E 离线
              E 离线
              ezios
              德高望重
              编写于 最后由 编辑
              #6

              rocm看来和cuda还是有差距

              最近开始玩LLM和COMFYUI
              手头只有RTX4060

              考虑购入RTX2080TI22G娱乐一下

              1 条回复 最后回复
              0
              • V 离线
                V 离线
                vosrock
                德高望重 劳动模范
                编写于 最后由 vosrock 编辑
                #7

                最近35B感觉又行了,之前测试用了Q4量化,最近发现实际上用Q8量化也是可以跑的,就是速度慢点,而且KV量化也可以用Q80,甚至不做KV量化,这样比原来测试的时候精度提高不少

                1 条回复 最后回复
                0
                • V 离线
                  V 离线
                  vosrock
                  德高望重 劳动模范
                  编写于 最后由 编辑
                  #8

                  实测了,35B还是不行,老老实实用27B了

                  1 条回复 最后回复
                  0

                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                  有了你的建议,这篇帖子会更精彩哦 💗

                  注册 登录
                  回复
                  • 在新帖中回复
                  登录后回复
                  • 从旧到新
                  • 从新到旧
                  • 最多赞同


                  • 登录

                  • 登录或注册以进行搜索。
                  • 第一个帖子
                    最后一个帖子
                  0
                  • 版块
                  • 最新
                  • 标签
                  • 热门
                  • 用户
                  • 群组