跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
S

sospda

@sospda
德高望重
取消关注 关注
关于
帖子
43
主题
7
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • R9700的速度还是挺好的,单发170,双并发180
    S sospda

    @kos-or 说:

    @sospda

    可以試試Ornith-1.5-35B
    速度飛快 也差不多 100~200 tok/s
    但橫衝亂撞 閃電俠 😁

    我受不了 就讓Codex-SOL harness 它一下
    品質有變好

    其实是想再要点品质, 速度感觉够快了,

    一直在找有没好用的A4B,A5B的模型,

    27B质量不错,就是速度差点意思。

    不知道有没有3.8 35B A3B ,提高点生成质量

    AI硬件 r9700 多卡部署

  • R9700的速度还是挺好的,单发170,双并发180
    S sospda

    看使用目的, 35b胜在速度快, 27b也在用,写小程序用,大程序都是用的deepseek

    AI硬件 r9700 多卡部署

  • R9700的速度还是挺好的,单发170,双并发180
    S sospda

    从字体应该能看出来,是windows, 都是Q5版本, 不过35B的 kv cache都改成了Q4, 之前并发会爆,改小了

    AI硬件 r9700 多卡部署

  • R9700的速度还是挺好的,单发170,双并发180
    S sospda

    Qwen3.8 27B ,单发54tok/s, 双发工63tok/s, 都是稳定工作值

    333.PNG

    444.PNG

    AI硬件 r9700 多卡部署

  • R9700的速度还是挺好的,单发170,双并发180
    S sospda

    Qwen3.6 35B A3B MTP,
    111.PNG

    222.PNG

    AI硬件 r9700 多卡部署

  • 24B左右的模型推荐,其实没必要删帖,本来就是讨论,不讨论怎么分得出对错好坏
    S sospda

    型 类型 等效 / 真实规模 Q4 体积 核心最强场景 ROCm 速度 tok/s
    GLM-4.7-FlashX MoE 27B(24 + 档) 16.5GB 代码、Agent、多并发商用 33~42
    Qwen3.6-27B 稠密 27B 纯稠密 17GB 中文数理、图文、论文精读 16~22
    DeepSeek-V2-Lite 24B 稠密 标准 24B 16.2GB 数学、算法、编程刷题 22~28
    Qwen3.5-35B-A3B MoE 24~26B 21.2GB 超长文档、外文翻译、图文 26~31
    Mistral-Small 24B 稠密 标准 24B 14.8GB 英文、创意写作、高速对话 28~36
    Yi-34B 稠密 等效 25B 19GB 中英双语、海外文献

    LLM讨论区 本地模型

  • 有没有大神折腾windows r9700的?
    S sospda

    折腾了几天放弃了, windows下面可以用vulkan, 用35ba3b的性能还可以,用27b性能下降严重。
    也安装rocm成功, 但是总有各种各样的小毛病,折腾了一阵,累人。
    是直装的,不通过wsl2。 各种修补,发挥不了全力,gpu核心占用只能用到一半左右。
    又退回ubuntu了。

    AI硬件 r9700

  • 双AI Pro R9700 32g,Qwen 3.6 27b q4 KM q8 KV Ubuntu24 Hermes agent
    S sospda

    速度不正常, 用vulkan, mtp可以达到52tok/s, 用rocm 也可以达到45tok/s. 我说的是单卡的情况,双卡不清楚,但是不到20的速度肯定不正常。3.6 27b模型

    LLM讨论区 r9700 ai-pro-r9700 hermes

  • 【交作业】Z390 + 7900XTX,跑vulkan + MTP + 128K上下文,opencode速度33~49tps尚可,但是没人说Qwen3.6 27b MTP不支持视觉啊,换35b-vl-mtp就有视觉了,70~80 tps 快的飞起
    S sospda

    支持视觉 千问3.5以上都支持

    AI硬件 7900xtx mtp open-code

  • 版主7900XTX 24G 蓝宝石 白金版 折腾日记。折腾过程从入手到成功全过程。部分版主个人开发架构分享。
    S sospda

    同一个模型,rocm的v cache还是q4,结果智力反而更高一点。
    不过日常用rocm的tokens速度是比vulkan慢点。

    AI硬件 7900xtx

  • 版主7900XTX 24G 蓝宝石 白金版 折腾日记。折腾过程从入手到成功全过程。部分版主个人开发架构分享。
    S sospda

    用rocm比vulkan聪明一点,7个答案都给出了。计算时间差不多。
    rocm也是q5,但是k q5,v q4

    让我逐步推理:
    五个位置 1-5(从左到右),条件:

    1. A 不在两端 → A ∈ {2,3,4}
    2. B 在 C 左边且不相邻 → B < C,C - B ≥ 2
    3. D 和 E 相邻 → |D - E| = 1
    4. E 不在最右 → E ≠ 5
    5. C 不在最左 → C ≠ 1
      关键推导:
      C 只能在 3 或 5:
      • C=2:B < 2 且 2-B ≥ 2 → B ≤ 0,不可能
      • C=4:B ≤ 2,但无论怎么排,D和E都无法相邻
      • C=5:B ≤ 3,可行
      • C=3:B=1,也可行
      经穷举,共有 7 种满足条件的排列:
      编号 排列
      1 D, E, B, A, C
      2 E, D, B, A, C
      3 B, D, E, A, C
      4 B, E, D, A, C
      5 B, A, D, E, C
      6 B, A, E, D, C
      7 B, A, C, E, D
      结论:题目条件不足以确定唯一顺序。 7 种排列都满足全部 5 个条件。
      如果你确认题目没有遗漏条件,可以告诉我,我帮你再检查一下是否某个条件我理解有误。
    AI硬件 7900xtx

  • 版主7900XTX 24G 蓝宝石 白金版 折腾日记。折腾过程从入手到成功全过程。部分版主个人开发架构分享。
    S sospda

    我的是r9700 ,我用的是Q5 KM

    AI硬件 7900xtx

  • 版主7900XTX 24G 蓝宝石 白金版 折腾日记。折腾过程从入手到成功全过程。部分版主个人开发架构分享。
    S sospda

    deepseek 得出 共7组解:

    | # | 左→右 |
    |:-:|:-----:|
    | 1 | B A C E D |
    | 2 | B D E A C |
    | 3 | B E D A C |
    | 4 | B A D E C |
    | 5 | B A E D C |
    | 6 | D E B A C |
    | 7 | E D B A C |
    

    本地Qwen3.6 b27 得出答案:有三种可能

    1. B A C E D
    2. B A E D C
    3. B E D A C
    

    答案不全,但是没错

    AI硬件 7900xtx

  • R9700到货,AI+Hermes部署llama.cpp+Qwen3.6-27B-Q4_K_M一次成功!
    S sospda

    上MTP版本, Q4KM ,直接上50t/s , 提速明显

    AI硬件 r9700 llama.cpp hermes

  • r9700 32G速度总算达标了,27B MTP,能上50t/s
    S sospda

    好的,谢谢。不同框架都试了,llama,ollama,vllm,lm stduio,然后35b,32b,30b,27b ,然后带MTP,然后q4、q5、q6, 说试了20多个模型感觉说少了,哈哈。一直没时间找测试的软件。自己瞎测一个,感觉不好用的就pass了,也没有调过参数。后面才知道参数对速度影响也挺大的。现在基本确定27b mtp版本的,推理能力和响应速度都不错。

    AI硬件 r9700 mtp

  • r9700 32G速度总算达标了,27B MTP,能上50t/s
    S sospda

    llama不知道有什么标准测试, 都是自己随便跑一下简单测试。如果有标准测试只要时间不是太长,都可以测一下,有个对比。 模型前后换了20多个了,每个都跑很长时间的测试,时间也不允许。

    AI硬件 r9700 mtp

  • r9700 32G速度总算达标了,27B MTP,能上50t/s
    S sospda

    最大功耗限制在280W, 不限制应该还能更高点。 不过性能损失应该很小。

    -c 65536 -ngl 99
    --reasoning auto
    --spec-type draft-mtp --spec-draft-n-max 3
    --flash-attn on
    -ub 512 \

    AI硬件 r9700 mtp

  • r9700 32G速度总算达标了,27B MTP,能上50t/s
    S sospda

    Q4_K_M · 1500 tokens 测试结果

    | 指标        | 值                                 |
    |-------------|------------------------------------|
    | 生成速度    | 53.5 tok/s 🚀                      |
    | 总耗时      | 28.0s                              |
    | MTP 接受率  | 60.8%(1592 draft / 968 accepted) |
    | Prompt 处理 | 115.4 tok/s(prompt cache 命中)   |
    

    2026-06-03 06-47-09屏幕截图.png

    draft=3

    AI硬件 r9700 mtp
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组