跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

坤

坤坤

@坤坤
取消关注 关注
关于
帖子
12
主题
3
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • RX7900xtx白金版 24G 跑Qwen3.8-27B Q4_0_ROCMFP4_FAST 模型 单卡60tok/s
    坤 坤坤

    系统:win11
    主板:Gigabyte B560M D2V
    CPU:i7-10700K
    内存:64GB ddr4
    后端:llama.cpp+后编译的rocmFB4版(这个版本我是让ai去调取官方仓库为和这个模型和根据本地配置编译的)

    先说下我的情况,模型第一次冷启动基本2分钟左右,然后初始速度是60tok/s左右
    26f3ec14-7745-4bde-9ba8-75d8ee17e74f-image.jpeg
    这个时候上下文在16k左右
    如果是开着思考的话,那么一次任务的思考,会造成上下文越来越多

    在上下文达到32k左右,那么速度回降到45tok/s
    4c0d4292-9f9b-4aff-bd22-6d78527e0e91-image.jpeg
    如果上下文达到64k左右,那么速度会继续降到30tok/s附近
    54dec9e1-5a6e-4f63-9d0a-aaf1476ddb75-image.jpeg

    我试过用128k上下文,基本模型的上下文达到64k后,速度就稳定在30附近了
    对此,如果是短任务的话只能坐一次然后手动去停掉模型然后重新启动,并且dsh这边要手动压缩上下文

    当然,关掉思考模式的话确实像锤哥说的一样,体感反应速度真的很舒服,单纯聊聊天还是可以的

    我也不想没错开关思考模型都要启动模型一遍,就让它自己加上了网页端可以设置思考或者不思考的选

    任务方面的话我已经测试过了,短任务,比如登录某个网站上去查询数据下来放表格,我工作上的事情已经能做并且完美完成,唯一的确定就是慢。

    思考链又臭又长,我只能交代繁琐重复的任务让他执行,然后我去干别的活,长代码方面我就没试过了,但是根据别的朋友反馈说代码能力很强

    关于这个降速的问题我怀疑是因为思考时候产生的上下文溢出到内存了,才导致速度变慢,我打算看什么时候再收一张7900xtx进行双卡测试,如果真的是这个原因,并且得到解决的话,那我真的不用花钱去订阅了,60tok/s对我来说刚好

    下面是我的启动参数
    .\llama-server.exe -m moxing\Qwen3.8-27B-Q4_0_ROCMFP4_FAST.gguf
    --model-draft moxing\mtp-Qwen3.8-27B-Q8_0.gguf
    --spec-type draft-mtp
    --spec-mtp-strict-qwen
    --spec-draft-ngl 99
    --spec-draft-n-max 3
    --spec-draft-n-min 0
    --spec-draft-p-min 0.0
    --host 0.0.0.0 --port 8655
    -c 128000 -b 2048 -ub 512
    --flash-attn on -np 1
    --kv-unified
    --cache-ram 8192
    --cache-type-k q4_0
    --cache-type-v q4_0
    --repeat-last-n 64
    --repeat-penalty 1.05
    --presence-penalty 0.0
    --frequency-penalty 0.0
    --temp 0.6 --top-p 0.85
    --top-k 40 --min-p 0.05
    --mmap
    --jinja -fit off -dio --jinja --chat-template-file chat_template.jinja

    .\llama-server.exe -m moxing\Qwen3.8-27B-Q4_0_ROCMFP4_FAST.gguf --model-draft moxing\mtp-Qwen3.8-27B-Q8_0.gguf --spec-type draft-mtp --spec-mtp-strict-qwen --spec-draft-ngl 99 --spec-draft-n-max 3 --spec-draft-n-min 0 --spec-draft-p-min 0.0 --host 0.0.0.0 --port 8655 -c 70000 -b 2048 -ub 512 --flash-attn on -np 1 --kv-unified --cache-ram 8192 --cache-type-k q4_0 --cache-type-v q4_0 --repeat-last-n 64 --repeat-penalty 1.05 --presence-penalty 0.0 --frequency-penalty 0.0 --temp 0.6 --top-p 0.85 --top-k 40 --min-p 0.05 --mmap --jinja -fit off -dio --jinja --chat-template-file chat_template.jinja
    

    同样显卡的兄弟可以去试试,结果跟我说下我看看你们是不是也是同样情况,如果有双卡的哥们试完记得跟我说下

    AI Agent 7900xtx qwen-27b rocm

  • RX7900xtx白金版 24G 跑Qwen3.8-27B Q4_0_ROCMFP4_FAST 模型 单卡60tok/s
    坤 坤坤

    @kos-or 97509e2d-8012-4baa-9572-f3b31ddc425d-image.jpeg

    AI Agent 7900xtx qwen-27b rocm

  • 【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。
    坤 坤坤

    上下文的个硬伤,而且这些模型你不能说像api一样完整完成任务,你需要自己去细分,规划,做一个项目号规划书,每个模块都拆成不同的小模块然后制定规范让它去干活才行

    LLM讨论区 rtx3090 qwen-27b
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组