@kop-wang 整个链路其实延时高的是模型方面,如果用低模的模型还是能办到的,就是这方面我是没想到真的有人弄了
坤坤
-
现在AI玩的都这么花了吗 -
【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。上下文的个硬伤,而且这些模型你不能说像api一样完整完成任务,你需要自己去细分,规划,做一个项目号规划书,每个模块都拆成不同的小模块然后制定规范让它去干活才行
-
你们的7900xtx在跑27b 核心温度高不高?卧槽,你怎么会那么高,是不是机箱通风没做好,我满载跑都不超过70,我用的是白金版的
-
RX7900xtx白金版 24G 跑Qwen3.8-27B Q4_0_ROCMFP4_FAST 模型 单卡60tok/s@hanyoud 这两天有空我测试下
-
RX7900xtx白金版 24G 跑Qwen3.8-27B Q4_0_ROCMFP4_FAST 模型 单卡60tok/s有个新情况,这样的参数虽然能正常用,但是会导致最后显存溢出,直到共享内存全部用完,会提示35.33.135.383 E ROCm error: out of memory
35.33.135.419 E current device: 0, in function alloc at I:/llama-mtp/llama.cpp/ggml/src/ggml-cuda/template-instances..\fattn-common.cuh:1596
35.33.135.618 E hipMalloc(&ptr, nelements * sizeof(half))
I:/llama-mtp/llama.cpp/ggml/src/ggml-cuda/ggml-cuda.cu:113: ROCm error -
RX7900xtx白金版 24G 跑Qwen3.8-27B Q4_0_ROCMFP4_FAST 模型 单卡60tok/s -
RX7900xtx白金版 24G 跑Qwen3.8-27B Q4_0_ROCMFP4_FAST 模型 单卡60tok/s@terry 我开着远程截图的
,我看着还行 -
RX7900xtx白金版 24G 跑Qwen3.8-27B Q4_0_ROCMFP4_FAST 模型 单卡60tok/s系统:win11
主板:Gigabyte B560M D2V
CPU:i7-10700K
内存:64GB ddr4
后端:llama.cpp+后编译的rocmFB4版(这个版本我是让ai去调取官方仓库为和这个模型和根据本地配置编译的)先说下我的情况,模型第一次冷启动基本2分钟左右,然后初始速度是60tok/s左右

这个时候上下文在16k左右
如果是开着思考的话,那么一次任务的思考,会造成上下文越来越多在上下文达到32k左右,那么速度回降到45tok/s

如果上下文达到64k左右,那么速度会继续降到30tok/s附近

我试过用128k上下文,基本模型的上下文达到64k后,速度就稳定在30附近了
对此,如果是短任务的话只能坐一次然后手动去停掉模型然后重新启动,并且dsh这边要手动压缩上下文当然,关掉思考模式的话确实像锤哥说的一样,体感反应速度真的很舒服,单纯聊聊天还是可以的
我也不想没错开关思考模型都要启动模型一遍,就让它自己加上了网页端可以设置思考或者不思考的选
任务方面的话我已经测试过了,短任务,比如登录某个网站上去查询数据下来放表格,我工作上的事情已经能做并且完美完成,唯一的确定就是慢。
思考链又臭又长,我只能交代繁琐重复的任务让他执行,然后我去干别的活,长代码方面我就没试过了,但是根据别的朋友反馈说代码能力很强
关于这个降速的问题我怀疑是因为思考时候产生的上下文溢出到内存了,才导致速度变慢,我打算看什么时候再收一张7900xtx进行双卡测试,如果真的是这个原因,并且得到解决的话,那我真的不用花钱去订阅了,60tok/s对我来说刚好
下面是我的启动参数
.\llama-server.exe -m moxing\Qwen3.8-27B-Q4_0_ROCMFP4_FAST.gguf
--model-draft moxing\mtp-Qwen3.8-27B-Q8_0.gguf
--spec-type draft-mtp
--spec-mtp-strict-qwen
--spec-draft-ngl 99
--spec-draft-n-max 3
--spec-draft-n-min 0
--spec-draft-p-min 0.0
--host 0.0.0.0 --port 8655
-c 128000 -b 2048 -ub 512
--flash-attn on -np 1
--kv-unified
--cache-ram 8192
--cache-type-k q4_0
--cache-type-v q4_0
--repeat-last-n 64
--repeat-penalty 1.05
--presence-penalty 0.0
--frequency-penalty 0.0
--temp 0.6 --top-p 0.85
--top-k 40 --min-p 0.05
--mmap
--jinja -fit off -dio --jinja --chat-template-file chat_template.jinja.\llama-server.exe -m moxing\Qwen3.8-27B-Q4_0_ROCMFP4_FAST.gguf --model-draft moxing\mtp-Qwen3.8-27B-Q8_0.gguf --spec-type draft-mtp --spec-mtp-strict-qwen --spec-draft-ngl 99 --spec-draft-n-max 3 --spec-draft-n-min 0 --spec-draft-p-min 0.0 --host 0.0.0.0 --port 8655 -c 70000 -b 2048 -ub 512 --flash-attn on -np 1 --kv-unified --cache-ram 8192 --cache-type-k q4_0 --cache-type-v q4_0 --repeat-last-n 64 --repeat-penalty 1.05 --presence-penalty 0.0 --frequency-penalty 0.0 --temp 0.6 --top-p 0.85 --top-k 40 --min-p 0.05 --mmap --jinja -fit off -dio --jinja --chat-template-file chat_template.jinja同样显卡的兄弟可以去试试,结果跟我说下我看看你们是不是也是同样情况,如果有双卡的哥们试完记得跟我说下
-
rx7900xtx会随着kv池变大导致oom@Xiaote 我用的llamacpp编译后的版本,是win下面的
-
rx7900xtx会随着kv池变大导致oom这个问题我一直没有解决办法,显存溢出的话会我观察到,如果上下文16k左右,速度能达到60~65tps左右,如果上下文到32k,那么速度降低到45~50tps,如果达到64k上下文,那么速度会降到30~35tps
我专门开了128000上下文测试,就算到110000上下文,速度还是保持在30~35tps,每秒,这个时候显存占用已经到39GB了,那是不是如果我再加一张rx7900xtx,两张组成显卡池,这样是不是就能让速度稳定在60tps这里 -
Qwen3.8 27B + DeepSeek Harness实测:7900XTX本地跑Agent效率不错,忘掉SGLang?llama.cpp咸鱼翻身!如果两张这个rx7900xtx并行的话,是不是上下文可以拉满
-
我想知道有没有伙伴用AMD R 9700 32G+RX 7900xtx 24G混合部署ai模型一直在纠结要不要加一张,目前使用rx7900xtx 部署了qwen3.8-27b的模型供Hernes使用,思考等级拉倒最高,开个128k上下文,倒是能帮我处理工作的简单任务,就是首字输入速度太慢了,速度再45~50Tps左右浮动
