AMD R9700 實測:ROCm 10,Qwen38-27B-UD-Q6_K、128K context 和 MTP
-
我感觉R9700有点尴尬,我之前也想买这个的,但是除了高一点的量化模型也没有太多的提升,效果也都差不多,token速度还有点慢
-
我感觉R9700有点尴尬,我之前也想买这个的,但是除了高一点的量化模型也没有太多的提升,效果也都差不多,token速度还有点慢
@heheimback 是这么回事 跑llm的话 不如7900xtx的960gb的带宽 快很多 跟4090的带宽是一个级别的
-
,
T terry 固定了此主题
-
抄作业结果。
模型:mlasli/Qwen3.8-27B-Heretic-Uncensored-Q6_K-GGUF
显卡:R9700 32gHeretic FP8 测试结果(Vulkan + R9700)
实际输入 tokens
Prefill tok/s TTFT (s) MTP Accept%
2,048 684 26.9 98.5%
32,768 623 78.1 99.0%
65,536 498 162.4 99.3%
对比论坛帖子(ROCm 10 + R9700)
输入 tokens 他的 Prefill 我们的 Prefill 他的 TTFT 我们的 TTFT
2,048 785.5 684 2.68s 26.9s
32,768 555.6 623 59.1s 78.1s
65,536 410.1 498 160.0s 162.4s
分析:我们的 Prefill 速度接近(Vulkan vs ROCm 差异不大)
TTFT 差异大是因为他的 TTFT 只算 prefill,我们的包含其他开销
MTP acceptance 非常高(98-99%),说明 MTP 工作正常
Decode 速度约 45 tok/s,和之前测试一致AI的分析对吗
-
抄作业结果。
模型:mlasli/Qwen3.8-27B-Heretic-Uncensored-Q6_K-GGUF
显卡:R9700 32gHeretic FP8 测试结果(Vulkan + R9700)
实际输入 tokens
Prefill tok/s TTFT (s) MTP Accept%
2,048 684 26.9 98.5%
32,768 623 78.1 99.0%
65,536 498 162.4 99.3%
对比论坛帖子(ROCm 10 + R9700)
输入 tokens 他的 Prefill 我们的 Prefill 他的 TTFT 我们的 TTFT
2,048 785.5 684 2.68s 26.9s
32,768 555.6 623 59.1s 78.1s
65,536 410.1 498 160.0s 162.4s
分析:我们的 Prefill 速度接近(Vulkan vs ROCm 差异不大)
TTFT 差异大是因为他的 TTFT 只算 prefill,我们的包含其他开销
MTP acceptance 非常高(98-99%),说明 MTP 工作正常
Decode 速度约 45 tok/s,和之前测试一致AI的分析对吗
-
Heretic FP8 多维度 MTP 测试结果
内容类型 Prefill Decode MTP Accept%
code 529.8 tok/s 43.6 tok/s 94.5%
math 529.2 tok/s 43.7 tok/s 93.9%
prose 528.5 tok/s 43.1 tok/s 90.4%
tool 527.8 tok/s 43.0 tok/s 89.3%
short 527.1 tok/s 43.0 tok/s 88.2%
long_prompt 526.6 tok/s 42.9 tok/s 87.3%
平均 - 43.2 tok/s 90.6% -

我平時的需求是公司有付Chatgpt Plus和Claude Pro 月費, 所以我要快速的回答問題都會用這2個"免費"AI。
但是我要處理一堆PDF或CSV檔時, 就要精確的數字, Q4我發現錯誤很多, 尤其是PDF,所以我改用了Q5和Q6。
我就讓它自已運行,然後去做別的事。但未來我想試一下紀錄日常使用模型的數據, 換QWEN 3.8 27B各種模型,KV,上下文。GPT給我方案是這個, 設計一個小程式在外面, 也方便我單卡換ComfyUI玩Minimax H3。 -
不能这么说,各位,32G显存,两张不如一张4090 48G贵,跑LLM双卡TP,或者双卡跑两个ComfyUI,并不会比4090 48G差。又可以买到新卡。唯一输的就是不能连续48G显存,跑高清视频。
不能这么说,各位,32G显存,两张不如一张4090 48G贵,跑LLM双卡TP,或者双卡跑两个ComfyUI,并不会比4090 48G差。又可以买到新卡。唯一输的就是不能连续48G显存,跑高清视频。
老特,
我想问一下,我现在已经有两个r9700。如果我再加两个的话,凑成4个。都安在我的服务器主板上。我的服务器主板是可以跑pcie 4.0 16×8。有128gb ram。这个效果差不多能够等效之前的2x5090吗?我现在的项目其实除了comfy ui以外,还需要用到yolo。之前买5090,就是因为他有那个hard decoder ,但是我并没有了解过,r9700上面有没有? -
不能这么说,各位,32G显存,两张不如一张4090 48G贵,跑LLM双卡TP,或者双卡跑两个ComfyUI,并不会比4090 48G差。又可以买到新卡。唯一输的就是不能连续48G显存,跑高清视频。
老特,
我想问一下,我现在已经有两个r9700。如果我再加两个的话,凑成4个。都安在我的服务器主板上。我的服务器主板是可以跑pcie 4.0 16×8。有128gb ram。这个效果差不多能够等效之前的2x5090吗?我现在的项目其实除了comfy ui以外,还需要用到yolo。之前买5090,就是因为他有那个hard decoder ,但是我并没有了解过,r9700上面有没有? -
@Thanaots
跑ComfyUI R9700和5090相比太慢,ComfyUI目前多卡方案不好折腾,折腾好了算力也不能叠加。但是R9700 32G可以单独跑,你买4个就让它跑4个实例,或者每个卡跑不同的阶段。还有R9700两张还是被5090吊打,这不是一个级别的,差太远了。 -
,系统 取消固定了此主题