@dardeaw-feng 确实有上过30+。让ai测试有上过45左右。
由于你我软硬件环境有很大不同,我不知道有没有可能是操作系统或docker的损耗。
Ying Hong
@Ying Hong
-
ROCm FP4以 AI Max+ 395測試 對比Q4進步不小 -
ROCm FP4以 AI Max+ 395測試 對比Q4進步不小@dardeaw-feng 是有用专门rocmfpx量化的模型,用q4量化模型还要慢挺多。
-
ROCm FP4以 AI Max+ 395測試 對比Q4進步不小很奇怪,我的 aimax+395小主机,尝试编译了各种 github 上支持 rocmfpx 量化的 llama.cpp 分发,下载尝试了各种q4_rocm 量化的 qwen3.8 27b gguf 模型。
- 在 mtp 关闭的情况下,所有组合的 推理解码速度不会超过 15 t/s 。
- 在 开启 mtp 的情况下,所有组合的 推理解码速度不会超过 24 t/s 。
我的主机硬件是:
零刻 gtr9 pro(ai max+395)
操作系统:cachyos Linux 7.1.4,
在 docker 内运行:(Fedora Linux 44 (Container Image)难道,零刻 gtr9 pro 的 ai max +395, 不如 FEVM FAEX1 ?