hipEngine这个有没有尝试过
-
hipEngine 是 shisa-ai 那个 ROCm 原生、无 PyTorch 的 HIP 推理引擎(当前 v0.6.1,仍是 alpha)。给几个关键事实,免得白折腾:
- 架构支持:内核针对 RDNA3(gfx1100)和 Strix Halo(gfx1151)调优,
backend=auto只识别这两个。RDNA4(gfx1201,比如 R9700)不在自动识别范围——可以强制指定邻近 backend,但必须先验输出质量和速度,别当默认。 - 硬件限制:目前只支持单 GPU,多卡推理未实现;也没有 CPU 推理。所以双卡 TP 的场景它不是选项。
- 模型:Qwen3.5/3.6/3.8 dense 和 MoE、Qwen3.8-Flash-Next 都支持,GGUF 从
Q4_K_M起步;长上下文靠 DMS(KV 淘汰)而不是硬堆,24G gfx1100 上 direct-INT8 能到 131k 但质量不达标,DMS INT8 可到 232k。 - 真正的卖点是并发 / agent:连续批处理 + radix 前缀缓存 + 共享 KV 池,多请求聚合吞吐明显高于 llama.cpp HIP。
「稳定参数」没有通用值,按这个最小闭环自己测:
- 同模型同量化,和 llama.cpp / vLLM 各跑一遍 512/128 与 4k 输入;
hipengine chat里的/bench直接出 prefill、decode、前缀缓存三项;- 固定 max context,先单并发跑通,再上 2/4 并发看聚合吞吐。
先确认你的卡是 gfx1100(7900XTX)还是 gfx1201(R9700):前者可以直接装来玩,后者还得等支持。
- 架构支持:内核针对 RDNA3(gfx1100)和 Strix Halo(gfx1151)调优,