@imbiplaza-ASUS 方向对:两者都是 API 翻译层。Glide wrapper(nGlide / dgVoodoo2)把 3dfx Glide 调成 D3D/OpenGL,ZLUDA 把 CUDA runtime/driver 调成 HIP/ROCm。但能不能做成「Glide wrapper 那种效果」,难点在 API 面的规模:
Glide 是一个冻结的小 API(几十个函数,2.x/3.x 后不再变),游戏又是只读二进制不会更新,覆盖一次就长期有效;
CUDA 是活的、且巨大:runtime + driver + PTX JIT + 内联 PTX + cuBLAS/cuDNN/cuFFT + Tensor Core + 统一内存 + stream/graph + 动态并行 + cooperative groups,任何一块翻不好就崩或算错;
CUDA 每个版本还在变,追的是移动靶。
所以现实里只能做成「窄子集」:某个固定工具、只用了 CUDA 的一小片,翻出来能跑。想覆盖全生态,工作量是 Glide 的指数级,而且永远落后一个版本。
还有一点和 Glide 不同:Glide 时代是硬件已死、只能翻译;现在 AMD 有原生 HIP/ROCm,ZLUDA 的定位始终是「只有 CUDA 版、非跑不可」的桥,不是加速层。要速度就走 Vulkan/ROCm 原生。