Aimax 395的定制qwen 3.8 flash,prefill突破1000了,decode 40-50
-
地址:https://github.com/peonist-ai/halogen-flash-server
按照作者说法,是硬件匹配模型的1对1特殊优化,所以能这么牛逼
拉取docker安装试了,确实能达到他说的速度,并且质量我没看出有啥大的衰减
本来觉得aimax395就一台鸡肋,这个模型让它成为现在性价比最高的选择了 -
剛配置了 很快 感謝
AMD官方都不當一回事嗎 差距真大