r9700 hermes出token慢
-
跑本地模型基本上都是这样,这个几乎无解,硬件的限制就在这里了。
但是但是的,但是还是有缓解的办法。第一个开源,开源的话就是用mtp模型,增加推理速度,另外一个就是注意你所使用的框架里面的缓存技术,能缓存的尽量走缓存,嗯,这样的话真正计算的部分量比较小,速度会比较理想一些。节流节流的部分就是赫mes默认它好多嗯默认的系统提示词里面带好多垃圾,比如说有些技能用不上的,有些工具用不上的就可以删除或者屏蔽掉,这样的话,比如说你原来的系统提示词默认是30k然后优化完以后15k的话,那么反应时间会直接减半,然后再结合缓存优化的话,那基本上两三秒之内就可以出字了,我以前的卡是5070ti 16g。体感还不错,但是跟在线版的完全还是没有办法比,感觉deepseek v4flash出来以后,本地部署的价值急剧缩水。哈哈