我也是这个版本,但是用的时候,容易死循环,单流速度确实挺快的,但是2流或是3流就直接卡死了,你这边有这些问题吗?
farmer node
-
关于双AMD RX7900XTX的使用感受 -
双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)@terry 好的,麻烦排版了,谢谢老哥,下次注意
-
双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)@flyer666

来2个罩子,防尘效果不错 -
双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)@flyer666 看到了,谢啦
-
双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)楼主参数是什么呢? 用的是和之前一样的模型和参数吗?
-
双卡7900xtx VLLM qwen3.8 爽玩agent pp1600 tg 160+ (附 mtp/7900xtx全攻略)陌拜大神,大神威武
-
7900XTX双卡跑VLLM跑 Qwen3.8 27b实录@iamvirus 纵享丝滑,vllm(perf/rdna3_full_stack)+lmcache(dev最新版本) +dbirks/Qwen3.8-27B-W4A16-AutoRound,一次过,感谢兄弟,我也是 128g + 2t,哈哈哈
-
神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。@crazypeace 接上了,可以用,谢啦
-
Qwen3.8-27B 量化全格式橫評:從 IQ2_XXS 到 Q6_K,14 種格式誰才是甜點?KV 才是大头,q4_0 或是q4_1 不够用,q5_1 勉强够, 最好上 q8 , 256k 上下文,显存就是10g+ 以上
-
第二张 AMD 显卡该怎么用?一次 128K Agent 双卡推理实测其实没必要纠结pcie5.0x8拆分 , 直接买 pcie 4*16 的主板即可,可能会更便宜
-
神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。刚用hermes调用了一次,然后就不让用了
-
# 7900 XTX 跑 Qwen3.8-27B 實測73.4t/s 完整部署與實測指南,claude code opus5協助佈署的,分享給大家陌拜大佬,搞起来搞起来
-
DeepSeek V4涨价后,账单起飞同时缓存命中率骤降,大家有这个情况吗?
命中倒是没降,就是感觉傻了很多,经常改错问题,然后自己又改回来,还改不好,浪费好多token -
7900xtx涨价了已经没性价比,双3080 20G怎么样?需要质保的话,用r9700,蓝宝石的 7900xtx 已经7600了,二手都要5500了
-
本地模型太弱,给它创建一个 skill去白嫖在线AI但是效率太低了,用免费的api ,像是 百炼送的额度,或是 硅基流动 注册送的额度等等都比这个多的多,实在没必要,现在在线api 就用来 分析一下复杂任务,用几次,然后让本地来执行
-
本地模型太弱,给它创建一个 skill去白嫖在线AI早就这么干过了,现在 claude 和gpt 额度一会就没了, gemini 每天是200次
-
X99-AD4运行7900XTX黑屏,求助如果是在官方买的话,就直接找官方客服,客户会告诉你怎么做,判断是否是主板的问题,如果不是会告诉你,如果是的话,实现不行可以申请售后换货,3年保修
-
分享一下我折腾RAG的不成功经验嗯,具体看场景,和颗粒度,我觉得dify 做 rag 应该是都大部分的生产场景了, 可以保证基础检索的召回质量,尤其是它内置了重排序。再加上它支持混合检、分段优化等操作的手段,所以大部分的生产场景是比较够用了,像是我做的学习习题板块,是完全够用的,因为不涉及到上下文,所以是够用的。但是多轮对话或是涉及到表格的情况,还是有问题,所以看是看具体场景。
-
分享一下我折腾RAG的不成功经验rag 检索已经有非常成熟的工具,没必要自己折腾了, 像是国内应用 腾讯的 ima (可以直接下载登录), cherryStudio, 或是dify ,这些直接就可以用, 把文件丢进去,然后自己就切分了,如果需要控制颗粒度,dify 的效果会好些,你可以试试