感谢群主提供的学习平台
-
授予@fcme @applejuice @johnnybegood @q-maria @kos-orr 技术大牛称号 -
AMD R9700 32G 硬体配置分享 + --highvram 显存溢出导致黑屏重启的解决经验比如你要做自动视频的时候,可以做批量化的处理,就是加载一个模型就把这个模型需要弄的工作流全部做完,然后保存中间文件,然后再进行下一步的操作加载下一步用得到的模型就行了。毕竟32g的显存在视频工作流里面也不是太大,肯定还要分批来实施的。我最近也在研究自动化视频方面的东西,一点小小的心得。
-
从 41 到 56 tok/s:我修好了 DFlash 官方 benchmark 的 bug,顺手在 7900 XTX 上搭了全套联网大模型@williamlouis
配合OpenWebUI看来不是搞代码的需求,这种情况下可以考虑27B的iQ3系列,日用和正常的Q4没什么区别。以前用5070ti的时候用这个效果很棒,又快又稳,简单的脚本之类的也没有问题。
下面这个实测不错,但是不要用xs和s版本那两个会崩,因为这些作者他们量化完了以后不会自己运行实际跑,所以要跑几个不同的版本精挑细选一下。
https://huggingface.co/mradermacher/Huihui-Qwen3.6-27B-abliterated-i1-GGUF?show_file_info=Huihui-Qwen3.6-27B-abliterated.i1-IQ3_XXS.gguf -
从 41 到 56 tok/s:我修好了 DFlash 官方 benchmark 的 bug,顺手在 7900 XTX 上搭了全套联网大模型ddg的搜索质量还是有点堪忧啊,感觉用searngx做聚合,把你实测质量比较好的搜索源的权重提高点效果比较好。外挂搜索引擎确实是弥补本地小模型知识库这个最大短版的印度神油

-
SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署! -
我的搜索自己说了算@williamlouis
如果只是为了实现借用一个无头浏览器来做搜索的功能的话camoufox跑个docker也可以啊,功能也不错。
只不过没有mcp,不过在AI时代,大佬可以写一个,或者说已经应该是有人已经写了吧。 -
一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评@terry
我也是看到了你的视频以后才了解到amd现在跑本地模型的生态算是比较成熟了才入手的R9700,感谢。
你说的这个问题有两个缓解的办法,35b用ornith官方的Q5,Q6效果不错,属于是质量和速度的平衡,日用不做代码不开发的话驱动和维斯非常好用,完全够了,原版的容易死循环。27b我也下载好了,需要绝对的输出质量的时候,我就让另一个运维的赫mes切换一下,切换也做成技能了,一句话的事情很简单。
成年人我都要,27b和35b各有所长吧

-
8g的HBM矿卡170hx解封了就是没啥卵用,聊天时代还行,agent时代几乎是废的。7900XTX这种神器不买买那种垃圾还是需要勇气的。
-
8g的HBM矿卡170hx解封了@job
好多人实测过了,内存可以都暴露出来,但是PCIe带宽不行物理屏蔽的 -
SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置ai要是搞不定那我们这种普通玩家也很难了,你给你的AI配个好点的搜索引擎吧。
-
一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评你说是卡吗?那肯定是amd的AI Pro R9700。带宽只有五零,九零的1/3,价格差不多也是1/3,就看你怎么选择了。32g最大的好处就是可以跑高比特的呃35b,27b的模型是我自己实测比较抗量化的,但是35b的话低于Q4,在agent场景下几乎没有办法用,动不动锻炼,然后死循环,但是高比特的就没有这个问题。我在9700上跑的是Q5的版本,但是我是需要开两个通道。
不管怎么说,是你的钱提前利用AI也好,自己做点功课也好,才能满足你真正的需求。总的一句话就是本地跑的ai不要期待它能跟云端的相比,哪怕是云端的deepseek flash。速度和知识的瓶颈就在那里了,但是对于日常使用大部分场景又都够用了 -
SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置@用户名违规
这个简单,你让你的AI助手联网扒一下就可以了,让他回答的时候带上信源,你顺便去核实一下 -
一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评还有一个关于模型的选择,显存直接决定了你可以用的模型。24g的显卡最好的选择是27b,32g的卡最好选择是35bMoE。各个价位肯定都是英伟达的更好,但是本地运行大模型的话速度是一个很重要的坎,27b你别看有了mtp以后速度都能到个五六十,但是agent时代的真正局限是pp速度,也就是预处理,一个系统提示词二十几k,上下文长一点了以后动不动上百k,虽然在同一个对话里面,它是逐渐累加的,跑起来以后还好,但是只要一涉及到大的文件读取或者说压缩对话之类的操作,那几乎都是全量操作,本地模型pp速度不够的话,直接跟卡死差不多。所以本地其实最佳的选择是35b的各种变种,质量不错,速度奇快。哪怕你的卡是5090,最佳的选择也是这两个,当然5090跑27b它计算速度太暴力了,好像pp能到1500往上。所以只要不是五零,九零,其他人的归宿差不多应该都是35b的各种版本。有了deepseek v4flash以后,本地部署的性价比其实挺低的。当然你用那种解禁的各种版本搞一点奇奇怪怪的事情,那是云端搞比不了的
。 -
一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评其实你驱动单卡7900xtx的话,建议你把这套服务直接推翻,你在闲鱼收一个二手的服务器,只要是有pcie3.0就行。当然如果是amd的那种双路更好,因为pcie通道更多,将来你插双卡的话,呃比较舒服。只是记得买卡的时候要买薄一点的,厚度不要太厚了,这个影响你双卡。
收二手服务器的好处是这种东西都太他妈稳定了,这完全不是民用的,自己组装的机器可以比拟的,而且性价比超高。哪怕是以前老的惠普z220240420620这些机器都可以,但是要注意,最好是电源容量充足的,内存不够的话,可以自己加一下,16确实小了点32是比较舒服的。
我曾经也想自己组的,后来研究来研究去,发现还是老服务器比较爽,我最终选的是7820,双路,6个pcie,两个满速x16。民用级别的CPU,pcie通道数不够,你买了也是白买,基本断绝了你以后组双路的想法。
关于系统的话,千万别装Windows,就用无头Linux,本来显存就吃紧,你装一套图形系统,只会无畏的拖慢速度占用宝贵的显存资源。 -
8g的HBM矿卡170hx解封了@applejuice
确实如此,这个玩意儿的真实价值也就1000~1500人民币,美元的话二三百块。现在哄抢的估计是没有研究明白AI不止吃内存容量,还持带宽,更吃算力。哈哈
不过从能不能的角度来考虑,还是相当不错的。要想用的舒服一点,还是要24g以上的英伟达和amd。 -
8g的HBM矿卡170hx解封了
我让AI研究了一下这个玩意儿它解锁完了,也只是把那个屏蔽掉的内存容量释放出来了,带宽是够的,所以在tp阶段是没有任何问题,然后速度也会比较快,因为是带宽受限,但是这个玩意儿pp预处理的速度比较崩,好像这块还没解开。如果只是聊天的话,没有必要本地部署,如果要是有生产需求接入agent的话,pp速度比tp关键太多了,因为你预处理一般都是动不动二三十k的那个系统提示词,pp太慢的话,你会等到天荒地老,没啥意义,不如有着钱不如充点儿deepseek api 用flash吧,体验好很多
-
我的搜索自己说了算只是别用百度,这个纯垃圾,里面全是噪音和广告
-
我的搜索自己说了算searngx配好引擎测试好了,其实也是相当不错的
-
Kimi K3 几天测试后 总结。如何正确使用。Kimi系列从K2开始就属于是废话多到让你不想用的模型, 当然如果他能反复多轮自我左右互搏,最后出结果的话也还是不错的,就只是比较废token。反正现在套餐也买不到,随便跑着玩吧
-
AMD AI Pro R9700 LLM调教@Luke-Mao
其实也没什么,你就让Hermes帮你重新编译llamacpp就可以了。编译的过程当中开启WMMA,之后是用系统原生服务跑还是docker跑都可以。效果没差。