跑代码的话27B肯定更稳,但是太慢了性子稍稍急一点就招架不住,尤其是agent类应用,输入远远远远大于输出,所以pp速度更重要27b我是等不及了,在R970零里面挂了一个高精度的35b也很爽。其实尤其是现在deepseek v4 flash太便宜了,本地部署的性价比真的是不太高
-
还以为会很折腾,没想到一下就好了弄好了:7900xtx -
R9700 Proxmox VE 懶人部署兩週運行心得 -
【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s@stormaround
我也发现这个问题了,试了不下10个这个基座模型的变种,有的量化精度低一些的在Hermes调用几步以后就开始陷入死循环,良化进度高一点的(新入了r9700)会好一些,但是他的思维会陷入一个死循环,就是不断的尝试,但是每一轮尝试下来都是一样的结果,根本解决不了问题。
后来我把跟他的交互记录让deepseek Pro看了一下,Deepseek 2分钟就发现了问题,根本的原因是Hermes斯的对话管理机制,因为它的定位是做一个轻量的助手,所以他的对话几乎都不能持久,然后你过一会不用的话,那个对话就给你关掉了,你在聊天的时候又是一个新的对话,所以说它不是靠对话来管理上下文的,它实际上是靠搜索它的那个对话的数据库来搞的,这样的话,尤其像这种本地小模型智商没那么高的情况下,他有可能抓到的内容是碎片化不相关的。所以导致使用体验非常糟糕,然后我就把同样的咖啡UI的自动化视频流程让他总结了一遍,迁移到了opencode里面。中间有一个断点在opencode里面调用一个魔改版的这个35b一次跑通!因为open code的一个对话就是一个项目,这种开发类的agent框架的上下文比较干净。
工具和模型同样重要,多么痛的领悟,我已经卡了三四天了了。 -
R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下@Alan-TANG
你这个测试和我自己做的好多测试基本相符,对于本地运行来说,35b和27b只是搞一搞hermes和文书编程类的工作太够用了,正常的ict方面,35b和27b几乎没有区别,所以我测试了不下20个版本的27B和35B后选了基于35b的Ornith Q5,主要是质量不差加速度快,Agent用的时候不便秘。但是这俩搞逻辑纯数学那确实不太行。 所以它完美适配agent应用,只要长链toolcall不掉链子就是好模型,关键是要适配自己的需求。另外本地模型可以越狱,云端的一点机会都没有。

-
有大神在本地部署 GLM 5.2 吗?这个太不现实了,除非你是视金钱如粪土的富哥。
现在本地部署说实话还是有点儿尴尬,哪怕是27b这样的模型,哪怕你用的是5090,一到agent使用场景,因为现在毕竟是agent时代了,那个pp速度一慢了你如果要是没做好缓存优化的话,你是根本不会想主力用它的。如果只是聊个天,做一点文本工作聊天窗口那种,然后识别个图啊,OCR的话,我以前那个5070ti就挺好的,升级到5090也就是可以跑的量化精度高一点,但是依然解决不了稠密模型在本地部署情况下的慢的问题。你想27b都如此,那像glm5.2这种庞然大物,本地布属真的意义不大。你可以考虑租个云端的卡试验一下,最终的归宿应该还是调用的时候用API,反正现在智谱的,coding plan也买不到。 -
我换回3.6 35B了@benton-yi
哈哈Ornith加一,那天我还想我说这个玩意儿Qwen3.8都出来了,怎么还不更新?结果一上官网官网把1.5的版本刚刚推出来两个小时。
现在它是我的独力模型,其实日常的使用完全够了,不管是配合dsh还是Hermes。dsh的话体感会好一些,配了deepseek的API以后搜索能力会比较强。 -
Hermes Agent 集群配置,多电脑多Profile,分工协作减少单个Agent记忆长度太长导致智力下降,API开销大的问题!云端+本地综合方案!确实,我也发现这个问题。相同的物理机上多开Hermes,一个挂了还能抢救另一个,俩的任务也能分开,他们的记忆系统不至于混乱。
Hermes标榜的的可以自我进化,这是绝对有它的好处的,但是坏处就是容易产生一大堆垃圾,也是屎山。所以,一个小技巧就是每周(或者说按自己需求的频率)让他自己检测自己的记忆系统和新创的技能。让他审视完了以后给你一个清理计划,批准了再执行,这样的话,就知道Hermes的大脑里到底现在存了些什么东西。一般去个重,然后再删除一些无用的垃圾(他理解错的内容)就会又很好用了。 -
7900XTX + llama.cpp Qwen3.6 27B TurboQuant + MTP 测试结果分享5000多人民币能买到带三年质保的新卡,还有24g高带宽显存的卡也就它了吧,这性价比其实已经爆棚了

可以关注一下27b的IQ量化系列,体积小一点,质量和速度都不差的。尤其是编译的时候,把wmma开启了的话,用hip llamacpp的PP速度能提示30%以上,实用度暴增。
我双路服务器,所以都有点儿后悔买9700了,没搞两张7900XTX,容量更大,速度应该比9700快将近一倍。 -
请问这个视频中 Qwen3.6 35b a3b 25token/s 是个什么水平?@crazypeace
没什么卵用,在Windows系统下和Linux下只要是个8g以上的显卡就能跑到这个速度,因为这个时候的速tp度是PCIe限制死的。如果是麦克的话是被显存带宽限制死的。顶多就是能跑起来而已,但是跑不顺。
Agent时代输入普遍很大,而输出比较少。PP速度慢了,除了纯聊天的场景,你不会想用下去的。 -
AMD AI Pro R9700 LLM调教@566656661 我在GitHub上下载了一个类似的里面下载量最高的一个,最后实际测试下来v l l m在r9700上性能不如llamacpp vulkan版本。
最后还是老老实实用vulkan吧,毕竟跑35b q5的模型,开三路,pp都能到2300,tp能到50~55。体验已经相当不错了,如果要是能把这个pp再提高到4000左右就比较爽了,agent应用太吃pp了。不过好像也就5090能做到这个水平,但是这破玩意儿现在是真的贵。 -
双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功@linkdesu Ornith 的版本我实测更好,他们官方放出的最低两化版本就是Q5,看来是有道理的。我用了一个日常工作当中用得到的比较难的三个场景测试,它跟deepseek v4 Flash的性能差距在1%,那基本上就是误差以内了。所以我最近连在线版的fassh都用的少了,哈哈,R9700搭配这个模型基本上日日常够用,需要云端的时候就用GLM5.2做个整体规划和验收就行。
-
8g的HBM矿卡170hx解封了
我让AI研究了一下这个玩意儿它解锁完了,也只是把那个屏蔽掉的内存容量释放出来了,带宽是够的,所以在tp阶段是没有任何问题,然后速度也会比较快,因为是带宽受限,但是这个玩意儿pp预处理的速度比较崩,好像这块还没解开。如果只是聊天的话,没有必要本地部署,如果要是有生产需求接入agent的话,pp速度比tp关键太多了,因为你预处理一般都是动不动二三十k的那个系统提示词,pp太慢的话,你会等到天荒地老,没啥意义,不如有着钱不如充点儿deepseek api 用flash吧,体验好很多
-
R9700 ai pro 32G 跑Qwen3.6 27B q6k 速度实测 -
ornith-1.0-35b Q8 與 Qwen3.6-35b-a3b Q8....大家覺的哪個更優秀?@David-Chen
Ornith Q5/Q6就很好,在你5090上应该可以飞起,或者你自己下载原始权重量化个FP8估计更快。
就非软件工程师的普通ICT应用来说足矣,看DS Pro对它工作的评价。

-
PVE HomeLab ( R9700x2+3090) 極限方案PVE HomeLab ( R9700x2+3090) 極限方案
這一邊是基於前一篇分享 https://lcz.me/post/4772
項目 舊 新 GPU 1× R9700(+ RTX 3090) **2× R9700 + 1× RTX 3090 ** 記憶體 64GB(2×32GB Kingston) 96GB(2×48GB Crucial/Micron DDR5-5600),4 槽用 2 槽,可擴 192GB 額外儲存 — 新增 WD 500GB SATA SSD VM 數量 100/101/103/104 再加 105 cuda-llm-lab** GPU passthrough 單張輪流 三張獨立 mapping(雙 R9700 可各自分派給不同 VM) 硬體規格
項目 品牌 規格 主機板 ASUS ProArt B850-CREATOR WIFI NEO CPU AMD Ryzen 9 9950X3D,16C / 32T 記憶體 Crucial / Micron DDR5-5600 96GB(48GB × 2,Part CP48G56C46U5.M16B1),4 槽用 2 槽顯示卡 #1 ASUS Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 03:00顯示卡 #2 PowerColor Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 07:00顯示卡 #3 ZOTAC GeForce RTX 3090(GA102,24GB),PCI 0a:00內顯 AMD Granite Ridge Radeon Graphics(iGPU),PCI 12:00有線網路 Realtek RTL8126 5GbE × 2 無線網路 Realtek RTL8922AE Wi-Fi 7 / 802.11be 系統碟 Crucial T500 NVMe SSD,2TB( CT2000T500SSD8)媒體碟 Samsung PM9A1 類 NVMe SSD,約 477GB( MZVL2512HDJD)追加資料碟 WDC WD Blue 500GB SATA SSD( WDS500G2B0A,ext4)Windows 系統碟 Predator GM9 NVMe SSD,約 1TB(NTFS,獨立 Windows 11,星際公民用) CPU 散熱 DeepCool Digital ASSASSIN IV VC VISION 機殼風扇 Noctua 12cm PWM / 14cm 電源 NZXT 1500W 機殼 Cooler Master QUBE 540 3090的話是採用開源宇宙的 OCulink + ADT m.2 PCIE 連接器,
採購建議 :
| 開源宇宙的質感極差,文件相關的資訊也不清楚
| ADT 品質不錯,但如果你放在機殼裡面的話建議超過50公分會比較好處理,然後要注意方向
目前的配置全部都是靠風冷,採用貓頭鷹官方推薦的上下進出佈局,基本上溫度都可以壓在50到70之間,極少時候才能拉到80,外部顯卡反而散熱的問題很嚴重,所以在機殼側邊掛了一顆酷冷的12cm風扇直吹
PCIe 通道分拆與 8×8 顯卡策略
9950X3D(Granite Ridge / AM5)對外總共 28 條 PCIe 5.0 lane:24 條給裝置、4 條當晶片組上行。這台把 28 條全部用好用滿,實測從 CPU root port 拉出來的分配如下:
CPU root port Lane(LnkCap) 掛什麼 協商速度 (LnkSta) 說明 00:01.1x8 R9700 #1(ASUS, 03:00)Gen5 x8 顯卡通道前半 00:01.3x8 R9700 #2(PowerColor, 07:00)Gen5 x8 顯卡通道後半 00:01.2x4 Predator GM9 M.2(Windows 碟) Gen5 x4 CPU 直連 M.2 00:02.2x4 Crucial T500 M.2(PVE 系統碟) Gen4 x4 CPU 直連 M.2 00:02.1x4 → B850 晶片組上行 Gen4 x4 底下再扇出一堆裝置 核心策略:把 CPU 的 16 條顯卡 lane 對半拆成 x8 + x8,兩張 R9700 各吃一半。
這是 AM5 平台想「兩張主力卡都直連 CPU」的唯一解——AM5 只有 16 條 PEG lane,要塞兩張就必須在 BIOS 開 PCIe bifurcation(x8/x8)。實測00:01.1與00:01.3的LnkCap Width都是 x8,證明分拆已生效。每張 R9700 前面還掛著一顆 PCIe switch(
1002:1478/1479):上游對 CPU 是 x8,下游對 GPU die 是 x16,所以卡端 endpoint 讀到的是Width x16,但真正的瓶頸帶寬是 CPU 側的 x8 Gen5(約 32 GB/s)。對 AI 推理來說完全夠——權重載入一次後就吃算力,不吃 host 頻寬。第三張卡 RTX 3090 沒有 CPU lane 可用(16 條已被雙 R9700 佔滿),只能掛到 B850 晶片組那條 x4 Gen4 上行下面,和兩張 5GbE、Samsung PM9A1、Wi-Fi 7、USB、SATA 共享頻寬,因此協商成 x4。當遊戲 / CUDA 實驗卡用足夠,但別期待它有滿頻寬。
CPU 9950X3D — 28× PCIe 5.0 lanes ├── x8 Gen5 ── R9700 #1 (ASUS, 03:00) ┐ ├── x8 Gen5 ── R9700 #2 (PowerColor, 07:00) ┘ ← 16 條顯卡 lane 拆成 8×8 ├── x4 Gen5 ── Predator GM9 M.2 (Windows 碟) ├── x4 Gen4 ── Crucial T500 M.2 (PVE 系統碟) └── x4 Gen4 ── B850 晶片組 ├── RTX 3090 (0a:00, x4 downgraded) ├── RTL8126 5GbE ×2 ├── Samsung PM9A1 NVMe (media) ├── RTL8922AE Wi-Fi 7 └── USB / SATA提醒:閒置時 link 會降到
2.5GT/s(ASPM 省電),例如 R9700 #2、RTX 3090 目前顯示 Gen1 x8/x4,這是正常降頻,跑推理 / 遊戲時會自動 train 回 Gen5 / Gen4。判斷「有沒有拆成 x8」要看LnkCap Width,不是看即時LnkSta Speed。你如果要是有其他的机器用的话,可以考虑把这个装pve,然后显卡直通给虚拟机。如果两张显卡不协同工作的话,甚至可以分配个不同的虚拟机来做不同的事情,如果一个崩溃了,不至于影响所有服务,硬件不能解耦的话,用虚拟机解耦还是不错的选择。
你这个主板有点儿豪华,都能放进显存的时候,其实没有必要用这么豪华的板子。可以考虑一下戴尔的7820或者7920工作站,原生pcie lane就很多,如果用贵的PCIe5然后再拆分就没什么意义了,速度又变回pcie4了。小小的建议。
-
我换回3.6 35B了@kos-or
哦,我的是r9700,没有试Q5以下的版本,Q5反正挺好用 -
授予@fcme @applejuice @johnnybegood @q-maria @kos-orr 技术大牛称号感谢群主提供的学习平台
-
实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率@Colt 不切换的要善用搜索功能,在线API也好,本地的Searxng也好,可以极大的扩展本地的小模型的脑容量,带价就是要慢点。
-
一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评你说是卡吗?那肯定是amd的AI Pro R9700。带宽只有五零,九零的1/3,价格差不多也是1/3,就看你怎么选择了。32g最大的好处就是可以跑高比特的呃35b,27b的模型是我自己实测比较抗量化的,但是35b的话低于Q4,在agent场景下几乎没有办法用,动不动锻炼,然后死循环,但是高比特的就没有这个问题。我在9700上跑的是Q5的版本,但是我是需要开两个通道。
不管怎么说,是你的钱提前利用AI也好,自己做点功课也好,才能满足你真正的需求。总的一句话就是本地跑的ai不要期待它能跟云端的相比,哪怕是云端的deepseek flash。速度和知识的瓶颈就在那里了,但是对于日常使用大部分场景又都够用了 -
r9700 hermes出token慢跑本地模型基本上都是这样,这个几乎无解,硬件的限制就在这里了。
但是但是的,但是还是有缓解的办法。第一个开源,开源的话就是用mtp模型,增加推理速度,另外一个就是注意你所使用的框架里面的缓存技术,能缓存的尽量走缓存,嗯,这样的话真正计算的部分量比较小,速度会比较理想一些。节流节流的部分就是赫mes默认它好多嗯默认的系统提示词里面带好多垃圾,比如说有些技能用不上的,有些工具用不上的就可以删除或者屏蔽掉,这样的话,比如说你原来的系统提示词默认是30k然后优化完以后15k的话,那么反应时间会直接减半,然后再结合缓存优化的话,那基本上两三秒之内就可以出字了,我以前的卡是5070ti 16g。体感还不错,但是跟在线版的完全还是没有办法比,感觉deepseek v4flash出来以后,本地部署的价值急剧缩水。哈哈