跑代码的话27B肯定更稳,但是太慢了性子稍稍急一点就招架不住,尤其是agent类应用,输入远远远远大于输出,所以pp速度更重要27b我是等不及了,在R970零里面挂了一个高精度的35b也很爽。其实尤其是现在deepseek v4 flash太便宜了,本地部署的性价比真的是不太高
-
还以为会很折腾,没想到一下就好了弄好了:7900xtx -
【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s@stormaround
我也发现这个问题了,试了不下10个这个基座模型的变种,有的量化精度低一些的在Hermes调用几步以后就开始陷入死循环,良化进度高一点的(新入了r9700)会好一些,但是他的思维会陷入一个死循环,就是不断的尝试,但是每一轮尝试下来都是一样的结果,根本解决不了问题。
后来我把跟他的交互记录让deepseek Pro看了一下,Deepseek 2分钟就发现了问题,根本的原因是Hermes斯的对话管理机制,因为它的定位是做一个轻量的助手,所以他的对话几乎都不能持久,然后你过一会不用的话,那个对话就给你关掉了,你在聊天的时候又是一个新的对话,所以说它不是靠对话来管理上下文的,它实际上是靠搜索它的那个对话的数据库来搞的,这样的话,尤其像这种本地小模型智商没那么高的情况下,他有可能抓到的内容是碎片化不相关的。所以导致使用体验非常糟糕,然后我就把同样的咖啡UI的自动化视频流程让他总结了一遍,迁移到了opencode里面。中间有一个断点在opencode里面调用一个魔改版的这个35b一次跑通!因为open code的一个对话就是一个项目,这种开发类的agent框架的上下文比较干净。
工具和模型同样重要,多么痛的领悟,我已经卡了三四天了了。 -
R9700 Proxmox VE 懶人部署兩週運行心得 -
有大神在本地部署 GLM 5.2 吗?这个太不现实了,除非你是视金钱如粪土的富哥。
现在本地部署说实话还是有点儿尴尬,哪怕是27b这样的模型,哪怕你用的是5090,一到agent使用场景,因为现在毕竟是agent时代了,那个pp速度一慢了你如果要是没做好缓存优化的话,你是根本不会想主力用它的。如果只是聊个天,做一点文本工作聊天窗口那种,然后识别个图啊,OCR的话,我以前那个5070ti就挺好的,升级到5090也就是可以跑的量化精度高一点,但是依然解决不了稠密模型在本地部署情况下的慢的问题。你想27b都如此,那像glm5.2这种庞然大物,本地布属真的意义不大。你可以考虑租个云端的卡试验一下,最终的归宿应该还是调用的时候用API,反正现在智谱的,coding plan也买不到。 -
AMD AI Pro R9700 LLM调教@566656661 我在GitHub上下载了一个类似的里面下载量最高的一个,最后实际测试下来v l l m在r9700上性能不如llamacpp vulkan版本。
最后还是老老实实用vulkan吧,毕竟跑35b q5的模型,开三路,pp都能到2300,tp能到50~55。体验已经相当不错了,如果要是能把这个pp再提高到4000左右就比较爽了,agent应用太吃pp了。不过好像也就5090能做到这个水平,但是这破玩意儿现在是真的贵。 -
双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功@linkdesu Ornith 的版本我实测更好,他们官方放出的最低两化版本就是Q5,看来是有道理的。我用了一个日常工作当中用得到的比较难的三个场景测试,它跟deepseek v4 Flash的性能差距在1%,那基本上就是误差以内了。所以我最近连在线版的fassh都用的少了,哈哈,R9700搭配这个模型基本上日日常够用,需要云端的时候就用GLM5.2做个整体规划和验收就行。
-
8g的HBM矿卡170hx解封了
我让AI研究了一下这个玩意儿它解锁完了,也只是把那个屏蔽掉的内存容量释放出来了,带宽是够的,所以在tp阶段是没有任何问题,然后速度也会比较快,因为是带宽受限,但是这个玩意儿pp预处理的速度比较崩,好像这块还没解开。如果只是聊天的话,没有必要本地部署,如果要是有生产需求接入agent的话,pp速度比tp关键太多了,因为你预处理一般都是动不动二三十k的那个系统提示词,pp太慢的话,你会等到天荒地老,没啥意义,不如有着钱不如充点儿deepseek api 用flash吧,体验好很多
-
一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评你说是卡吗?那肯定是amd的AI Pro R9700。带宽只有五零,九零的1/3,价格差不多也是1/3,就看你怎么选择了。32g最大的好处就是可以跑高比特的呃35b,27b的模型是我自己实测比较抗量化的,但是35b的话低于Q4,在agent场景下几乎没有办法用,动不动锻炼,然后死循环,但是高比特的就没有这个问题。我在9700上跑的是Q5的版本,但是我是需要开两个通道。
不管怎么说,是你的钱提前利用AI也好,自己做点功课也好,才能满足你真正的需求。总的一句话就是本地跑的ai不要期待它能跟云端的相比,哪怕是云端的deepseek flash。速度和知识的瓶颈就在那里了,但是对于日常使用大部分场景又都够用了 -
PVE HomeLab ( R9700x2+3090) 極限方案PVE HomeLab ( R9700x2+3090) 極限方案
這一邊是基於前一篇分享 https://lcz.me/post/4772
項目 舊 新 GPU 1× R9700(+ RTX 3090) **2× R9700 + 1× RTX 3090 ** 記憶體 64GB(2×32GB Kingston) 96GB(2×48GB Crucial/Micron DDR5-5600),4 槽用 2 槽,可擴 192GB 額外儲存 — 新增 WD 500GB SATA SSD VM 數量 100/101/103/104 再加 105 cuda-llm-lab** GPU passthrough 單張輪流 三張獨立 mapping(雙 R9700 可各自分派給不同 VM) 硬體規格
項目 品牌 規格 主機板 ASUS ProArt B850-CREATOR WIFI NEO CPU AMD Ryzen 9 9950X3D,16C / 32T 記憶體 Crucial / Micron DDR5-5600 96GB(48GB × 2,Part CP48G56C46U5.M16B1),4 槽用 2 槽顯示卡 #1 ASUS Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 03:00顯示卡 #2 PowerColor Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 07:00顯示卡 #3 ZOTAC GeForce RTX 3090(GA102,24GB),PCI 0a:00內顯 AMD Granite Ridge Radeon Graphics(iGPU),PCI 12:00有線網路 Realtek RTL8126 5GbE × 2 無線網路 Realtek RTL8922AE Wi-Fi 7 / 802.11be 系統碟 Crucial T500 NVMe SSD,2TB( CT2000T500SSD8)媒體碟 Samsung PM9A1 類 NVMe SSD,約 477GB( MZVL2512HDJD)追加資料碟 WDC WD Blue 500GB SATA SSD( WDS500G2B0A,ext4)Windows 系統碟 Predator GM9 NVMe SSD,約 1TB(NTFS,獨立 Windows 11,星際公民用) CPU 散熱 DeepCool Digital ASSASSIN IV VC VISION 機殼風扇 Noctua 12cm PWM / 14cm 電源 NZXT 1500W 機殼 Cooler Master QUBE 540 3090的話是採用開源宇宙的 OCulink + ADT m.2 PCIE 連接器,
採購建議 :
| 開源宇宙的質感極差,文件相關的資訊也不清楚
| ADT 品質不錯,但如果你放在機殼裡面的話建議超過50公分會比較好處理,然後要注意方向
目前的配置全部都是靠風冷,採用貓頭鷹官方推薦的上下進出佈局,基本上溫度都可以壓在50到70之間,極少時候才能拉到80,外部顯卡反而散熱的問題很嚴重,所以在機殼側邊掛了一顆酷冷的12cm風扇直吹
PCIe 通道分拆與 8×8 顯卡策略
9950X3D(Granite Ridge / AM5)對外總共 28 條 PCIe 5.0 lane:24 條給裝置、4 條當晶片組上行。這台把 28 條全部用好用滿,實測從 CPU root port 拉出來的分配如下:
CPU root port Lane(LnkCap) 掛什麼 協商速度 (LnkSta) 說明 00:01.1x8 R9700 #1(ASUS, 03:00)Gen5 x8 顯卡通道前半 00:01.3x8 R9700 #2(PowerColor, 07:00)Gen5 x8 顯卡通道後半 00:01.2x4 Predator GM9 M.2(Windows 碟) Gen5 x4 CPU 直連 M.2 00:02.2x4 Crucial T500 M.2(PVE 系統碟) Gen4 x4 CPU 直連 M.2 00:02.1x4 → B850 晶片組上行 Gen4 x4 底下再扇出一堆裝置 核心策略:把 CPU 的 16 條顯卡 lane 對半拆成 x8 + x8,兩張 R9700 各吃一半。
這是 AM5 平台想「兩張主力卡都直連 CPU」的唯一解——AM5 只有 16 條 PEG lane,要塞兩張就必須在 BIOS 開 PCIe bifurcation(x8/x8)。實測00:01.1與00:01.3的LnkCap Width都是 x8,證明分拆已生效。每張 R9700 前面還掛著一顆 PCIe switch(
1002:1478/1479):上游對 CPU 是 x8,下游對 GPU die 是 x16,所以卡端 endpoint 讀到的是Width x16,但真正的瓶頸帶寬是 CPU 側的 x8 Gen5(約 32 GB/s)。對 AI 推理來說完全夠——權重載入一次後就吃算力,不吃 host 頻寬。第三張卡 RTX 3090 沒有 CPU lane 可用(16 條已被雙 R9700 佔滿),只能掛到 B850 晶片組那條 x4 Gen4 上行下面,和兩張 5GbE、Samsung PM9A1、Wi-Fi 7、USB、SATA 共享頻寬,因此協商成 x4。當遊戲 / CUDA 實驗卡用足夠,但別期待它有滿頻寬。
CPU 9950X3D — 28× PCIe 5.0 lanes ├── x8 Gen5 ── R9700 #1 (ASUS, 03:00) ┐ ├── x8 Gen5 ── R9700 #2 (PowerColor, 07:00) ┘ ← 16 條顯卡 lane 拆成 8×8 ├── x4 Gen5 ── Predator GM9 M.2 (Windows 碟) ├── x4 Gen4 ── Crucial T500 M.2 (PVE 系統碟) └── x4 Gen4 ── B850 晶片組 ├── RTX 3090 (0a:00, x4 downgraded) ├── RTL8126 5GbE ×2 ├── Samsung PM9A1 NVMe (media) ├── RTL8922AE Wi-Fi 7 └── USB / SATA提醒:閒置時 link 會降到
2.5GT/s(ASPM 省電),例如 R9700 #2、RTX 3090 目前顯示 Gen1 x8/x4,這是正常降頻,跑推理 / 遊戲時會自動 train 回 Gen5 / Gen4。判斷「有沒有拆成 x8」要看LnkCap Width,不是看即時LnkSta Speed。你如果要是有其他的机器用的话,可以考虑把这个装pve,然后显卡直通给虚拟机。如果两张显卡不协同工作的话,甚至可以分配个不同的虚拟机来做不同的事情,如果一个崩溃了,不至于影响所有服务,硬件不能解耦的话,用虚拟机解耦还是不错的选择。
你这个主板有点儿豪华,都能放进显存的时候,其实没有必要用这么豪华的板子。可以考虑一下戴尔的7820或者7920工作站,原生pcie lane就很多,如果用贵的PCIe5然后再拆分就没什么意义了,速度又变回pcie4了。小小的建议。
-
R9700 ai pro 32G 跑Qwen3.6 27B q6k 速度实测 -
R9700 Proxmox VE 懶人部署兩週運行心得@AGI 我的amd R9700还没到,所以这一块的直通不太好说,但是英伟达的也是需要折腾一下,他那个驱动有时候会比较挑。也跟你用的乌班图的版本有关系,有些版本的驱动不兼容,这个确实需要折腾一下,n卡也不是说即插即用的。
你如果局域网有另外的机器的话,可以在另外一台机器上装一个Hermes,Deepseek v4flash就能搞定这些工作,都不需要太聪明的模型。AI时代能给AI版的尽量给他,配置好了以后在pve里面做好备份,后续再崩溃了就很容易了。 -
一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评@terry
我也是看到了你的视频以后才了解到amd现在跑本地模型的生态算是比较成熟了才入手的R9700,感谢。
你说的这个问题有两个缓解的办法,35b用ornith官方的Q5,Q6效果不错,属于是质量和速度的平衡,日用不做代码不开发的话驱动和维斯非常好用,完全够了,原版的容易死循环。27b我也下载好了,需要绝对的输出质量的时候,我就让另一个运维的赫mes切换一下,切换也做成技能了,一句话的事情很简单。
成年人我都要,27b和35b各有所长吧

-
两块5070TI 16G 能部署什么样的本地模型,分别提供给2个人使用,相互不影响?@kos-or Qwen3.6-35B-A3B这个模型在工具调用的场景下非常糟糕,我换了可能不下20个版本,但是几乎每一个都会陷入死循环,然后工具调用崩溃。
-
从 41 到 56 tok/s:我修好了 DFlash 官方 benchmark 的 bug,顺手在 7900 XTX 上搭了全套联网大模型@williamlouis
配合OpenWebUI看来不是搞代码的需求,这种情况下可以考虑27B的iQ3系列,日用和正常的Q4没什么区别。以前用5070ti的时候用这个效果很棒,又快又稳,简单的脚本之类的也没有问题。
下面这个实测不错,但是不要用xs和s版本那两个会崩,因为这些作者他们量化完了以后不会自己运行实际跑,所以要跑几个不同的版本精挑细选一下。
https://huggingface.co/mradermacher/Huihui-Qwen3.6-27B-abliterated-i1-GGUF?show_file_info=Huihui-Qwen3.6-27B-abliterated.i1-IQ3_XXS.gguf -
3060 12GB+32GB RAM训练Qwen image lora的方法我自己训练用5070Ti,Qwen image 的lora实测250和500步有区别再多了没啥卵用,而且说是有过拟合 的风险。3000步多了些,毕竟你素材也不多。
-
两块5070TI 16G 能部署什么样的本地模型,分别提供给2个人使用,相互不影响?可以试试Llamacpp的np2,双slots。
如果如果做row切分的话可以可以加速到单卡的1.8倍左右速度,值得尝试,我以前也想过但是机箱放不下双卡。 -
大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?@Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
一套下来体验很好。
-
SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署! -
从 41 到 56 tok/s:我修好了 DFlash 官方 benchmark 的 bug,顺手在 7900 XTX 上搭了全套联网大模型ddg的搜索质量还是有点堪忧啊,感觉用searngx做聚合,把你实测质量比较好的搜索源的权重提高点效果比较好。外挂搜索引擎确实是弥补本地小模型知识库这个最大短版的印度神油

-
实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率@Colt
我自己用下来本地AI跑Agent的命门在缓存,启用Llamacpp的缓存机制,多试试各种不同组合总有一个可用的。
自己的经验是之前(5070ti跑27B IQ3XXS)Hermes吐字大概要10s左右,而且会越来越慢,缓存的问题解决以后基本在3-5s,因为Hermes的系统提示词部分不用每次让5070Ti再重算了。体验好很多,但是我后来还是不用了,因为Deepseek V4 flash太便宜了,哈哈,除非需要识图的时候让Hermes自己做了个技能,需要的时候自己停掉Comfyui调用27B,因为目前单卡。