跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

fcmeF

fcme

@fcme
技术大牛 劳动模范
取消关注 关注
关于
帖子
58
主题
1
分享
0
群组
2
粉丝
1
关注
0

帖子

最新 最佳 有争议的

  • 还以为会很折腾,没想到一下就好了弄好了:7900xtx
    fcmeF fcme

    跑代码的话27B肯定更稳,但是太慢了性子稍稍急一点就招架不住,尤其是agent类应用,输入远远远远大于输出,所以pp速度更重要27b我是等不及了,在R970零里面挂了一个高精度的35b也很爽。其实尤其是现在deepseek v4 flash太便宜了,本地部署的性价比真的是不太高😭

    LLM讨论区 7900xtx

  • 【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s
    fcmeF fcme

    @stormaround
    我也发现这个问题了,试了不下10个这个基座模型的变种,有的量化精度低一些的在Hermes调用几步以后就开始陷入死循环,良化进度高一点的(新入了r9700)会好一些,但是他的思维会陷入一个死循环,就是不断的尝试,但是每一轮尝试下来都是一样的结果,根本解决不了问题。
    后来我把跟他的交互记录让deepseek Pro看了一下,Deepseek 2分钟就发现了问题,根本的原因是Hermes斯的对话管理机制,因为它的定位是做一个轻量的助手,所以他的对话几乎都不能持久,然后你过一会不用的话,那个对话就给你关掉了,你在聊天的时候又是一个新的对话,所以说它不是靠对话来管理上下文的,它实际上是靠搜索它的那个对话的数据库来搞的,这样的话,尤其像这种本地小模型智商没那么高的情况下,他有可能抓到的内容是碎片化不相关的。所以导致使用体验非常糟糕,然后我就把同样的咖啡UI的自动化视频流程让他总结了一遍,迁移到了opencode里面。中间有一个断点在opencode里面调用一个魔改版的这个35b一次跑通!因为open code的一个对话就是一个项目,这种开发类的agent框架的上下文比较干净。
    工具和模型同样重要,多么痛的领悟,我已经卡了三四天了了。

    LLM讨论区 7900xtx amd llama.cpp

  • R9700 Proxmox VE 懶人部署兩週運行心得
    fcmeF fcme

    @AGI 说:

    proxmox能用?我以为效果一般呢。我专门找出来个闲置的sata ssd,安装的Ubuntu,如果可用,我就用回我的proxmox了。

    PVE对于Homelab来说基本是终极方案,尤其对于咱们这样的折腾人士来说有NAS的话给它挂个PBS自动备份太重要了,崩溃了随时会退,太强了。

    我是一台Dell7820的服务器来跑的,现在一个VM装各种服务和docker等等,另一个VM直通了显卡作为算力中心,LLM/Comfyui都在一起,很好用只是5070Ti算力不错,但是卡显存很难受,所以入了R9700还没到,估计之后又是一顿折腾,哈哈。不过二手的服务器确实很香,稳的一批!

    AI硬件 r9700

  • 有大神在本地部署 GLM 5.2 吗?
    fcmeF fcme

    这个太不现实了,除非你是视金钱如粪土的富哥。
    现在本地部署说实话还是有点儿尴尬,哪怕是27b这样的模型,哪怕你用的是5090,一到agent使用场景,因为现在毕竟是agent时代了,那个pp速度一慢了你如果要是没做好缓存优化的话,你是根本不会想主力用它的。如果只是聊个天,做一点文本工作聊天窗口那种,然后识别个图啊,OCR的话,我以前那个5070ti就挺好的,升级到5090也就是可以跑的量化精度高一点,但是依然解决不了稠密模型在本地部署情况下的慢的问题。你想27b都如此,那像glm5.2这种庞然大物,本地布属真的意义不大。你可以考虑租个云端的卡试验一下,最终的归宿应该还是调用的时候用API,反正现在智谱的,coding plan也买不到。

    LLM讨论区

  • AMD AI Pro R9700 LLM调教
    fcmeF fcme

    @566656661 我在GitHub上下载了一个类似的里面下载量最高的一个,最后实际测试下来v l l m在r9700上性能不如llamacpp vulkan版本。
    最后还是老老实实用vulkan吧,毕竟跑35b q5的模型,开三路,pp都能到2300,tp能到50~55。体验已经相当不错了,如果要是能把这个pp再提高到4000左右就比较爽了,agent应用太吃pp了。不过好像也就5090能做到这个水平,但是这破玩意儿现在是真的贵。

    LLM讨论区 r9700 ai-pro-r9700 amd

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    fcmeF fcme

    @linkdesu Ornith 的版本我实测更好,他们官方放出的最低两化版本就是Q5,看来是有道理的。我用了一个日常工作当中用得到的比较难的三个场景测试,它跟deepseek v4 Flash的性能差距在1%,那基本上就是误差以内了。所以我最近连在线版的fassh都用的少了,哈哈,R9700搭配这个模型基本上日日常够用,需要云端的时候就用GLM5.2做个整体规划和验收就行。

    LLM讨论区 r9700 ai-pro-r9700 sg-lang

  • 8g的HBM矿卡170hx解封了
    fcmeF fcme

    Screenshot_20260723_142849_com_termux_TermuxActivity.jpg

    我让AI研究了一下这个玩意儿它解锁完了,也只是把那个屏蔽掉的内存容量释放出来了,带宽是够的,所以在tp阶段是没有任何问题,然后速度也会比较快,因为是带宽受限,但是这个玩意儿pp预处理的速度比较崩,好像这块还没解开。如果只是聊天的话,没有必要本地部署,如果要是有生产需求接入agent的话,pp速度比tp关键太多了,因为你预处理一般都是动不动二三十k的那个系统提示词,pp太慢的话,你会等到天荒地老,没啥意义,不如有着钱不如充点儿deepseek api 用flash吧,体验好很多

    AI硬件

  • 一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评
    fcmeF fcme

    你说是卡吗?那肯定是amd的AI Pro R9700。带宽只有五零,九零的1/3,价格差不多也是1/3,就看你怎么选择了。32g最大的好处就是可以跑高比特的呃35b,27b的模型是我自己实测比较抗量化的,但是35b的话低于Q4,在agent场景下几乎没有办法用,动不动锻炼,然后死循环,但是高比特的就没有这个问题。我在9700上跑的是Q5的版本,但是我是需要开两个通道。
    不管怎么说,是你的钱提前利用AI也好,自己做点功课也好,才能满足你真正的需求。总的一句话就是本地跑的ai不要期待它能跟云端的相比,哪怕是云端的deepseek flash。速度和知识的瓶颈就在那里了,但是对于日常使用大部分场景又都够用了

    AI硬件 7900xtx

  • PVE HomeLab ( R9700x2+3090) 極限方案
    fcmeF fcme

    @CS6 说:

    PVE HomeLab ( R9700x2+3090) 極限方案

    這一邊是基於前一篇分享 https://lcz.me/post/4772

    項目 舊 新
    GPU 1× R9700(+ RTX 3090) **2× R9700 + 1× RTX 3090 **
    記憶體 64GB(2×32GB Kingston) 96GB(2×48GB Crucial/Micron DDR5-5600),4 槽用 2 槽,可擴 192GB
    額外儲存 — 新增 WD 500GB SATA SSD
    VM 數量 100/101/103/104 再加 105 cuda-llm-lab**
    GPU passthrough 單張輪流 三張獨立 mapping(雙 R9700 可各自分派給不同 VM)

    硬體規格

    項目 品牌 規格
    主機板 ASUS ProArt B850-CREATOR WIFI NEO
    CPU AMD Ryzen 9 9950X3D,16C / 32T
    記憶體 Crucial / Micron DDR5-5600 96GB(48GB × 2,Part CP48G56C46U5.M16B1),4 槽用 2 槽
    顯示卡 #1 ASUS Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 03:00
    顯示卡 #2 PowerColor Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 07:00
    顯示卡 #3 ZOTAC GeForce RTX 3090(GA102,24GB),PCI 0a:00
    內顯 AMD Granite Ridge Radeon Graphics(iGPU),PCI 12:00
    有線網路 Realtek RTL8126 5GbE × 2
    無線網路 Realtek RTL8922AE Wi-Fi 7 / 802.11be
    系統碟 Crucial T500 NVMe SSD,2TB(CT2000T500SSD8)
    媒體碟 Samsung PM9A1 類 NVMe SSD,約 477GB(MZVL2512HDJD)
    追加資料碟 WDC WD Blue 500GB SATA SSD(WDS500G2B0A,ext4)
    Windows 系統碟 Predator GM9 NVMe SSD,約 1TB(NTFS,獨立 Windows 11,星際公民用)
    CPU 散熱 DeepCool Digital ASSASSIN IV VC VISION
    機殼風扇 Noctua 12cm PWM / 14cm
    電源 NZXT 1500W
    機殼 Cooler Master QUBE 540

    3090的話是採用開源宇宙的 OCulink + ADT m.2 PCIE 連接器,

    採購建議 :
    | 開源宇宙的質感極差,文件相關的資訊也不清楚
    | ADT 品質不錯,但如果你放在機殼裡面的話建議超過50公分會比較好處理,然後要注意方向

    中IMG_8499.jpeg

    目前的配置全部都是靠風冷,採用貓頭鷹官方推薦的上下進出佈局,基本上溫度都可以壓在50到70之間,極少時候才能拉到80,外部顯卡反而散熱的問題很嚴重,所以在機殼側邊掛了一顆酷冷的12cm風扇直吹

    PCIe 通道分拆與 8×8 顯卡策略

    9950X3D(Granite Ridge / AM5)對外總共 28 條 PCIe 5.0 lane:24 條給裝置、4 條當晶片組上行。這台把 28 條全部用好用滿,實測從 CPU root port 拉出來的分配如下:

    CPU root port Lane(LnkCap) 掛什麼 協商速度 (LnkSta) 說明
    00:01.1 x8 R9700 #1(ASUS,03:00) Gen5 x8 顯卡通道前半
    00:01.3 x8 R9700 #2(PowerColor,07:00) Gen5 x8 顯卡通道後半
    00:01.2 x4 Predator GM9 M.2(Windows 碟) Gen5 x4 CPU 直連 M.2
    00:02.2 x4 Crucial T500 M.2(PVE 系統碟) Gen4 x4 CPU 直連 M.2
    00:02.1 x4 → B850 晶片組上行 Gen4 x4 底下再扇出一堆裝置

    核心策略:把 CPU 的 16 條顯卡 lane 對半拆成 x8 + x8,兩張 R9700 各吃一半。
    這是 AM5 平台想「兩張主力卡都直連 CPU」的唯一解——AM5 只有 16 條 PEG lane,要塞兩張就必須在 BIOS 開 PCIe bifurcation(x8/x8)。實測 00:01.1 與 00:01.3 的 LnkCap Width 都是 x8,證明分拆已生效。

    每張 R9700 前面還掛著一顆 PCIe switch(1002:1478/1479):上游對 CPU 是 x8,下游對 GPU die 是 x16,所以卡端 endpoint 讀到的是 Width x16,但真正的瓶頸帶寬是 CPU 側的 x8 Gen5(約 32 GB/s)。對 AI 推理來說完全夠——權重載入一次後就吃算力,不吃 host 頻寬。

    第三張卡 RTX 3090 沒有 CPU lane 可用(16 條已被雙 R9700 佔滿),只能掛到 B850 晶片組那條 x4 Gen4 上行下面,和兩張 5GbE、Samsung PM9A1、Wi-Fi 7、USB、SATA 共享頻寬,因此協商成 x4。當遊戲 / CUDA 實驗卡用足夠,但別期待它有滿頻寬。

    CPU 9950X3D — 28× PCIe 5.0 lanes
    ├── x8  Gen5 ── R9700 #1 (ASUS,       03:00) ┐
    ├── x8  Gen5 ── R9700 #2 (PowerColor, 07:00) ┘ ← 16 條顯卡 lane 拆成 8×8
    ├── x4  Gen5 ── Predator GM9 M.2  (Windows 碟)
    ├── x4  Gen4 ── Crucial T500 M.2  (PVE 系統碟)
    └── x4  Gen4 ── B850 晶片組
                    ├── RTX 3090 (0a:00, x4 downgraded)
                    ├── RTL8126 5GbE ×2
                    ├── Samsung PM9A1 NVMe (media)
                    ├── RTL8922AE Wi-Fi 7
                    └── USB / SATA
    

    提醒:閒置時 link 會降到 2.5GT/s(ASPM 省電),例如 R9700 #2、RTX 3090 目前顯示 Gen1 x8/x4,這是正常降頻,跑推理 / 遊戲時會自動 train 回 Gen5 / Gen4。判斷「有沒有拆成 x8」要看 LnkCap Width,不是看即時 LnkSta Speed。

    你如果要是有其他的机器用的话,可以考虑把这个装pve,然后显卡直通给虚拟机。如果两张显卡不协同工作的话,甚至可以分配个不同的虚拟机来做不同的事情,如果一个崩溃了,不至于影响所有服务,硬件不能解耦的话,用虚拟机解耦还是不错的选择。
    你这个主板有点儿豪华,都能放进显存的时候,其实没有必要用这么豪华的板子。可以考虑一下戴尔的7820或者7920工作站,原生pcie lane就很多,如果用贵的PCIe5然后再拆分就没什么意义了,速度又变回pcie4了。

    小小的建议。

    AI硬件 rtx3090 r9700

  • R9700 ai pro 32G 跑Qwen3.6 27B q6k 速度实测
    fcmeF fcme

    @Xiaote 说:

    长上下文(64K+):prefill 可能 10-20s,这就确实比较考验耐心了

    对于Agent累的应用,强烈建议缓存方面的设置,我的5070ti优化了缓存和对话间缓存以后首字从10s以上掉到3-5s,体验好太多了。这种AGENT的东西,系统提示词和对话的增长实在太快了,本地运行的话缓存一定重视起来,另外Deepseek Engram架构希望早日用到小模型上,感觉那时候才是本地的真正的春天,知识库靠SSD,缓存借用RAM,以存代算才是本地的未来,哈哈!

    AI硬件 r9700

  • R9700 Proxmox VE 懶人部署兩週運行心得
    fcmeF fcme

    @AGI 我的amd R9700还没到,所以这一块的直通不太好说,但是英伟达的也是需要折腾一下,他那个驱动有时候会比较挑。也跟你用的乌班图的版本有关系,有些版本的驱动不兼容,这个确实需要折腾一下,n卡也不是说即插即用的。
    你如果局域网有另外的机器的话,可以在另外一台机器上装一个Hermes,Deepseek v4flash就能搞定这些工作,都不需要太聪明的模型。AI时代能给AI版的尽量给他,配置好了以后在pve里面做好备份,后续再崩溃了就很容易了。

    AI硬件 r9700

  • 一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评
    fcmeF fcme

    @terry
    我也是看到了你的视频以后才了解到amd现在跑本地模型的生态算是比较成熟了才入手的R9700,感谢。
    你说的这个问题有两个缓解的办法,35b用ornith官方的Q5,Q6效果不错,属于是质量和速度的平衡,日用不做代码不开发的话驱动和维斯非常好用,完全够了,原版的容易死循环。27b我也下载好了,需要绝对的输出质量的时候,我就让另一个运维的赫mes切换一下,切换也做成技能了,一句话的事情很简单。
    成年人我都要,27b和35b各有所长吧😂😂

    AI硬件 7900xtx

  • 两块5070TI 16G 能部署什么样的本地模型,分别提供给2个人使用,相互不影响?
    fcmeF fcme

    @kos-or Qwen3.6-35B-A3B这个模型在工具调用的场景下非常糟糕,我换了可能不下20个版本,但是几乎每一个都会陷入死循环,然后工具调用崩溃。

    LLM讨论区

  • 从 41 到 56 tok/s:我修好了 DFlash 官方 benchmark 的 bug,顺手在 7900 XTX 上搭了全套联网大模型
    fcmeF fcme

    @williamlouis
    配合OpenWebUI看来不是搞代码的需求,这种情况下可以考虑27B的iQ3系列,日用和正常的Q4没什么区别。以前用5070ti的时候用这个效果很棒,又快又稳,简单的脚本之类的也没有问题。
    下面这个实测不错,但是不要用xs和s版本那两个会崩,因为这些作者他们量化完了以后不会自己运行实际跑,所以要跑几个不同的版本精挑细选一下。
    https://huggingface.co/mradermacher/Huihui-Qwen3.6-27B-abliterated-i1-GGUF?show_file_info=Huihui-Qwen3.6-27B-abliterated.i1-IQ3_XXS.gguf

    LLM讨论区

  • 3060 12GB+32GB RAM训练Qwen image lora的方法
    fcmeF fcme

    我自己训练用5070Ti,Qwen image 的lora实测250和500步有区别再多了没啥卵用,而且说是有过拟合 的风险。3000步多了些,毕竟你素材也不多。

    LLM讨论区 rtx3060

  • 两块5070TI 16G 能部署什么样的本地模型,分别提供给2个人使用,相互不影响?
    fcmeF fcme

    可以试试Llamacpp的np2,双slots。
    如果如果做row切分的话可以可以加速到单卡的1.8倍左右速度,值得尝试,我以前也想过但是机箱放不下双卡。

    LLM讨论区

  • 大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?
    fcmeF fcme

    @Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
    我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。

    本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
    一套下来体验很好。

    aab76594-307d-4abe-b3c7-109f60d82d31-image.jpeg

    LLM讨论区

  • SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署!
    fcmeF fcme

    @loulan 说:

    AMD R9700可以这么部署吗?

    目前不可以,我也是9700查了一圈sclang对amd支持稀烂。970用Q5以上的35b很好用,27b的话还是太慢了,能力上来说肯定27b好一点点,但是只是驱动和Hermes的话就没区别

    AI Agent sg-lang qwen3.6-27b hermes

  • 从 41 到 56 tok/s:我修好了 DFlash 官方 benchmark 的 bug,顺手在 7900 XTX 上搭了全套联网大模型
    fcmeF fcme

    ddg的搜索质量还是有点堪忧啊,感觉用searngx做聚合,把你实测质量比较好的搜索源的权重提高点效果比较好。外挂搜索引擎确实是弥补本地小模型知识库这个最大短版的印度神油😂

    LLM讨论区

  • 实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率
    fcmeF fcme

    @Colt
    我自己用下来本地AI跑Agent的命门在缓存,启用Llamacpp的缓存机制,多试试各种不同组合总有一个可用的。
    自己的经验是之前(5070ti跑27B IQ3XXS)Hermes吐字大概要10s左右,而且会越来越慢,缓存的问题解决以后基本在3-5s,因为Hermes的系统提示词部分不用每次让5070Ti再重算了。体验好很多,但是我后来还是不用了,因为Deepseek V4 flash太便宜了,哈哈,除非需要识图的时候让Hermes自己做了个技能,需要的时候自己停掉Comfyui调用27B,因为目前单卡。

    AI Agent hermes
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组