跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
fcmeF

fcme

@fcme
技术大牛 劳动模范
取消关注 关注
关于
帖子
96
主题
2
分享
0
群组
2
粉丝
4
关注
0

帖子

最新 最佳 有争议的

  • 还以为会很折腾,没想到一下就好了弄好了:7900xtx
    fcmeF fcme

    跑代码的话27B肯定更稳,但是太慢了性子稍稍急一点就招架不住,尤其是agent类应用,输入远远远远大于输出,所以pp速度更重要27b我是等不及了,在R970零里面挂了一个高精度的35b也很爽。其实尤其是现在deepseek v4 flash太便宜了,本地部署的性价比真的是不太高😭

    LLM讨论区 7900xtx

  • R9700 Proxmox VE 懶人部署兩週運行心得
    fcmeF fcme

    @AGI 说:

    proxmox能用?我以为效果一般呢。我专门找出来个闲置的sata ssd,安装的Ubuntu,如果可用,我就用回我的proxmox了。

    PVE对于Homelab来说基本是终极方案,尤其对于咱们这样的折腾人士来说有NAS的话给它挂个PBS自动备份太重要了,崩溃了随时会退,太强了。

    我是一台Dell7820的服务器来跑的,现在一个VM装各种服务和docker等等,另一个VM直通了显卡作为算力中心,LLM/Comfyui都在一起,很好用只是5070Ti算力不错,但是卡显存很难受,所以入了R9700还没到,估计之后又是一顿折腾,哈哈。不过二手的服务器确实很香,稳的一批!

    AI硬件 r9700

  • 【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s
    fcmeF fcme

    @stormaround
    我也发现这个问题了,试了不下10个这个基座模型的变种,有的量化精度低一些的在Hermes调用几步以后就开始陷入死循环,良化进度高一点的(新入了r9700)会好一些,但是他的思维会陷入一个死循环,就是不断的尝试,但是每一轮尝试下来都是一样的结果,根本解决不了问题。
    后来我把跟他的交互记录让deepseek Pro看了一下,Deepseek 2分钟就发现了问题,根本的原因是Hermes斯的对话管理机制,因为它的定位是做一个轻量的助手,所以他的对话几乎都不能持久,然后你过一会不用的话,那个对话就给你关掉了,你在聊天的时候又是一个新的对话,所以说它不是靠对话来管理上下文的,它实际上是靠搜索它的那个对话的数据库来搞的,这样的话,尤其像这种本地小模型智商没那么高的情况下,他有可能抓到的内容是碎片化不相关的。所以导致使用体验非常糟糕,然后我就把同样的咖啡UI的自动化视频流程让他总结了一遍,迁移到了opencode里面。中间有一个断点在opencode里面调用一个魔改版的这个35b一次跑通!因为open code的一个对话就是一个项目,这种开发类的agent框架的上下文比较干净。
    工具和模型同样重要,多么痛的领悟,我已经卡了三四天了了。

    LLM讨论区 7900xtx amd llama.cpp

  • R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
    fcmeF fcme

    @Alan-TANG
    你这个测试和我自己做的好多测试基本相符,对于本地运行来说,35b和27b只是搞一搞hermes和文书编程类的工作太够用了,正常的ict方面,35b和27b几乎没有区别,所以我测试了不下20个版本的27B和35B后选了基于35b的Ornith Q5,主要是质量不差加速度快,Agent用的时候不便秘。但是这俩搞逻辑纯数学那确实不太行。 所以它完美适配agent应用,只要长链toolcall不掉链子就是好模型,关键是要适配自己的需求。

    另外本地模型可以越狱,云端的一点机会都没有。

    58651.jpg

    LLM讨论区 本地模型 r9700

  • 有大神在本地部署 GLM 5.2 吗?
    fcmeF fcme

    这个太不现实了,除非你是视金钱如粪土的富哥。
    现在本地部署说实话还是有点儿尴尬,哪怕是27b这样的模型,哪怕你用的是5090,一到agent使用场景,因为现在毕竟是agent时代了,那个pp速度一慢了你如果要是没做好缓存优化的话,你是根本不会想主力用它的。如果只是聊个天,做一点文本工作聊天窗口那种,然后识别个图啊,OCR的话,我以前那个5070ti就挺好的,升级到5090也就是可以跑的量化精度高一点,但是依然解决不了稠密模型在本地部署情况下的慢的问题。你想27b都如此,那像glm5.2这种庞然大物,本地布属真的意义不大。你可以考虑租个云端的卡试验一下,最终的归宿应该还是调用的时候用API,反正现在智谱的,coding plan也买不到。

    LLM讨论区 本地模型 glm

  • 我换回3.6 35B了
    fcmeF fcme

    @benton-yi
    哈哈Ornith加一,那天我还想我说这个玩意儿Qwen3.8都出来了,怎么还不更新?结果一上官网官网把1.5的版本刚刚推出来两个小时。
    现在它是我的独力模型,其实日常的使用完全够了,不管是配合dsh还是Hermes。dsh的话体感会好一些,配了deepseek的API以后搜索能力会比较强。

    AI硬件 qwen

  • Hermes Agent 集群配置,多电脑多Profile,分工协作减少单个Agent记忆长度太长导致智力下降,API开销大的问题!云端+本地综合方案!
    fcmeF fcme

    确实,我也发现这个问题。相同的物理机上多开Hermes,一个挂了还能抢救另一个,俩的任务也能分开,他们的记忆系统不至于混乱。
    Hermes标榜的的可以自我进化,这是绝对有它的好处的,但是坏处就是容易产生一大堆垃圾,也是屎山。所以,一个小技巧就是每周(或者说按自己需求的频率)让他自己检测自己的记忆系统和新创的技能。让他审视完了以后给你一个清理计划,批准了再执行,这样的话,就知道Hermes的大脑里到底现在存了些什么东西。一般去个重,然后再删除一些无用的垃圾(他理解错的内容)就会又很好用了。

    AI Agent hermes

  • 7900XTX + llama.cpp Qwen3.6 27B TurboQuant + MTP 测试结果分享
    fcmeF fcme

    5000多人民币能买到带三年质保的新卡,还有24g高带宽显存的卡也就它了吧,这性价比其实已经爆棚了😁
    可以关注一下27b的IQ量化系列,体积小一点,质量和速度都不差的。尤其是编译的时候,把wmma开启了的话,用hip llamacpp的PP速度能提示30%以上,实用度暴增。
    我双路服务器,所以都有点儿后悔买9700了,没搞两张7900XTX,容量更大,速度应该比9700快将近一倍。

    LLM讨论区 7900xtx mtp llama.cpp

  • 请问这个视频中 Qwen3.6 35b a3b 25token/s 是个什么水平?
    fcmeF fcme

    @crazypeace
    没什么卵用,在Windows系统下和Linux下只要是个8g以上的显卡就能跑到这个速度,因为这个时候的速tp度是PCIe限制死的。如果是麦克的话是被显存带宽限制死的。顶多就是能跑起来而已,但是跑不顺。
    Agent时代输入普遍很大,而输出比较少。PP速度慢了,除了纯聊天的场景,你不会想用下去的。

    AI硬件 qwen-27b 视频生成

  • AMD AI Pro R9700 LLM调教
    fcmeF fcme

    @566656661 我在GitHub上下载了一个类似的里面下载量最高的一个,最后实际测试下来v l l m在r9700上性能不如llamacpp vulkan版本。
    最后还是老老实实用vulkan吧,毕竟跑35b q5的模型,开三路,pp都能到2300,tp能到50~55。体验已经相当不错了,如果要是能把这个pp再提高到4000左右就比较爽了,agent应用太吃pp了。不过好像也就5090能做到这个水平,但是这破玩意儿现在是真的贵。

    LLM讨论区 r9700 ai-pro-r9700 amd

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    fcmeF fcme

    @linkdesu Ornith 的版本我实测更好,他们官方放出的最低两化版本就是Q5,看来是有道理的。我用了一个日常工作当中用得到的比较难的三个场景测试,它跟deepseek v4 Flash的性能差距在1%,那基本上就是误差以内了。所以我最近连在线版的fassh都用的少了,哈哈,R9700搭配这个模型基本上日日常够用,需要云端的时候就用GLM5.2做个整体规划和验收就行。

    LLM讨论区 r9700 ai-pro-r9700 sg-lang

  • 8g的HBM矿卡170hx解封了
    fcmeF fcme

    Screenshot_20260723_142849_com_termux_TermuxActivity.jpg

    我让AI研究了一下这个玩意儿它解锁完了,也只是把那个屏蔽掉的内存容量释放出来了,带宽是够的,所以在tp阶段是没有任何问题,然后速度也会比较快,因为是带宽受限,但是这个玩意儿pp预处理的速度比较崩,好像这块还没解开。如果只是聊天的话,没有必要本地部署,如果要是有生产需求接入agent的话,pp速度比tp关键太多了,因为你预处理一般都是动不动二三十k的那个系统提示词,pp太慢的话,你会等到天荒地老,没啥意义,不如有着钱不如充点儿deepseek api 用flash吧,体验好很多

    AI硬件

  • R9700 ai pro 32G 跑Qwen3.6 27B q6k 速度实测
    fcmeF fcme

    @Xiaote 说:

    长上下文(64K+):prefill 可能 10-20s,这就确实比较考验耐心了

    对于Agent累的应用,强烈建议缓存方面的设置,我的5070ti优化了缓存和对话间缓存以后首字从10s以上掉到3-5s,体验好太多了。这种AGENT的东西,系统提示词和对话的增长实在太快了,本地运行的话缓存一定重视起来,另外Deepseek Engram架构希望早日用到小模型上,感觉那时候才是本地的真正的春天,知识库靠SSD,缓存借用RAM,以存代算才是本地的未来,哈哈!

    AI硬件 r9700

  • ornith-1.0-35b Q8 與 Qwen3.6-35b-a3b Q8....大家覺的哪個更優秀?
    fcmeF fcme

    @David-Chen
    Ornith Q5/Q6就很好,在你5090上应该可以飞起,或者你自己下载原始权重量化个FP8估计更快。
    就非软件工程师的普通ICT应用来说足矣,看DS Pro对它工作的评价。
    58651.jpg

    随便聊聊 qwen-27b 量化

  • PVE HomeLab ( R9700x2+3090) 極限方案
    fcmeF fcme

    @CS6 说:

    PVE HomeLab ( R9700x2+3090) 極限方案

    這一邊是基於前一篇分享 https://lcz.me/post/4772

    項目 舊 新
    GPU 1× R9700(+ RTX 3090) **2× R9700 + 1× RTX 3090 **
    記憶體 64GB(2×32GB Kingston) 96GB(2×48GB Crucial/Micron DDR5-5600),4 槽用 2 槽,可擴 192GB
    額外儲存 — 新增 WD 500GB SATA SSD
    VM 數量 100/101/103/104 再加 105 cuda-llm-lab**
    GPU passthrough 單張輪流 三張獨立 mapping(雙 R9700 可各自分派給不同 VM)

    硬體規格

    項目 品牌 規格
    主機板 ASUS ProArt B850-CREATOR WIFI NEO
    CPU AMD Ryzen 9 9950X3D,16C / 32T
    記憶體 Crucial / Micron DDR5-5600 96GB(48GB × 2,Part CP48G56C46U5.M16B1),4 槽用 2 槽
    顯示卡 #1 ASUS Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 03:00
    顯示卡 #2 PowerColor Radeon AI PRO R9700(Navi 48 / RDNA4,32GB),PCI 07:00
    顯示卡 #3 ZOTAC GeForce RTX 3090(GA102,24GB),PCI 0a:00
    內顯 AMD Granite Ridge Radeon Graphics(iGPU),PCI 12:00
    有線網路 Realtek RTL8126 5GbE × 2
    無線網路 Realtek RTL8922AE Wi-Fi 7 / 802.11be
    系統碟 Crucial T500 NVMe SSD,2TB(CT2000T500SSD8)
    媒體碟 Samsung PM9A1 類 NVMe SSD,約 477GB(MZVL2512HDJD)
    追加資料碟 WDC WD Blue 500GB SATA SSD(WDS500G2B0A,ext4)
    Windows 系統碟 Predator GM9 NVMe SSD,約 1TB(NTFS,獨立 Windows 11,星際公民用)
    CPU 散熱 DeepCool Digital ASSASSIN IV VC VISION
    機殼風扇 Noctua 12cm PWM / 14cm
    電源 NZXT 1500W
    機殼 Cooler Master QUBE 540

    3090的話是採用開源宇宙的 OCulink + ADT m.2 PCIE 連接器,

    採購建議 :
    | 開源宇宙的質感極差,文件相關的資訊也不清楚
    | ADT 品質不錯,但如果你放在機殼裡面的話建議超過50公分會比較好處理,然後要注意方向

    中IMG_8499.jpeg

    目前的配置全部都是靠風冷,採用貓頭鷹官方推薦的上下進出佈局,基本上溫度都可以壓在50到70之間,極少時候才能拉到80,外部顯卡反而散熱的問題很嚴重,所以在機殼側邊掛了一顆酷冷的12cm風扇直吹

    PCIe 通道分拆與 8×8 顯卡策略

    9950X3D(Granite Ridge / AM5)對外總共 28 條 PCIe 5.0 lane:24 條給裝置、4 條當晶片組上行。這台把 28 條全部用好用滿,實測從 CPU root port 拉出來的分配如下:

    CPU root port Lane(LnkCap) 掛什麼 協商速度 (LnkSta) 說明
    00:01.1 x8 R9700 #1(ASUS,03:00) Gen5 x8 顯卡通道前半
    00:01.3 x8 R9700 #2(PowerColor,07:00) Gen5 x8 顯卡通道後半
    00:01.2 x4 Predator GM9 M.2(Windows 碟) Gen5 x4 CPU 直連 M.2
    00:02.2 x4 Crucial T500 M.2(PVE 系統碟) Gen4 x4 CPU 直連 M.2
    00:02.1 x4 → B850 晶片組上行 Gen4 x4 底下再扇出一堆裝置

    核心策略:把 CPU 的 16 條顯卡 lane 對半拆成 x8 + x8,兩張 R9700 各吃一半。
    這是 AM5 平台想「兩張主力卡都直連 CPU」的唯一解——AM5 只有 16 條 PEG lane,要塞兩張就必須在 BIOS 開 PCIe bifurcation(x8/x8)。實測 00:01.1 與 00:01.3 的 LnkCap Width 都是 x8,證明分拆已生效。

    每張 R9700 前面還掛著一顆 PCIe switch(1002:1478/1479):上游對 CPU 是 x8,下游對 GPU die 是 x16,所以卡端 endpoint 讀到的是 Width x16,但真正的瓶頸帶寬是 CPU 側的 x8 Gen5(約 32 GB/s)。對 AI 推理來說完全夠——權重載入一次後就吃算力,不吃 host 頻寬。

    第三張卡 RTX 3090 沒有 CPU lane 可用(16 條已被雙 R9700 佔滿),只能掛到 B850 晶片組那條 x4 Gen4 上行下面,和兩張 5GbE、Samsung PM9A1、Wi-Fi 7、USB、SATA 共享頻寬,因此協商成 x4。當遊戲 / CUDA 實驗卡用足夠,但別期待它有滿頻寬。

    CPU 9950X3D — 28× PCIe 5.0 lanes
    ├── x8  Gen5 ── R9700 #1 (ASUS,       03:00) ┐
    ├── x8  Gen5 ── R9700 #2 (PowerColor, 07:00) ┘ ← 16 條顯卡 lane 拆成 8×8
    ├── x4  Gen5 ── Predator GM9 M.2  (Windows 碟)
    ├── x4  Gen4 ── Crucial T500 M.2  (PVE 系統碟)
    └── x4  Gen4 ── B850 晶片組
                    ├── RTX 3090 (0a:00, x4 downgraded)
                    ├── RTL8126 5GbE ×2
                    ├── Samsung PM9A1 NVMe (media)
                    ├── RTL8922AE Wi-Fi 7
                    └── USB / SATA
    

    提醒:閒置時 link 會降到 2.5GT/s(ASPM 省電),例如 R9700 #2、RTX 3090 目前顯示 Gen1 x8/x4,這是正常降頻,跑推理 / 遊戲時會自動 train 回 Gen5 / Gen4。判斷「有沒有拆成 x8」要看 LnkCap Width,不是看即時 LnkSta Speed。

    你如果要是有其他的机器用的话,可以考虑把这个装pve,然后显卡直通给虚拟机。如果两张显卡不协同工作的话,甚至可以分配个不同的虚拟机来做不同的事情,如果一个崩溃了,不至于影响所有服务,硬件不能解耦的话,用虚拟机解耦还是不错的选择。
    你这个主板有点儿豪华,都能放进显存的时候,其实没有必要用这么豪华的板子。可以考虑一下戴尔的7820或者7920工作站,原生pcie lane就很多,如果用贵的PCIe5然后再拆分就没什么意义了,速度又变回pcie4了。

    小小的建议。

    AI硬件 rtx3090 r9700

  • 我换回3.6 35B了
    fcmeF fcme

    @kos-or
    哦,我的是r9700,没有试Q5以下的版本,Q5反正挺好用

    AI硬件 qwen

  • 授予@fcme @applejuice @johnnybegood @q-maria @kos-orr 技术大牛称号
    fcmeF fcme

    感谢群主提供的学习平台

    站点公告

  • 实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率
    fcmeF fcme

    @Colt 不切换的要善用搜索功能,在线API也好,本地的Searxng也好,可以极大的扩展本地的小模型的脑容量,带价就是要慢点。

    AI Agent hermes

  • 一个7900 xtx 24G 装机单,期望:稳定、高性价比、可拓展,请大神点评
    fcmeF fcme

    你说是卡吗?那肯定是amd的AI Pro R9700。带宽只有五零,九零的1/3,价格差不多也是1/3,就看你怎么选择了。32g最大的好处就是可以跑高比特的呃35b,27b的模型是我自己实测比较抗量化的,但是35b的话低于Q4,在agent场景下几乎没有办法用,动不动锻炼,然后死循环,但是高比特的就没有这个问题。我在9700上跑的是Q5的版本,但是我是需要开两个通道。
    不管怎么说,是你的钱提前利用AI也好,自己做点功课也好,才能满足你真正的需求。总的一句话就是本地跑的ai不要期待它能跟云端的相比,哪怕是云端的deepseek flash。速度和知识的瓶颈就在那里了,但是对于日常使用大部分场景又都够用了

    AI硬件 7900xtx

  • r9700 hermes出token慢
    fcmeF fcme

    跑本地模型基本上都是这样,这个几乎无解,硬件的限制就在这里了。
    但是但是的,但是还是有缓解的办法。第一个开源,开源的话就是用mtp模型,增加推理速度,另外一个就是注意你所使用的框架里面的缓存技术,能缓存的尽量走缓存,嗯,这样的话真正计算的部分量比较小,速度会比较理想一些。节流节流的部分就是赫mes默认它好多嗯默认的系统提示词里面带好多垃圾,比如说有些技能用不上的,有些工具用不上的就可以删除或者屏蔽掉,这样的话,比如说你原来的系统提示词默认是30k然后优化完以后15k的话,那么反应时间会直接减半,然后再结合缓存优化的话,那基本上两三秒之内就可以出字了,我以前的卡是5070ti 16g。体感还不错,但是跟在线版的完全还是没有办法比,感觉deepseek v4flash出来以后,本地部署的价值急剧缩水。哈哈😃

    AI硬件 r9700 hermes
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组