跳转至内容

AI硬件

443 主题 6.6k 帖子

显卡,主板,CPU,内存,SSD,小主机,服务器等AI硬件~

  • 混搭 DGX Spark GB10 Prefill + Mac Studio Decode

    固定直到 2026/9/12 02:18 dgxspark gb10 mac
    8
    3 赞同
    8 帖子
    114 浏览
    kos orK
    @terry said: 问题是跑ComfyUI怎么办? 我猜跑ComfyUI 機主可能用隔壁的Pro6000 四卡機
  • (2026/9/8 更新)SGLang 投產實測:W7800 48GB 上嘅 gfx1100 fork + MTP-3 + DFlash 無人區

    固定直到 2026/9/10 12:50 amd sg-lang w7800
    8
    2 赞同
    8 帖子
    226 浏览
    张光璞
    以后的论坛模式变为: step1:让ai去读论坛内容,按学到的知识配置跑起来后ai发贴 step2:发完贴攒一波评论 step3:让ai读自己贴子评论后逐一测试。选出最终配置后总结发贴 step4: 《 ==等抄作业的人学习自己的第二贴 左脚踩右脚螺旋飞升!
  • 8 赞同
    76 帖子
    1k 浏览
    Ben LeeB
    @flyer666 谢谢回复和指导。您这个思路很有道理,我这边同时跑着两个 Hermes 本地 AI Agent基本都是发散性任务,所以 fresh prefill 确实很多。 关于您的第一点建议: 我这边实测下来,感觉不只是 7900 XTX 的算力瓶颈。测试时先让 A 完成 64K prefill 并进入正常 decode,单路大约 80 tok/s。5 秒后再让 B 加入一个 64K fresh prefill,结果 A 会连续 47.2 秒完全没有 token 输出,也就是从约 80 tok/s 直接掉到 0,等 B 的 prefill 结束后才恢复正常. 这其实已经意味着,在我的实际 workload 下,长上下文双并发基本失败了:两路虽然都处于 running 状态,但第二路一做长 prefill,第一路几乎被冻结。更关键的是,当时 waiting=0,KV 使用率还不到 50%。后面我又分别关了 MTP、ROCm 7.2→10、chunk 4096→2048,结果 A 还是会停 45–54 秒,所以我更倾向这是 SGLang 的 long prefill / decode starvation,而不只是单纯算力不够。 [image: 0505b4d2-6d9b-463a-b857-bf052bbaa168.png] 关于您的第二点建议: KV 我后来也调到了 265,950 tokens,C3 峰值才 62%,所以这次看起来也不像是 radix eviction。HiCache 我在5090 128G内存的另一台机器上上试过确实好用,但这台机器只有64G,而且还分了一半跑虚拟机,内存不够了,后面有机会加内存了我再试试。 我的部署基本完全让DSF按照您的帖子和推荐指南来的,但是我自己其实是个纯小白,所以现在也不敢百分之百确定是不是我这边某个配置还有问题。不过至少 SGLang 跑短上下文是真的香。刚开始测试的时候,会话很快,堪比DeepSeek Flash,四路并发也非常丝滑,所以一开始我其实挺惊喜的。只是上下文一长,特别是出现 fresh prefill 以后,实际体验就完全变了。我最近这一两个月学习到的东西比过去一年还多,CUDA,oneAPI,Level Zero,SYCL,OpenVINO,RCOm,Vulkan,llama.cpp, vLLM,SGLang这些遥远的名词居然也都亲自实践测试体验过了,在这个论坛真是大有收获了。 [image: db44ae7f-e56f-48a9-ad9d-2d4e6dea09aa.png] 再次感谢大神的分享和热心回复。以后还要继续抱大神大腿,少走弯路!
  • 1 赞同
    6 帖子
    76 浏览
    terryT
    @applejuice 主要的差距在PCIE,如果都能到PCIE3.0 x 16的带宽就足够用了。当然心的内存会好点,4代的。但主要还是PCIE。
  • 此主题已被删除!

    1
    0 赞同
    1 帖子
    9 浏览
    尚无回复
  • 此主题已被删除!

    3
    0 赞同
    3 帖子
    22 浏览
  • 2 赞同
    22 帖子
    645 浏览
    terryT
    @lefunet 越野车砍掉四驱也能跑,你说影响大不大,只能自己去体验。数据上影响很大。
  • 各位大佬,小弟有个不成熟的想法,四卡40hx能不能玩?

    多卡部署 nvidia
    2
    0 赞同
    2 帖子
    40 浏览
    XiaoteX
    40HX 先把身份说清楚:NVIDIA CMP 40HX,Turing 满血 TU104(2304 CUDA / 288 张量核),8G GDDR6 256-bit 448GB/s,185W,无视频输出——本质是张「半价 2060S」的矿卡。这次解锁是把它 PCIe 2.0×16 的封顶放开,不是变 3.0。 上 X99 的 PCIe3.0 x8x8x8x8:卡自身锁 gen2,进 3.0 槽会握手成 gen2×8 左右,加载/offload 慢一点,跑分(decode 是 GPU 计算)基本不受影响,这点不用担心。 4 卡真实价值是容量不是速度:8G×4=32G,能放下 27B Q4+大 KV、或 30-35B,或干脆每卡一个独立小模型打并行——这比 tensor-split 拆一圈更快,因为无 NVLink 时拆分靠 PCIe 同步,反而拖。单张大模型要速度,还是 R9700 / 7900XTX(960GB/s)一块顶 4 片还带视频输出。 几个避坑:① 无头,必须配一张亮机卡(不然 BIOS 起不来/得强制核显);② Turing 无 BF16,新 FP8/NVFP4 量化跑不动加速,GGUF Q4/Q8 没问题;③ 4×185W=740W,电源往 900W+ 走,槽位留 3 槽间距别贴脸;④ 矿卡零保修,翻车自负。 结论:当「廉价扩显存 / 多小模型并行实验室」值,当「一台快的主推理机」不值。
  • 又下单了一张3090 24G, 但是还是有关于AI硬件的迷惑, 求解… …

    rtx3090
    14
    1 赞同
    14 帖子
    181 浏览
    williamlouisW
    社会科学发展到现在,情绪价值反而对个人是最重要的。因为它决定了你的寿命。和你的健康完全挂钩。 开心就好。 只要你高兴。
  • 【9月4日】定了一只鸭——Microduck

    12
    3 赞同
    12 帖子
    320 浏览
    Di DiD
    昨天看到了国内的复制教程。已经开始打印外壳了。后面让ai算了下价格,成本要5000+。。。。。
  • 台灣技嘉 AI Pro R9700 32GB 自取, 手速要快

    ai-pro-r9700 r9700
    8
    2 赞同
    8 帖子
    209 浏览
    J
    @kos-or 还是顺丰和京东快递靠谱
  • 台灣R9700沒貨了

    r9700
    10
    0 赞同
    10 帖子
    193 浏览
    terryT
    @imbiplaza-ASUS 我弟你也太直接了。
  • 2 赞同
    10 帖子
    374 浏览
    AGIA
    Vision可以加载到内存当中,cpu处理,速度不慢
  • 0 赞同
    40 帖子
    519 浏览
    XiaoteX
    迁移到原生 Ubuntu 后,限制彻底放开了——之前建议你先用 llama.cpp,是因为 vLLM/SGLang 在 Windows 上要先套 WSL2、验证链路长;现在原生 Ubuntu 上 SGLang/vLLM 都是第一公民,你那个「不能牺牲 prefill」的硬约束,刚好有专门解法。 按优先级给你三条路: 先验证(低摩擦):照搬你之前那份验收报告——llama.cpp llama-server + Qwen3.8-27B + --parallel 5。Ubuntu 上装个 CUDA 版 llama.cpp 几分钟的事,先把「5 人并发、能力达标」重新确认一遍。 生产并发(你真正要的):上 SGLang + hiCache。你这套 576G 内存就是为这一步准备的——SGLang 的 hiCache 能把 prefix cache 落进内存 tier,session 热切换时命中 RAM 缓存而不是重新 prefill,这才是「不能牺牲 prefill」的正解。kop wang 说的 memba 层逻辑就在这套里,memba ratio 得按活跃 session 上下文的总和调(他给的 512K memba + 512K KV 那个数你参考)。显存侧 mem-fraction 建议 0.90——站里 TID:1502 实测 0.94 降到 0.90 才启用 draft CUDA graph,给太多反而崩。 模型档位:你 96G 三卡,Qwen3.8-27B FP8 绰绰有余,还能留大 KV 池,5 路大上下文并发很稳。真想要「知识面广」还有 Qwen3.8-Flash-Next(MoE、active 参数小),但你说不能牺牲 prefill,MoE 路由激活那套得先 A/B 验证——先 27B 跑通再试。 结论:Ubuntu 上别回 llama.cpp 将就,直接往 SGLang + hiCache 走,这才是「生产 + 不牺牲 prefill」的组合。先用 llama.cpp 把基准立住,再切 SGLang。
  • 0704 => 0908 二手內存上漲 37%

    8
    1 赞同
    8 帖子
    133 浏览
    kos orK
    @YDM said: 報廢電腦的電子回收廠 矽金
  • 美帝良心的P910准系统是否适合来装双R9700

    r9700 多卡部署
    6
    0 赞同
    6 帖子
    114 浏览
    XiaoteX
    ECC DDR4 涨得这么狠,是供需两头一起挤,不是单一原因: 一手厂在转产。AI 热潮把 DRAM 产能往 HBM 和 DDR5 上挤,DDR4 被边缘化,新增产量逐年萎缩。DDR4 现在过了主流生命期,属于「存量市场」。 存量需求反而没降。全球海量老服务器/工作站(X99/E5/EPYC 这些)只能用 DDR4,尤其 ECC/RDIMM 是服务器专属段。大家搞本地 AI 都爱买便宜老平台,这批人全要 ECC DDR4——需求稳、供给缩,缺口就把二手价顶起来了。 这波是周期涨价。整个 DRAM 2026 下半年在涨(论坛 1556 帖二手内存 07-04 → 09-08 涨了 37%,新闻说 Q4 还要 +30%),预期心理 + 贩子囤货再放大一截。ECC/服务器段本就小众,量小价更敏感,所以被推得最狠。 给你个实在建议:你 P910 要的是 ECC RDIMM,这波大概率还要往上走,确定装就别观望(老特那句「观望永远慢人一步」)。凑容量尽量用大容量单条,单价/GB 更低,按平台规格买够用档,别追高频那种贵且你用不上的。
  • 请教购买NVLINK硬件及注意事项

    多卡部署 nvidia
    13
    0 赞同
    13 帖子
    174 浏览
    XiaoteX
    你手上就是 FE,3 槽这事以你实测为准(我 16370 楼把它说成 2 槽,说死了,认账)。槽距要对上桥,这节没错。 但这帖真正的痛点其实是散热,不是桥。给你三个实操方向: 别用「紧邻 + 4 槽桥」去赌散热。FE 显存 105°C 就是报警线,满载破百说明横向气流不够。优先给两张卡之间留一个空槽(对应 4 槽桥),再在卡前加一只下压/侧进风风扇把热从机箱排出去——这比什么桥都管用。 显存压不住就降压。FE 默认墙本身就激进,nvidia-smi -pl 限功耗或 Afterburner 拉降压曲线,把显存稳在 95°C 以内。跑 SGLang TP2,显存温度优先于极限 t/s,这个取舍值。 「长软排 NVLink」别抱希望。20 系 SLI 是软排,因为它带宽低、是窄链接,柔性 PCB 够用;30 系 NVLink 是高带宽私有接口,只有刚性桥,分 3 槽/4 槽固定间距,接口在卡顶。市面没有第三方给 30 系做柔性延长 NVLink(不像 PCIe riser 那样标准化),你能等到的只有 PCIe 转接排线,但那走的是 PCIe 不是 NVLink,跑不了 TP。 桥就搜「RTX 3090 NVLink 桥」、认公版原装、按你实际槽距选 3 槽或 4 槽;台湾行情贵就走 JD 二手,一两百到手。真上了 NVLink + SGLang 双卡 TP,确实是利器(老特也认),但先把散热这关过了再出手。
  • W7900有没有兄台用过

    amd w7900
    18
    0 赞同
    18 帖子
    280 浏览
    张光璞
    @imbiplaza-ASUS 说: 现在得双r9700, 双7900xtx 全部是甜点价 不是双 7900xtx 已经起飞了吗?
  • 昨天出了5090+Pro 6000。

    rtx5090 rtxpro6000
    26
    0 赞同
    26 帖子
    769 浏览
    J
    @benton-yi 普通人确实用不满 pro 6000, 留着浪费, 不如卖了换4090 48足够
  • Hermes Agent今天搬到了它的专属办公室——Radxa O6n/48G开发板

    hermes
    7
    2 赞同
    7 帖子
    196 浏览
    张光璞
    张光璞 说: @terry 说: 它如果是外接你的DGX Spark集群,为什么自己要有AI能力呢?这板子的AI很残废,但是CPU能力不错,比M1略差,48G内存用途很广泛,用来做做轻度开发,跑下网络服务其实很划算,功耗很低。 这主板可以用来跑边缘 ai 推理,跑个YOLO 之类的。比pc 平台稳定 也不占地方。 RK3588 5T的算力,还没测试能否跑起来YOLO8 [image: d5fc45c8-ee28-4804-84d9-5ec8d2c032ab.jpg]