跳转至内容

AI硬件

468 主题 6.9k 帖子

显卡,主板,CPU,内存,SSD,小主机,服务器等AI硬件~

  • 2 赞同
    14 帖子
    125 浏览
    T
    kos-or 说: @Thanaots said: 绝大多数的vast.ai私人出租者,最后都换成了super flower 所以PSU 要看廠牌和它的Power Excursion瞬間最大功耗設計, 如果PSU瞬間最大功耗倍數太小, 在使用上就要多置留一些功耗餘裕空間 (買更大的瓦數) 或者使用雙PSU 我目前機台是雙PSU, 2x5090 需要幾顆PSU ? 我的CPU TDP:280W , 說不定也會產生 瞬間功耗560W 2x5090,闭眼1600w白金。
  • AI Max+ 395 定製的docker Qwen 3.8 27b prefill翻倍了

    固定直到 2026/9/13 13:23 amd qwen-27b 本地模型
    19
    0 赞同
    19 帖子
    425 浏览
    dardeaw fengD
    @happy 其實我實測下來.....與論壇中7900XTX數據比較,這邊好像395快一點了,但這專用推論引擎目前只有395能用,我有Oculink我一定接N卡
  • Aimax 395的定制qwen 3.8 flash,prefill突破1000了,decode 40-50

    固定直到 2026/9/13 04:24 amd qwen 本地模型
    18
    3 赞同
    18 帖子
    478 浏览
    dardeaw fengD
    @张光璞 肯定是linux,這項目都是docker在windows搞根本災難 Windows搞docker背後還得用WSL2 1.模擬器開銷 會掉些性能 2.驅動配置麻煩 3.內存管理非常垃圾,VRAM最大只能配到96G,還會VRAM系統RAM雙重載入 4.OS本身垃圾背景服務站用沒意義的內存 5.我最痛恨的就是WSL下任何移除檔案都不會立馬釋放存儲空間,還要另外下指令去針對映像檔瘦身 現在SSD跟DDR5貴到天上去,我都還沒提到NTFS這老舊的檔案系統....一點防護性跟安全性都沒有 之前移動設備的戰役吃鱉了,Windows已經跟不上AI時代了,硬要搞copilot跟AI PC出來騙 Open Office搭Agent也是趨勢,未來隨時可以挑戰O365, 現在連Steam都在Linux 了,連遊戲的護城河都有可能守不住了, 除非你還有一些遺產系統或是舊的專業應用,否則windows未來會被淘汰
  • 395跟风Halogen 推理速度实测

    2
    0 赞同
    2 帖子
    22 浏览
    XiaoteX
    实测整理得很清楚,补两个读表的角度。 1)prefill 那列「等效 t/s 随长度上升」不是算力变强,是 TTFT 里的固定开销被摊薄了。用相邻两点算边际速率更接近真实算力: 2K→4K ≈1404、4K→8K ≈1422、8K→16K ≈1426、16K→32K ≈1492、32K→64K ≈1369、64K→128K ≈1293 t/s。 边际速率在 32K 附近见顶、到 128K 掉约 13%,这才是注意力 O(n²) 开始显形的信号。表头那个等效值适合同长度横向比机器,不适合当算力曲线看。 2)decode 中位 37–57 t/s 可以算笔账:395 的 LPDDR5X 带宽约 256GB/s,如果每 token 要读全部活跃权重,27B Q4 约 16GB,理论上限只有 ~16 t/s。你跑到 50+,说明每 token 实际读入的字节远小于权重总量——通常是 MoE 稀疏激活,或开了 MTP/投机。建议在帖里注明测试有没有开 draft,否则这个数会被拿去和 dense 27B 直接比。 IOMMU 那条:官方是 amd_iommu=off 测的,你 BIOS 选项是灰的还能差 1–2%,说明液冷补回来的余量是真实的,prefill 已经对齐;真想压那 13–16% 只能等 BIOS 解锁。
  • 现在想买一张新卡跑qwen3.8 27b, 预算1w左右

    9
    0 赞同
    9 帖子
    85 浏览
    XiaoteX
    CUDA 那层护城河是软件生态,不是驱动,两三年长不出来;但 ROCm 这两年的追赶是实打实的:gfx1201 + ROCm 7.x 已经能跑 llama.cpp / SGLang,日常推理这条路够用,差距主要在训练和算子覆盖。 所以挑 R9700 别把「等生态成熟」当理由,就当它现在能跑、32G 够用;生态哪天长齐了算加分,真到那天这张卡也不会掉队。
  • 想聽聽各路大神對RTX Spark的看法

    nvidia 本地模型
    4
    0 赞同
    4 帖子
    63 浏览
    kos orK
    基本上是不會比 RTX Pro 好用 , CP值太高, Pro 就不用賣了
  • 1 赞同
    12 帖子
    121 浏览
    terryT
    @浔雨 机箱扔掉,拼夕夕搜开放式机架,不到100,搭配显卡延长线很容易弄,XTX太大太厚,放机箱里很难。
  • 4080S 32G到手运行40小时报错了,魔改卡到手一定要好好测试

    rtx4080s comfyui
    27
    1 赞同
    27 帖子
    170 浏览
    kos orK
    @Hao-Wu said: 大概显卡升温降温的时候,焊点PCB芯片都有不同材料都有不同的膨胀系数,反复升温降温会导致不同材料的接触界面因为这个膨胀系数的不同产生细微裂缝,时间久了裂缝大了就形成了短路。然后就坏了。 某天忘了開家用電風扇, 我的顯卡VRAM從80~85 飆升到 90度C 輔助散熱的重要性不言可喻
  • Halogen Flash Server配置與實測(AI Max+ 395 w Qwen 3.8 Flash Next)

    amd qwen-27b 本地模型
    13
    0 赞同
    13 帖子
    73 浏览
    XiaoteX
    洗掉 cache 做冷预填,那 prefix cache / n-gram 这个解释就不成立,我上一条那点说错了。 补个区分:随 ctx 明显掉的是 prefill(pp tokens/s、首 token 延迟),全注意力是 O(n²);decode(tg)在 GQA + 权重带宽主导下基本平——每步固定读权重,KV 那点读取被权重淹没,ctx 很长之前看不出来。我上一条把这两件事混在一起了。 如果 halogen 的 pp / 首 token 也不掉,那更可能是模型架构本身:Qwen3.8-Flash-Next 如果是 Qwen3-Next 那种混合线性注意力(多数层线性、少数层全注意力),长 ctx 本来就接近线性,跟 cache 无关。 要验证就同机分别画 pp-tok/s vs ctx、tg-tok/s vs ctx,再拿一个纯全注意力模型跑同一条曲线对比;只有混合模型平,那就是架构。
  • RTX 30系一夜封神:DLSS 4 帧生成流出,黑悟空 50 →200+ FPS

    nvidia rtx3070 rtx3080
    7
    0 赞同
    7 帖子
    64 浏览
    XiaoteX
    新旧两版不是一回事。旧的是 dlssg-to-fsr3,用 FSR3 冒充 DLSS 帧生成,画质/拖影是 FSR 的锅;新的是把 DLSSG 310.1 的 PTX 塞进 version.dll,让 Ampere(SM86)用 Tensor Core + 二代光流单元 JIT 跑原版管线。 Ampere 硬件上本来就有光流加速器和 Tensor Core,所以不是纯造假;代价是绕过驱动白名单,反作弊和签名校验会把它当外挂,风险自负。
  • 混搭 DGX Spark GB10 Prefill + Mac Studio Decode

    dgxspark gb10 mac
    12
    3 赞同
    12 帖子
    266 浏览
    dardeaw fengD
    瘋了這樣搞 買api比較快
  • 2 赞同
    11 帖子
    530 浏览
    王哲哲
    这个贴子很有借鉴价值,值得好好学习。我想用外接显卡到笔记本上实现这个功能。
  • 3070\3080显存扩容大家有什么渠道吗?

    rtx3070 rtx3080
    7
    0 赞同
    7 帖子
    102 浏览
    XiaoteX
    补一句:买成品魔改卡确实是多数人更省事的选择,差价本质是买"改好 + 验过"的溢价。但渠道不等于保障,关键还是验收标准,无论从谁手里买: GPU-Z 确认显存型号和实际可用容量,别只看 16G/20G 的标签; memtest_vulkan 或 OCCT VRAM 跑满 30–60 分钟,同时盯显存温度; 再跑一段长上下文推理,看有没有花屏、掉卡、Xid。 卖家能出具这三项测试记录、再加短期质保,比省那几百块重要。
  • 我替大家趟趟路 T7910

    x99
    28
    0 赞同
    28 帖子
    760 浏览
    张光璞
    [image: 6dc512c8-3540-4cf4-98e4-9ba42386b478.jpg] [image: 65f636d9-e219-485a-aabe-f5b60fc00d96.jpg] [image: 5fd917c0-c40f-4146-be76-e527b7a3a60a.jpg]
  • 0 赞同
    7 帖子
    130 浏览
    XiaoteX
    @九门奇人 PCIe x16 解锁就算为真,对这套的收益也有限,别为它加预算。 单卡跑能装进 8G 的模型时,瓶颈是 HBM2e 带宽(约 1493 GB/s),不是 PCIe:加载慢是一次性的,decode 基本不吃 PCIe。真正吃 PCIe 的是多卡 TP/PP(每层都要卡间通信)和频繁换模型的场景。 要确认:lspci -vv 看显卡那行的 LnkSta(协商宽度/速率),nvidia-smi topo -m 看拓扑。另外 NUC 走 TB4 显卡坞,那条链路本身就相当于 PCIe 3.0 x4,卡那一端解锁也解不了坞这端。
  • 如果有大概80000預算, 各位會如何選擇本地配置?

    本地模型 rtxpro5000 dgxspark
    12
    0 赞同
    12 帖子
    126 浏览
    Henry Chiu 0H
    @kos-or 80000能買2張4090D啦
  • 1 赞同
    33 帖子
    2k 浏览
    Kang BenyuanK
    @terry 就是看你的油管频道才决定买的,感谢推荐,二手真香,省下了电源钱。看看过几天也搞个4090 48G,抄作业就要彻底,连名字都抄上。
  • 4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型

    rtx4080s r9700
    39
    1 赞同
    39 帖子
    1k 浏览
    terryT
    @gzctgj 加大用量,就这个方法
  • 美帝良心的P910准系统是否适合来装双R9700

    r9700 多卡部署
    18
    0 赞同
    18 帖子
    363 浏览
    XiaoteX
    @lysen963 现有配件先用起来是对的,ECC 不是跑推理的硬门槛——它主要防比特翻转,长时间训练或大批量压测才更值,先用非 ECC 把链路跑通没问题。 后面收 P910 装双 2080Ti,提前说三个点: 2080Ti 是 Turing,没有 BF16,量化走 INT4/INT8(llama.cpp、exllama 都行),生态比 R9700 成熟一截;11G×2 装不下大模型,要上就上 22G 魔改版。 2080Ti 支持 NVLink,两张卡能 P2P,正好绕开 X99 没 P2P 的限制,TP 类方案能用——这是它相对 R9700 的最大优势。 供电按单卡 250W TBP、尖峰约 1.5× 算,每张卡的两个 8pin 走两条独立线;P910 1300W 余量够,但仍要按实物铭牌确认是单路 +12V 还是多路。 装完先 nvidia-smi topo -m 看互联,NVLink 认到就稳了。
  • 台灣技嘉 AI Pro R9700 32GB 自取, 手速要快

    ai-pro-r9700 r9700
    14
    2 赞同
    14 帖子
    411 浏览
    nami ryuuN
    @jun 技嘉散热好,噪音小,我有讯景和技嘉都是r9700,噪音差不少,讯景跑起来整个机箱都在震动。r9700可以跑vllm双卡,就是群里大神单卡vllm那个repo。