跳转至内容
  • X99-AD4运行7900XTX黑屏,求助

    AI硬件 7900xtx x99
    18
    0 赞同
    18 帖子
    206 浏览
    terryT
    @LearningAI 这个没有实际测试tokens,就是部署好了之后,它能聊天了,不会有便秘的感觉,不如在线DeepSeek V4 Flash迅速敏捷,不过其他模型的差距可以接受,Llama.cpp和VLLM都只能挂机,不具备日常聊天,即时沟通的可用性。 它的优势来自于缓存,Raidx缓存不用大量prefill,就是你发了信息它立刻就回复了。
  • 1 赞同
    7 帖子
    405 浏览
    williamlouisW
    @老白登 你原来的 主板和CPU 确实很LOW。直接换X99 是不错的选择。显卡是越观望越涨价。先拿下显卡和电源 跑跑 看也行。这玩意是真的涨。
  • 交作業~新手初試X99配雙RTX2080ti 22G

    AI硬件 x99
    4
    2 赞同
    4 帖子
    292 浏览
    D
    昨天又繼續跟我的hermes一起研究(其實都是它的功勞啦)報告如下 雙 RTX 2080 Ti 22GB 跑 Qwen3.6 35B Coder FP8 實戰紀錄 來源 基於 weicj/vLLM-2080Ti-Definitive 專案的 profile 與 launcher。 硬體 2× RTX 2080 Ti 22GB + NVLink GPU 功耗上限 200W 模型 Jackrong/Qwopus3.6-35B-A3B-Coder-FP8(約 35GB) MoE 架構,35B 總參數 / 3B 激活 FP8 量化,純文字版 支援 256K context(FP16 KV cache) 支援 Function Calling(tool-call-parser: qwen3_coder) 啟動參數 項目 值 Profile qwen35b/normal/fp8/fp16kv-256K-nomtp-text-only.env GPU CUDA_VISIBLE_DEVICES=0,1 (TP=2) 量化 FP8 Context 262144 tokens (256K) KV cache FP16 MTP 0(無多 token 預測) Reasoning OFF(enable_thinking=false) Chat Template froggeric-v21(修復版) Tool Call Parser qwen3_coder Chat Template 使用 froggeric/Qwen-Fixed-Chat-Templates v21.3 修復官方 Qwen template 的多項問題: 禁用強制思考模式(enable_thinking=false) 修復 KV cache 失效問題 優化 Jinja 渲染效能 實際測試速度表現 Prompt: 寫一篇 2000 字的小說,故事要完整,有開頭結尾 輸出: 2132 字中文字 Token: 1384 completion tokens 花費: 15.14 秒 速度: 91.4 tok/s 結束: stop(自然結束) 項目 數據 生成速度(暖機後) 91.4 tok/s TTFT(首個 token) ~11ms 最大小說產出 2132 字 / 1384 tokens / 15.14s 我滿足了
  • RTX5000Pro配X99可行吗?

    AI硬件 x99
    7
    0 赞同
    7 帖子
    353 浏览
    SIMON LIS
    我在主板将resize bar关掉后,暂时可以了
  • 关于华南金牌X99-CD3主板MOS风扇降噪

    AI硬件 x99
    7
    0 赞同
    7 帖子
    194 浏览
    williamlouisW
    @Colt 这是正确的。不知道 下面是主板南桥或北桥。厂商带风扇不会是无的放矢。 这块芯片应该是管理 CPU 内存 硬盘 显卡间数据交换的。加载模型的时候会很热。pci-e 的带宽应该是靠它。吸的散热效果很一般。建议观察。或加载模型的时候手摸摸温度。
  • 0 赞同
    30 帖子
    456 浏览
    A
    @ken-chan 说: @GH-Y 好的,谢谢;我总算了解了一番,买了X99洋垃圾,够用了 ddr3 都不会贵 基本上单卡够用 当你觉得不够的时候 就是你明白需求的时候了 那时候x99 ddr3 丢弃也不可惜
  • 7 赞同
    10 帖子
    352 浏览
    J
    @abaalei 说: 当然,单卡推理完全没所谓——模型加载到显存后,PCIe 只做偶尔的数据传输,瓶颈在算力和显存带宽上。 看到这里我就放心,我的华南金牌X99-CD4的第1槽插了3090Ti(三风扇版本)后,第2槽位被挡住了,3060只能插在第3槽。 还好,我两张卡是分配跑不同的模型
  • 1 赞同
    20 帖子
    454 浏览
    5
    @abaalei 最近gpt 5.5偷懶很嚴重 寫計劃的時候他沒把很多該有的設定都寫出來 搞到我自己的vLLM 27B經常撞板...
  • 1 赞同
    1 帖子
    184 浏览
    尚无回复
  • 卖掉了我的macstudio,准备进军x99+双卡3090

    AI硬件 rtx3090 x99 mac
    11
    0 赞同
    11 帖子
    365 浏览
    A
    @566656661 有钱犯贱,刚刚买了13寸的m1 macbookpro 13寸了 3000出头,成色8成新,玩一年半载再2700卖也算可以
  • 【交作业】华南金牌 X99-TF + E5 2686V4 +蓝宝石7900XTX 白金板

    AI硬件 7900xtx x99
    13
    4 赞同
    13 帖子
    537 浏览
    terryT
    @koala 我认为这个你可以只鹅几在AI音视频栏目发一个单独的帖子,不要混入这里。可以复制这几个图片就可以了。
  • 被抡锤者种草后,我用 X99 + 4090D 48G 搭了一台本地 LLM 服务器

    AI硬件 x99
    31
    2 赞同
    31 帖子
    1k 浏览
    williamlouisW
    @nami-ryuu 大。峰值工作噪音过75分贝
  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4

    AI硬件 x99 rtx3090
    30
    4 赞同
    30 帖子
    626 浏览
    kos orK
    @Ray-Wang 假如是待在製造業 有做模具或樣品相關的 是可以深入研究 假如不是 就沒必要了 這個幾年內應該會有相關服務出現
  • 双卡缝合怪 X99平台 P40+2080Ti的本地生产力平台

    LLM讨论区 x99 多卡部署
    8
    0 赞同
    8 帖子
    197 浏览
    Miemie YM
    缝合怪本地 LLM 折腾记:X99 + RTX 2080 Ti + Tesla P40 这台"缝合怪"是自己以前的老硬件东平西凑来的,记录一下踩过的坑和目前的状态,供有类似想法的朋友参考。 遇到的坑和痛点 1. X99 平台 + P40 的 BIOS 启动问题 X99 是个年代久远、脾气刁钻的平台。P40 作为纯计算卡,没有视频输出,但插上之后会被主板优先识别,导致系统启动时卡在 BIOS 画面,显示器一片黑。 最终解决方案是通过降低 P40 所在 PCIe 通道的启动优先级,强制 P40 晚于 2080 Ti 完成初始化,才彻底解决这个问题。过程中试了很多方法,这条路不太直观,网上资料也零散。 2. 温度与噪音 目前是冬天,情况还算可控。但可以预见夏天会是另一番煎熬。 P40 原装被动散热,没有风扇,长时间推理温度会飙升。解决方案是拆下 Titan Xp 的涡轮风扇移植到 P40 上,引出风扇控制线接到主板风扇针脚,再通过软件 root 风扇控制逻辑,在管理面板里配置了基于温度的自动调速方案。目前运行稳定,但整机噪音在高负载下依然可观。 3. Qwen 3.6 35B A3B MoE 的稳定性问题 Qwen 3.6 35B A3B 是 MoE 架构,active 参数只有约 3.6B,输出速度快(实测约 41 tok/s decode),在缝合怪上跑起来性价比不错。 但跟同量级的 27B Dense 模型相比,它在长上下文下的 instruction following 稳定性较差,容易出现 thinking loop 和工具调用格式偏移。只要外部有足够强的约束框架(harness)控制任务边界和输出格式,用来做本地 agentic coding 还是完全可用的。没有约束的情况下,复杂任务的可靠性会明显下降。 4. 128k 上下文不够用 128k 的上下文窗口在单 session 多轮代码修改的场景下远远不够。一旦触发上下文压缩,prefill 阶段需要重新处理大量 token,100k 冷启动实测 TTFT 约 428 秒,压缩期间 decode 速度也会从正常的 41 tok/s 大幅下降。这段等待体验非常差,是目前整个方案最大的短板。 下一步打算 缝合怪作为过渡方案已经验证了本地 LLM 的可行性,但多卡异构带来的复杂度和性能瓶颈越来越明显。 目前倾向于等 Apple M5 Ultra。如果真的像传闻里的192GB 统一内存 + 约 1228 GB/s 内存带宽,可以直接跑 70B 以上的 Dense 模型而不需要多卡拼接,省去异构平台的所有麻烦。相比继续在 PC 平台上堆显卡,M5 Ultra 的性价比和可维护性更有吸引力。 当然如果近期有合适的显卡升级机会也不排除,但长期方向应该是统一内存架构。 硬件:X99 + RTX 2080 Ti 11GB + Tesla P40 24GB | 推理框架:llama.cpp build 9528 | 主力模型:Qwen 3.6 35B A3B MoE Q5
  • 请教寨板X99 配 新7900xtx 无视频输出问题

    AI硬件 7900xtx x99
    4
    1 赞同
    4 帖子
    356 浏览
    W XW
    填坑,解决问题的最简单方法,使用DP接口,或者买个DP 转HDMI 转接口。就有输出了。然后 Above 4G Decoding = Enabled,CSM关闭
  • 5 赞同
    11 帖子
    830 浏览
    terryT
    测试数据非常有参考意义,置顶,有prefill速度可以发下,但影响不是很大。
  • 【求助】铭凡HX99G 打算 eGPU上7900XTX 24G,是否可行

    AI硬件 7900xtx x99
    12
    0 赞同
    12 帖子
    239 浏览
    L
    @YQ-YQ 我猜 nvlink 应该会比主板 pcie gen4x16 快. N卡生态也好一些. 不过 7900xtx 也有它的优点, 最大的优点就是安静(我个人认为). 如果 2x7900, 那主板上的两个pcie插槽应该最好都是直连到cpu的 gen4x16. 我也希望看到 layer split 以后, tg 的速度到底差多少的测试数据.
  • 我来简单一次说清楚Resizeable BAR吧

    AI硬件 resizeablebar x99 bios
    9
    3 赞同
    9 帖子
    373 浏览
    Grayson RenG
    我X99装了PVE 然后虚拟机Ubuntu直通显卡跑27B 要开这个 不然模型加载不到显卡里
  • 0 赞同
    12 帖子
    295 浏览
    陈鸿
    我用一个scandisk 128GB 的u盘安装过 UBUNTU24 和ubuntu 26 都没问题 也是华南X99 DDR3 E52686V4 7900XTX
  • X99 Dual 7900 XTX + DFlash Qwen3.6-27B 實測

    LLM讨论区 7900xtx x99 dflash
    8
    3 赞同
    8 帖子
    385 浏览
    陈鸿
    楼主讲的是粤语阿。。香港朋友