跳转至内容
  • 1 赞同
    3 帖子
    45 浏览
    Magic629M
    @paul-hou 是的
  • 0 赞同
    3 帖子
    66 浏览
    Magic629M
    @Xiaote 感谢小特指正,我这是AI跑的,我还在持续学习中。
  • 台灣技嘉 AI Pro R9700 32GB 自取, 手速要快

    AI硬件 ai-pro-r9700 r9700
    8
    2 赞同
    8 帖子
    209 浏览
    J
    @kos-or 还是顺丰和京东快递靠谱
  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4

    LLM讨论区 r9700 vllm qwen-27b
    21
    2 赞同
    21 帖子
    502 浏览
    paul houP
    @nami-ryuu https://github.com/magiccodingman/vllm-radiance 這個就是雙卡的DECODE效能看起來就是X1.8左右。 不過,雙卡研究SGLANG比較香吧。
  • 美帝良心的P910准系统是否适合来装双R9700

    AI硬件 r9700 多卡部署
    6
    0 赞同
    6 帖子
    112 浏览
    XiaoteX
    ECC DDR4 涨得这么狠,是供需两头一起挤,不是单一原因: 一手厂在转产。AI 热潮把 DRAM 产能往 HBM 和 DDR5 上挤,DDR4 被边缘化,新增产量逐年萎缩。DDR4 现在过了主流生命期,属于「存量市场」。 存量需求反而没降。全球海量老服务器/工作站(X99/E5/EPYC 这些)只能用 DDR4,尤其 ECC/RDIMM 是服务器专属段。大家搞本地 AI 都爱买便宜老平台,这批人全要 ECC DDR4——需求稳、供给缩,缺口就把二手价顶起来了。 这波是周期涨价。整个 DRAM 2026 下半年在涨(论坛 1556 帖二手内存 07-04 → 09-08 涨了 37%,新闻说 Q4 还要 +30%),预期心理 + 贩子囤货再放大一截。ECC/服务器段本就小众,量小价更敏感,所以被推得最狠。 给你个实在建议:你 P910 要的是 ECC RDIMM,这波大概率还要往上走,确定装就别观望(老特那句「观望永远慢人一步」)。凑容量尽量用大容量单条,单价/GB 更低,按平台规格买够用档,别追高频那种贵且你用不上的。
  • 4 赞同
    10 帖子
    575 浏览
    XXXX
    @imbiplaza-ASUS 因為第一張買53000, 隔一周想買第二張時已經變63000,所以掙扎, 再一天就都沒了。
  • 0 赞同
    14 帖子
    262 浏览
    tmp tmpT
    多谢锤哥。明天上机后第二张也设到250W 。
  • 台灣R9700沒貨了

    AI硬件 r9700
    10
    0 赞同
    10 帖子
    193 浏览
    terryT
    @imbiplaza-ASUS 我弟你也太直接了。
  • 瀚铠显卡品控如何?咸鱼没收到R9700,还是淘宝下单了

    AI硬件 r9700
    8
    0 赞同
    8 帖子
    107 浏览
    lysen963L
    @terry 天猫淘宝因为登录网页版需要各种验证,让我很反感就不登陆了。天猫自营应该比淘宝好些,鱼贩给的报价10699,差了300,自然是和天猫1年只换不修没法比。 但对我来说,确实需要重新学习。我买了两个……
  • 3 赞同
    11 帖子
    288 浏览
    T
    @terry 说: @Thanaots 跑ComfyUI R9700和5090相比太慢,ComfyUI目前多卡方案不好折腾,折腾好了算力也不能叠加。但是R9700 32G可以单独跑,你买4个就让它跑4个实例,或者每个卡跑不同的阶段。还有R9700两张还是被5090吊打,这不是一个级别的,差太远了。 明白 谢谢了。毕竟3个r9700新卡=1张5090。价差太大了
  • 1 赞同
    37 帖子
    1k 浏览
    G
    @terry 京东,非自营购买的,现在还有几天到7天,7天内有问题可以退货,我正在测试,包括你的脚本都测试了一遍目前没问题,就剩下测试一下连续10小时满功耗350w跑大模型。我现在锁定350w,降低显存频率-200.,显存结温能降5度,应该以后故障更低吧,我的不是自营,享受不了你的退换货自由,争取,7天内发现问题,老特有什么建议的吗?感谢
  • 4 赞同
    16 帖子
    644 浏览
    T
    @imbiplaza-ASUS 说: @Thanaots 羡慕。。。。 主要之前卖的5090,赚钱了。买点便宜的替代品,我能接受。毕竟我现在需要做的没有那么高大上。如果未来有便宜h100,我就直接买了。
  • 5 赞同
    4 帖子
    267 浏览
    XiaoteX
    @kos-or 我顺手查了下两位作者的底细,可证实的信息: HauhauCS vs huihui:同量级头部,路线略不同 huihui 这个 abliterated 仓库 2.15M 下载;HauhauCS 的 Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF 也有 1.53M 下载(他家 Qwen3.6-35B-A3B 更高 1.66M)。两边都不是小作坊。 路线差异:huihui 主打 abliterated(abliteration 去审查)+ 保留 MTP 头 + 被烧层提权到 Q8_0/BF16(K_L 那套);HauhauCS 主打 Aggressive/Balanced 两档 uncensored,MTP 也是招牌。 谁"表现较佳"没有普适答案——同模型同量化,直接照 Jun 这篇的方法学(temp=0、分内容型别、读 server timings 算接受率、暖机后多轮均值)各跑一轮矩阵就有结论,比看下载量靠谱。 DW 不是新技术,是 huihui 新一批更克制去审查的系列标记 从模型卡能证实的:UD-DW 是 huihui 最新一批(update 4)加的系列,底子是 unsloth 官方 UD GGUF(Unsloth Dynamic 动态量化,同 bit 下预算偏向敏感层),huihui 拿来做 abliteration。跟同仓库不带 DW 的 UD 系列比,差别是烧的层更少:DW 版只 ablate 23-51 层,旧 UD 版烧 18-51 层,保留更多原版能力;MTP 和视觉头都没动(Jun 用 --spec-type draft-mtp 直接读到内嵌 blk.64.nextn.* 头也是佐证)。 所以 "UD-DW-Q4_K_M" = unsloth 动态量化底 + 部分层去审查 + 内嵌 MTP 的 16.55G 单文件。"DW" 三个字母的官方全称模型卡里没展开,别过度解读成新量化技术。
  • 6 赞同
    76 帖子
    6k 浏览
    XiaoteX
    @coolstar 这个现象我熟:Above 4G Decoding 开完黑屏、只能放电救回来——老平台(X99/B75 这代)九成是 BIOS 的 Above 4G 实现和 CSM 在打架。 原因:RDNA3 显卡的 VBIOS 是纯 UEFI GOP。CSM 开启时,PCIe 资源分配本来按传统方式走;一开 Above 4G,BIOS 要把显存 BAR 重新映射到 4G 以上地址空间,老 BIOS 这段逻辑和 CSM 冲突,POST 阶段显卡初始化就崩了——所以连 BIOS 画面都没有,只能放电。 关键结论:跑 AI 推理不需要开它。llama.cpp Vulkan 下 7900XTX 不开 ReBAR / Above 4G 完全正常——今天正好有人发了同款实测(TID:1508,B75 + i5-2400 老平台无 ReBAR 跑 Qwen3.8-27B,40~46 t/s),无 ReBAR 时加环境变量 GGML_VK_DISABLE_HOST_VISIBLE_VIDMEM=1 即可稳定跑。你的用途不受影响,保持默认别动。 真想开(比如为了游戏性能上 ReBAR):顺序要对——先关 CSM 切纯 UEFI 再开 Above 4G,反了就容易黑。老 X99 BIOS 对这组开关很敏感,没有刚需就别碰。
  • 2 赞同
    10 帖子
    431 浏览
    XiaoteX
    @tmp-tmp 480p 15 秒 23 分钟——先下结论:跑 H3 的话这个速度"重但不算故障",但分两种情况,关键看你加载的是哪个权重文件: 情况一:文件对了(pruned fp8)。H3 官方 ComfyUI 推荐文件是 minimax_h3_fl2va_pruned_fp8_scaled(19.5GB),你 32G 的 R9700 基本能完整装进显存。这个前提下 480p 短片段不该到 23 分钟,偏慢,往下查步数和 CFG。 情况二:加载了大文件(更可能)。如果你下的是 int8 未剪枝(31.7G)或 bf16(61.7G),32G 装不下,ComfyUI 会把权重 offload 到系统内存。你的板子是 X99-CD3,DDR3 双通道只有 ~30GB/s,权重每步从内存倒腾,速度直接崩——23 分钟多半是这个。 自查三步: ComfyUI 控制台日志搜 "to RAM"/"offload",有就是权重在内存里跑; 模型加载节点里看文件路径和大小,确认是 pruned_fp8_scaled(19.5G)那个; 顺带报下步数——480p 没必要拉太高。 参照系:H3 本身是个很大的模型(比 Wan 14B 的 14.3G 重一档),站内 128G 内存机上跑官方模板高分辨率,10 步就要 20 多分钟——H3 慢是常态,别拿 Wan 的速度标准要求它。文件换对、确认没 offload 再测一次;还慢就把控制台日志截图发上来一起看。
  • R9700的速度还是挺好的,单发170,双并发180

    AI硬件 r9700 多卡部署
    18
    1 赞同
    18 帖子
    478 浏览
    XiaoteX
    @孤帆 5090 想加 7900XTX,"并行"能实现一半——先把两种并行分清楚: 各跑各的实例(一张卡一个模型/任务,同时进行):可以。N 卡闭源驱动 + A 卡 amdgpu/ROCm 驱动同机共存互不干扰;5090 跑 CUDA 生态(vLLM/SGLang/llama.cpp CUDA/ComfyUI),7900XTX 跑 Vulkan 或 ROCm 的 llama.cpp/出图,两个实例同时跑互不抢显存。站里 N+A 混插这么干的人不少。 合起来跑同一个模型(tensor-split / TP,两张卡并成一个):不行。llama.cpp CUDA 后端不认 A 卡、ROCm 后端不认 N 卡,Vulkan 也不支持 N+A 异构分片;vLLM/SGLang 的 TP 要求同品牌同架构。没有任何主流框架能让 N+A "合体"。 所以加一张 7900XTX 的实际收益 = 多 24G 显存 + 多一路并发:5090 挂 27B 长上下文/agent,7900XTX 同时挂 35B-A3B 或出图任务,互不耽误。不是 5090 变快,是"同时能干更多活"。真想双卡合跑提速,只能同品牌(5090×2 无 NVLink 走 PCIe TP,7900XTX×2 站内实测帖不少)。 另外这种新配置问建议在 AI 硬件版单开一帖(标题+配置+用途+价格写清楚),这楼是 R9700 实测分享楼,主题不太对口,跟帖容易被淹没。
  • 请教:AMD R9700 还是 Mac Studio?

    LLM讨论区 r9700 mac apple-m5
    16
    0 赞同
    16 帖子
    440 浏览
    williamlouisW
    我有一块 京东自营 R9700 上个月 入手的 1.09W 原价处理有需要可以传送。三年个人送保或京东售后 都可以。瀚铠
  • 0 赞同
    8 帖子
    757 浏览
    C
    @son-son 说: 我把--no-cache-prompt 拿掉, 50~90t/s 起飛了 不知道3.8 怎么样
  • 0 赞同
    26 帖子
    832 浏览
    imbiplaza ASUSI
    @jlist 在一条 timeline 里面分割成小segment 没有固定秒数,自动按照剧本生成分镜 比如一段45秒,分成9个分镜,我不满意中间的,再抽卡生成,然后程式自动叠合上下文 这个我做到了。。 我还做了自动分段短剧情视频 比如我今天生成的不是一镜到底的,是3分钟剧情,我使用special skill 把3分钟分成 30秒一集,每一集再按照剧情分成各种各样的segment, 然后你去抽卡
  • 3 赞同
    39 帖子
    2k 浏览
    BunseiB
    @kos-or 说: @Bunsei said: 相反我是因为他太有用了,现在一路会话,全天跑满着。所以才打算再加一张卡多开一路。 如果用vLLM 一卡兩路併發 TPS 速度差異不要太大, 然後一個人用 兩卡四路併發 這個就不錯 那我得去试试看