我就一张7900xtx,之前试sglang 跑fp8 双r9700 开mtp,32k ctx会掉到10几tok/s,普通请求40 -50,关mtp 32k也能稳定25左右tok/s,短的也差不多
stormaround
-
魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec -
2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰@stormaround
关于「DFLASH 牺牲视觉」:不会,正好今天实测验证了。DFLASH 只参与 decode 阶段(草稿出 token),图像编码在 prefill 阶段完成,两段正交。twolven 这个 AWQ 版视觉塔保留 bf16 未量化,模型卡原文就有 "vision still works"。今天 curl 直传图片实测:读图 100% 正确(形状/颜色/文字全对),同时段 DFLASH accept rate 0.28-0.40 照常跑,零冲突。真实照片测试连法文成分表都能正确 OCR。那还可以,之前用双r9700跑tp2,mtp和dflash速度差不多,就没有再去调dflash
-
2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰dflash好像要牺牲视觉,两张3090 nvlink 接近两万了,而且现在二手都是矿渣,感觉不是很值
-
这个配置,大神帮忙建议一下,本地化部署什么大模型最合适,需要5个人同时并发?3卡好像不能跑tp3,流水线并行,sglang比较稳,3张卡跑qwen3.8-27b-fp8,显存相当充足,感觉bf16没有必要,5个人完全没有问题,如果想折腾也可以考虑qwen3.8-flash-next,这么大内存确实可以考虑下。27b比较稳,qwen3.8-flash属于知识面广,看需求。flash 那个moe,q4量化容易漂移。27b跑双卡tp也不错。
-
我换回3.6 35B了35b经常死循环,一直重复
-
双 R9700 TP. SGlang 部署qwen3.8-27b-fp8踩坑记录目前没找到4bit的,4bit应该会快一些
-
双 R9700 TP. SGlang 部署qwen3.8-27b-fp8踩坑记录 -
4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型@Takano-RR 现在14600,涨了5000,有点不值得了
比我买的时候涨了400,睡不醒的85后那家,一个多月前买的
-
4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型@stormaround 你在哪个平台买的4080s,魔改卡呢,我找找
就是某宝买的,买的贵的14420快,改的三风扇
-
下单了疯狂的7900xtx+1000w电源,求推荐单路的硬件配置(希望老特不要觉得我在水贴) -
双 R9700 TP. SGlang 部署qwen3.8-27b-fp8踩坑记录【硬件】
cpu:5700x
主板:rog crosshair VIII hero
内存:ddr4 128g
显卡:r9700 * 2【部署全历程】
1. 初始部署失败(开箱即挂) - 直接跑 sglang 起服务:权重加载、cache 分配都正常,但第一次 forward(多模态 warmup)就卡死,300s 看门狗超时,模型从未成功跑完一次 forward - 原因:R9700 无 P2P(PCIe 2 hops),sglang logits 的 TP all-gather 无条件走 triton_symm_mem_ag(NVIDIA PTX kernel + symmetric memory peer IPC),rendezvous 从 C++ 抛 hipErrorIllegalAddress 直接 std::terminate,Python 兜底抓不到 → 硬崩 2. Cursor 调 opus5 改源码 → 部署成功 - 光靠配置参数救不活,是 Cursor 里的 opus5 深入 sglang 源码:定位到 logits_processor.py:333 创建 MultimemAllGatherer 时缺平台门禁,参照同目录 torch_symm_mem.py 的既有约定补上 is_cuda() 判断,非 CUDA 平台回退到常规 all-gather - 验证通过:warmup 首次出现 "The server is fired up and ready to roll!",文本 + 图片推理都正常 - patch 已打成文件可提上游 PR(分支 fix/rocm-disable-symm-mem-logits-allgather) 3. 速度 0.94 tok/s → 23 tok/s(NCCL_PROTO=Simple) - RCCL 的 LL/LL128 低延迟协议在无 P2P 时走主机共享内存病态回退(10KiB all-reduce 要 8.2ms),每 token 光通信就 1045ms - opus5 实测对比四种协议,NCCL_PROTO=Simple 快 187 倍 4. 23 → 52 tok/s(MTP steps=3 + KV fp8_e4m3) - 启用模型自带的 mtp.safetensors 做 NEXTN 投机解码(必须 topk=1)(为什么用cursor不是Claude code,因为账号稀里糊涂被封了,也没充钱,使用deepseek-v4-flash一直说无法部署,sglang不支持消费级显卡,部署就挂,使用opus5拆解源码,发现了这个bug,修改后能正常部署)
【响应速度】
短 prompt(日常交互): - 思维链关闭:TTFT 141ms,生成 35.6 tok/s - 思维链开启:TTFT 167ms,生成 40 tok/s 满 ctx(预填充主导,TTFT≈prefill 总时长): - 173K 冷启动:TTFT 243s,prefill ~713 tok/s - 217K(radix 缓存命中):TTFT 137s - 260,028 tokens / 262,144(99.2% 满)冷启动:TTFT 473s(7.9 分钟),生成 3.6 tok/s,prefill ~549 tok/s 【上下文召回命中率】3/3 全中 ✅ - 200K 长文中间埋 needle → 准确返回 - 217K → 准确返回 - 260K 满 ctx(needle 埋在开头,即最远端)→ 准确返回 GOLDEN_NEEDLE_77113 【结论】 - 召回能力优秀:99.2% 满 ctx 仍能精确找回远端信息,长文检索没问题 - 短上下文很流畅(首 token <200ms),适合日常对话 - 满 ctx 基本不可交互:等首 token 要 8 分钟、生成只有 3.6 tok/s,只适合离线批处理场景 - 生成速度随上下文增长衰减明显:40 → 5.3 → 4.3 → 3.6 tok/s(长序列 decode 每 token 要扫全部 KV) - prefill 吞吐 550-713 tok/s 偏慢(ROCm 上 cuda graph 未启用);radix cache 对重复前缀有效(217K 场景 TTFT 直接减半)A卡使用 SGlang能用,但是速度还是较慢
-
7900XTX 24G白金版哪里买划算,现在京东都涨到7799了,之前还是7299@stormaround
二手的怎么样,就是没有保修我买的就是二手的,店铺保一年,不过现在二手的也不便宜
-
DeepSeek FLASH V4 真贵啊!我也差不多,不能白天用,周末可以白天用,还要检查下有没有key被盗用,检查有没有死循环,改用glm-5.3-flash感觉有几次循环,也不便宜
-
4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型@stormaround 花屏,应该就是过热,显存焊点接触不良,冷却以后就好了吧
不常出现,就是突然有点彩色点
-
7900XTX 24G白金版哪里买划算,现在京东都涨到7799了,之前还是7299之前买超白金才7199,结果犯蠢用一年5000卖了,上个月花4900又买了张二手超白金,如果买新卡不如买r9700,不过确实7900xtx更快,不过24g经常容易oom
-
下单了疯狂的7900xtx+1000w电源,求推荐单路的硬件配置(希望老特不要觉得我在水贴)单路买最便宜的,有显卡插槽就行,确实像在水
-
买了俩条 7900XTX白金版 ,其他的配件希望各位大神推荐一下 ,完整上线我过来交作业!两条牛批,没找到涡轮卡,有个卖工包的要8000多块,两张卡很难插在一起,我现在是7900xtx和r9700插一起,跑分层pp不快,就是显存大,能跑q8
-
4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型两个我都买了张,个人感觉4080s 32g跑llm更快,跑视频也更好,就是有时候会奇怪的有点像花屏了一样,魔改卡还是比较不省心。r9700这张卡感觉跑llm有点慢,不如7900xtx,跑模型最好找rocm特化版的,能稍微快一点
-
我要新装一个7900XTX到我现在的4060TI电脑上的疑问?我个人感觉7900xtx 跑视频不如n卡,windows驱动经常有问题,必须用linux,现在很多量化版本,8g都能跑,不过7900xtx跑llm还是不错的,只要能装下速度很快


