跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
S

stormaround

@stormaround
取消关注 关注
关于
帖子
27
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    S stormaround

    我就一张7900xtx,之前试sglang 跑fp8 双r9700 开mtp,32k ctx会掉到10几tok/s,普通请求40 -50,关mtp 32k也能稳定25左右tok/s,短的也差不多

    AI硬件 7900xtx sg-lang 多卡部署

  • 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
    S stormaround

    @starryskyknight 说:

    @stormaround
    关于「DFLASH 牺牲视觉」:不会,正好今天实测验证了。DFLASH 只参与 decode 阶段(草稿出 token),图像编码在 prefill 阶段完成,两段正交。twolven 这个 AWQ 版视觉塔保留 bf16 未量化,模型卡原文就有 "vision still works"。今天 curl 直传图片实测:读图 100% 正确(形状/颜色/文字全对),同时段 DFLASH accept rate 0.28-0.40 照常跑,零冲突。真实照片测试连法文成分表都能正确 OCR。

    那还可以,之前用双r9700跑tp2,mtp和dflash速度差不多,就没有再去调dflash

    LLM讨论区 rtx3090 sg-lang dflash

  • 2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰
    S stormaround

    dflash好像要牺牲视觉,两张3090 nvlink 接近两万了,而且现在二手都是矿渣,感觉不是很值

    LLM讨论区 rtx3090 sg-lang dflash

  • 这个配置,大神帮忙建议一下,本地化部署什么大模型最合适,需要5个人同时并发?
    S stormaround

    3卡好像不能跑tp3,流水线并行,sglang比较稳,3张卡跑qwen3.8-27b-fp8,显存相当充足,感觉bf16没有必要,5个人完全没有问题,如果想折腾也可以考虑qwen3.8-flash-next,这么大内存确实可以考虑下。27b比较稳,qwen3.8-flash属于知识面广,看需求。flash 那个moe,q4量化容易漂移。27b跑双卡tp也不错。

    AI硬件 本地模型 多卡部署

  • 我换回3.6 35B了
    S stormaround

    35b经常死循环,一直重复

    AI硬件 qwen

  • 双 R9700 TP. SGlang 部署qwen3.8-27b-fp8踩坑记录
    S stormaround

    目前没找到4bit的,4bit应该会快一些

    AI硬件 r9700 sg-lang qwen-27b

  • 双 R9700 TP. SGlang 部署qwen3.8-27b-fp8踩坑记录
    S stormaround

    @张光璞 说:

    双9700跑到个位数,没法接受

    跑满上下文能掉到个位数,一般20-40之间

    AI硬件 r9700 sg-lang qwen-27b

  • 4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型
    S stormaround

    @gzctgj 说:

    @Takano-RR 现在14600,涨了5000,有点不值得了

    比我买的时候涨了400,睡不醒的85后那家,一个多月前买的

    AI硬件 rtx4080s r9700

  • 4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型
    S stormaround

    @gzctgj 说:

    @stormaround 你在哪个平台买的4080s,魔改卡呢,我找找

    就是某宝买的,买的贵的14420快,改的三风扇

    AI硬件 rtx4080s r9700

  • 下单了疯狂的7900xtx+1000w电源,求推荐单路的硬件配置(希望老特不要觉得我在水贴)
    S stormaround

    @coolstar 说:

    @kos-or 说:

    @coolstar said:

    RECC 32G内存’

    找 DDR4-2400/2666 ECC RDIMM 16/32GB 都可以 他們有貨嗎?

    H12D-8D Ver2.0
    74ced7cc-ca80-4540-a011-2cf1e51e610f-image.jpeg

    722a4462-49ef-4a96-8425-d28cbca3e132-image.jpeg

    谢谢大哥关注!!!

    我问客服,扔给我这个,让我自己网上搜有什么区别。

    ECC REG这个便宜得不行,不知道能不能用呢。

    客服说能用,他的意思应该是能点亮,我想知道配7900xtx会不会拖后腿。。。。

    对了, 我又在回去看X99-TF的主板。。。。

    ab6ca949-857b-465d-b9c1-e919919c23ea-image.jpeg

    一个月前32g ddr4给我报价才875,涨的太快了

    AI硬件 7900xtx

  • 双 R9700 TP. SGlang 部署qwen3.8-27b-fp8踩坑记录
    S stormaround

    【硬件】
    cpu:5700x
    主板:rog crosshair VIII hero
    内存:ddr4 128g
    显卡:r9700 * 2

    【部署全历程】

    1. 初始部署失败(开箱即挂)
       - 直接跑 sglang 起服务:权重加载、cache 分配都正常,但第一次 forward(多模态 warmup)就卡死,300s 看门狗超时,模型从未成功跑完一次 forward
       - 原因:R9700 无 P2P(PCIe 2 hops),sglang logits 的 TP all-gather 无条件走 triton_symm_mem_ag(NVIDIA PTX kernel + symmetric memory peer IPC),rendezvous 从 C++ 抛 hipErrorIllegalAddress 直接 std::terminate,Python 兜底抓不到 → 硬崩
    
    2. Cursor 调 opus5 改源码 → 部署成功
       - 光靠配置参数救不活,是 Cursor 里的 opus5 深入 sglang 源码:定位到 logits_processor.py:333 创建 MultimemAllGatherer 时缺平台门禁,参照同目录 torch_symm_mem.py 的既有约定补上 is_cuda() 判断,非 CUDA 平台回退到常规 all-gather
       - 验证通过:warmup 首次出现 "The server is fired up and ready to roll!",文本 + 图片推理都正常
       - patch 已打成文件可提上游 PR(分支 fix/rocm-disable-symm-mem-logits-allgather)
    
    3. 速度 0.94 tok/s → 23 tok/s(NCCL_PROTO=Simple)
       - RCCL 的 LL/LL128 低延迟协议在无 P2P 时走主机共享内存病态回退(10KiB all-reduce 要 8.2ms),每 token 光通信就 1045ms
       - opus5 实测对比四种协议,NCCL_PROTO=Simple 快 187 倍
    
    4. 23 → 52 tok/s(MTP steps=3 + KV fp8_e4m3)
       - 启用模型自带的 mtp.safetensors 做 NEXTN 投机解码(必须 topk=1)
    

    (为什么用cursor不是Claude code,因为账号稀里糊涂被封了,也没充钱,使用deepseek-v4-flash一直说无法部署,sglang不支持消费级显卡,部署就挂,使用opus5拆解源码,发现了这个bug,修改后能正常部署)

    【响应速度】

    短 prompt(日常交互):
    - 思维链关闭:TTFT 141ms,生成 35.6 tok/s
    - 思维链开启:TTFT 167ms,生成 40 tok/s
    
    满 ctx(预填充主导,TTFT≈prefill 总时长):
    - 173K 冷启动:TTFT 243s,prefill ~713 tok/s
    - 217K(radix 缓存命中):TTFT 137s
    - 260,028 tokens / 262,144(99.2% 满)冷启动:TTFT 473s(7.9 分钟),生成 3.6 tok/s,prefill ~549 tok/s
    
    【上下文召回命中率】3/3 全中 ✅
    - 200K 长文中间埋 needle → 准确返回
    - 217K → 准确返回
    - 260K 满 ctx(needle 埋在开头,即最远端)→ 准确返回 GOLDEN_NEEDLE_77113
    
    【结论】
    - 召回能力优秀:99.2% 满 ctx 仍能精确找回远端信息,长文检索没问题
    - 短上下文很流畅(首 token <200ms),适合日常对话
    - 满 ctx 基本不可交互:等首 token 要 8 分钟、生成只有 3.6 tok/s,只适合离线批处理场景
    - 生成速度随上下文增长衰减明显:40 → 5.3 → 4.3 → 3.6 tok/s(长序列 decode 每 token 要扫全部 KV)
    - prefill 吞吐 550-713 tok/s 偏慢(ROCm 上 cuda graph 未启用);radix cache 对重复前缀有效(217K 场景 TTFT 直接减半)
    

    A卡使用 SGlang能用,但是速度还是较慢

    AI硬件 r9700 sg-lang qwen-27b

  • 7900XTX 24G白金版哪里买划算,现在京东都涨到7799了,之前还是7299
    S stormaround

    @909 说:

    @stormaround
    二手的怎么样,就是没有保修

    我买的就是二手的,店铺保一年,不过现在二手的也不便宜

    AI硬件 7900xtx

  • DeepSeek FLASH V4 真贵啊!
    S stormaround

    我也差不多,不能白天用,周末可以白天用,还要检查下有没有key被盗用,检查有没有死循环,改用glm-5.3-flash感觉有几次循环,也不便宜

    随便聊聊 deepseek

  • 4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型
    S stormaround

    @gzctgj 说:

    @stormaround 花屏,应该就是过热,显存焊点接触不良,冷却以后就好了吧

    不常出现,就是突然有点彩色点

    AI硬件 rtx4080s r9700

  • 7900XTX 24G白金版哪里买划算,现在京东都涨到7799了,之前还是7299
    S stormaround

    之前买超白金才7199,结果犯蠢用一年5000卖了,上个月花4900又买了张二手超白金,如果买新卡不如买r9700,不过确实7900xtx更快,不过24g经常容易oom

    AI硬件 7900xtx

  • 下单了疯狂的7900xtx+1000w电源,求推荐单路的硬件配置(希望老特不要觉得我在水贴)
    S stormaround

    单路买最便宜的,有显卡插槽就行,确实像在水

    AI硬件 7900xtx

  • 买了俩条 7900XTX白金版 ,其他的配件希望各位大神推荐一下 ,完整上线我过来交作业!
    S stormaround

    两条牛批,没找到涡轮卡,有个卖工包的要8000多块,两张卡很难插在一起,我现在是7900xtx和r9700插一起,跑分层pp不快,就是显存大,能跑q8

    AI硬件 7900xtx

  • 4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型
    S stormaround

    两个我都买了张,个人感觉4080s 32g跑llm更快,跑视频也更好,就是有时候会奇怪的有点像花屏了一样,魔改卡还是比较不省心。r9700这张卡感觉跑llm有点慢,不如7900xtx,跑模型最好找rocm特化版的,能稍微快一点

    AI硬件 rtx4080s r9700

  • 我要新装一个7900XTX到我现在的4060TI电脑上的疑问?
    S stormaround

    我个人感觉7900xtx 跑视频不如n卡,windows驱动经常有问题,必须用linux,现在很多量化版本,8g都能跑,不过7900xtx跑llm还是不错的,只要能装下速度很快

    AI硬件 7900xtx rtx4060
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组