跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
Mediali LiM

Mediali Li

@Mediali Li
取消关注 关注
关于
帖子
17
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    Mediali LiM Mediali Li
    AI硬件 7900xtx sg-lang 多卡部署

    @stormaround 这卡 prefill太低了 说白了就是性能不行 做智能体几乎不能用


  • 3090单卡跑qwen3.8 27b q4km 上下文2456K达成,但是感觉生产力还是不太行。
    Mediali LiM Mediali Li
    LLM讨论区 rtx3090 qwen-27b 量化

    @Xiaote 想的少 效果就差 这是无解的


  • 3090单卡跑qwen3.8 27b q4km 上下文2456K达成,但是感觉生产力还是不太行。
    Mediali LiM Mediali Li
    LLM讨论区 rtx3090 qwen-27b 量化

    这模型想有点效果 首先必须 vllm 或者sglang,单卡24g是很难跑起来的,所以必须 32g-40g显存才有生产力,所以普通卡就必须双卡了,双卡的n卡哪个便宜就选哪个就是了,速度妥妥的提升 能干活,例如双卡 5070ti 32g ,那么nvfp4版本可以开 256k上下文 速度 大概 prefill 3000-5000 输出 130+,长上下文不掉速多少


  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Mediali LiM Mediali Li
    LLM讨论区 dgxspark qwen

    @Kk-Hh 问题这台主机不是3000 也不是1w, 是3-4w, 这价格能用小主机来衡量吗? 这价格目的买的是工作平台来使用吧,不是用来等用来玩的。这价位这速度,超级不值。


  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    Mediali LiM Mediali Li
    AI硬件 7900xtx sg-lang 多卡部署

    还好 我可以经常回国,在美国也没啥好买的,不过之前特价倒是入了3张5090 现在派用场了


  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    Mediali LiM Mediali Li
    AI硬件 7900xtx sg-lang 多卡部署

    @applejuice
    2026_01123_.jpg

    不同模型它的输出速度是不同的。

    双卡的话prefill 大概15000左右,现在在跑next,我就不测试双卡了。


  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    Mediali LiM Mediali Li
    AI硬件 7900xtx sg-lang 多卡部署

    @applejuice 这点速度还快? 27b w4a16 我双卡5090 去到 8000 prefill,nvfp4得 1.5w+ 2080ti我就挂机做个翻译而已!
    2026_01121_.jpgPerf_Qwen3.8-27B-QUASAR-NVFP4_c1_2026-09-08_09_38_39.png
    2026_01122_.jpg


  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    Mediali LiM Mediali Li
    AI硬件 7900xtx sg-lang 多卡部署

    @applejuice 4-bit 量化模型(AWQ、GPTQ 或 AutoRound)的输出速度为 110 token/s,而 FP8 量化可达到约 1500–1600 token/s,从而实现 75 token/s 的输出速度。


  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    Mediali LiM Mediali Li
    AI硬件 7900xtx sg-lang 多卡部署

    Prefill 才500多 速度这么低 能用吗?

    随便一张n卡 都翻倍了吧,双卡价格都上万了才这点速度 ,性价比很差啊,我是不能理解这么低的prefill 做智能体究竟有什么意义,我随便组的 2080ti双卡 27b prefill都有1800+,我都觉得慢,正常好用至少4000+


  • 真心求教Hermes agent运行本地oMLX的Qwen3.8-27B-MLX-4bit如何提速?
    Mediali LiM Mediali Li
    AI硬件 hermes qwen-27b mac

    现在才醒觉,会不会太晚了呢?当时用DS 4 flash的时候就没想过它会涨价吗?你觉得它那么便宜是合理的吗?能一直持续下去吗?现在能用得爽的卡 已经很贵很贵了,都买不起了


  • Qwen3.8 27B + DeepSeek Harness实测:7900XTX本地跑Agent效率不错,忘掉SGLang?llama.cpp咸鱼翻身!
    Mediali LiM Mediali Li
    AI Agent deepseek dsharness llama.cpp qwen-27b

    2080ti*2 不好吗? 同样5000


  • 双显卡叠加 VRAM 玩本地模型的迷思,两年过来人血泪谈,最终直上32gb 单卡
    Mediali LiM Mediali Li
    AI硬件 多卡部署 本地模型

    fcme 用延长线就是的


  • 昨天看到一个博主的配置(5060ti 16G X4 )+华南H12D-8D 这能成吗?
    Mediali LiM Mediali Li
    AI硬件 rtx5090 x99 rtx5060

    再发一个对比
    66F838E82E1E43D2EE1231944EBD337E.png


  • 昨天看到一个博主的配置(5060ti 16G X4 )+华南H12D-8D 这能成吗?
    Mediali LiM Mediali Li
    AI硬件 rtx5090 x99 rtx5060

    @applejuice 2080ti四卡 27b fp8 优化后也有 2200 prefill 输出大概是80tks-100tks


  • 昨天看到一个博主的配置(5060ti 16G X4 )+华南H12D-8D 这能成吗?
    Mediali LiM Mediali Li
    AI硬件 rtx5090 x99 rtx5060

    E88A5B895B8874D6BBA2E513EA47205C.png


  • 昨天看到一个博主的配置(5060ti 16G X4 )+华南H12D-8D 这能成吗?
    Mediali LiM Mediali Li
    AI硬件 rtx5090 x99 rtx5060

    昨天他的测试成绩并不理想 27b fp8 prefill 2300 decode mtp3 100tks


  • 双显卡叠加 VRAM 玩本地模型的迷思,两年过来人血泪谈,最终直上32gb 单卡
    Mediali LiM Mediali Li
    AI硬件 多卡部署 本地模型

    5090 2w 块钱的时候不醒觉 现在才来醒觉,我都第三张5090了

  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组