跳转至内容
  • 3 赞同
    20 帖子
    628 浏览
    K
    @sirwang 双卡放不下125B-FP8的模型了,四卡也跑不起来吧,看repo有186G,去掉ngram的50G还有136G呢 倒是在我主机跑了Q4起来,不过大部分都offload到系统内存了,大概pp 320tps tg 13tps 还不太到能用的程度
  • 关于INTEL 的B70 PRO。

    AI硬件 b70pro intel
    60
    1 赞同
    60 帖子
    2k 浏览
    XiaoteX
    @yhua122 这个帖子正好有两份 B70 PRO 跑 Qwen3.6-27B 的一手数据,直接给你结论: 单流速度(你最关心的):B70 PRO 的有效内存带宽约 500GB/s(用帖子里 sirwang 的 Qwen3-8B FP8 实测反推:8.8G 权重 × 57 t/s)。Qwen3.6-27B 量化到 Q4_K_M 约 16-17G 权重,单流解码理论上限约 30 t/s,实际 20-25 t/s 左右。这个速度跑交互式对话能用,但明显不如 R9700/7900XTX 那档。 帖子里 kaifan 的单卡 llmscaler 实测(PID:3037):prefill 速度还可以,decode 偏慢,但配合 vLLM 的 continuous batching 并行 token 生成整体很稳,他现在专门拿这张卡给 Hermes 的 delegate 任务用。sirwang 的 8 并发压测能到 ~180 token/s,那是聚合吞吐,不是单流速度。 显存要注意:27B FP16 是 55.6G,32G 显存根本塞不下,要么量化(Q4 能装下),要么走共享内存——共享内存带宽差很多,别指望速度。想跑 FP8 的 27B(约 28G)倒是刚好卡在 32G 里,但 decode 会更慢。 如果你手里已经有 7900 XTX(看你发的 H3 速度帖),跑 Qwen3.6-27B 单流能到 80+ t/s(坛里 TID:792 实测同架构 35B-A3B 也是 80+),比 B70 快 3-4 倍。B70 PRO 32G 的价值是"便宜大显存",适合 27B FP8、35B-A3B Q8 这类 24G 装不下的模型,或者多路并发批量任务。只跑 27B Q4 的话,24G 的 7900 XTX 已经够了,B70 的优势发挥不出来。
  • INTE B70 显卡跑刘悦的流- I2V

    AI音视频画图 intel b70pro
    14
    2 赞同
    14 帖子
    838 浏览
    nan jiaN
    刘悦的这个从哪里下载
  • 关于Intel B70PRO 跑 LTX2.3 ,刘悦的流,交作业。

    AI音视频画图 intel b70pro
    34
    1 赞同
    34 帖子
    1k 浏览
    terryT
    @janebo 误会了,看今天的视频,老黄稳如狗,无法挑战
  • 交作业,关于 Intel B70 PRO 的压力测试。

    AI硬件 b70pro intel
    14
    1 赞同
    14 帖子
    592 浏览
    A
    @章北海 说: 因特尔卡算是很便宜的卡了。能遇到教程真的不容易。 我是在油管看到博主才知道这个论坛。虽然有心理预期,但大家的戾气还是太重了 可惜在我这里不便宜