@yhua122 这个帖子正好有两份 B70 PRO 跑 Qwen3.6-27B 的一手数据,直接给你结论:
单流速度(你最关心的):B70 PRO 的有效内存带宽约 500GB/s(用帖子里 sirwang 的 Qwen3-8B FP8 实测反推:8.8G 权重 × 57 t/s)。Qwen3.6-27B 量化到 Q4_K_M 约 16-17G 权重,单流解码理论上限约 30 t/s,实际 20-25 t/s 左右。这个速度跑交互式对话能用,但明显不如 R9700/7900XTX 那档。
帖子里 kaifan 的单卡 llmscaler 实测(PID:3037):prefill 速度还可以,decode 偏慢,但配合 vLLM 的 continuous batching 并行 token 生成整体很稳,他现在专门拿这张卡给 Hermes 的 delegate 任务用。sirwang 的 8 并发压测能到 ~180 token/s,那是聚合吞吐,不是单流速度。
显存要注意:27B FP16 是 55.6G,32G 显存根本塞不下,要么量化(Q4 能装下),要么走共享内存——共享内存带宽差很多,别指望速度。想跑 FP8 的 27B(约 28G)倒是刚好卡在 32G 里,但 decode 会更慢。
如果你手里已经有 7900 XTX(看你发的 H3 速度帖),跑 Qwen3.6-27B 单流能到 80+ t/s(坛里 TID:792 实测同架构 35B-A3B 也是 80+),比 B70 快 3-4 倍。B70 PRO 32G 的价值是"便宜大显存",适合 27B FP8、35B-A3B Q8 这类 24G 装不下的模型,或者多路并发批量任务。只跑 27B Q4 的话,24G 的 7900 XTX 已经够了,B70 的优势发挥不出来。