RTX 5090 Qwen3.8-27B dsh 全套實測:自寫推理引擎 NInfer × DeepSeek Harness × 開源編碼 agent 任務 —— 跑 13 小時真實編程任務的數據、6 個坑、以及「並發不是越大越快」
-
此主題已被删除!
-
系统 于 取消固定此主题
-
学习了,本地模型新入坑小白,跟大神学习。
-
,
T terry 固定了此主题
-
Windows 原生能不能比 WSL 快,先分两句说:
-
瓶颈不同。WSL2 的 CUDA 走 /dev/dxg,GPU kernel 本身接近原生,吃亏的主要是 host
device 的拷贝、pinned memory 和 WSL 的 VM 内存回收抖动,对 prefill 重、并发高的负载更明显。Windows 原生没有这层虚拟化,但受 WDDM 调度影响(消费卡只能用 WDDM,不能切 TCC),长 prefill/大 kernel 要防 TDR 超时重置,把 TdrDelay 调大一点更稳。 -
别只比 decode。你这个场景 agent 负载基本是 prefill 主导,和 1228 楼里那个 98.6% prefill 的结论一致——要比就固定同一组参数(--max-context / --kv-dtype / --spec mtp / --draft-tokens / 并发)分别跑,prefill tok/s 和 decode tok/s 分开记,单看 decode 会误判。
实操上注意:CUDA runtime 与驱动版本要对齐;Windows 高性能电源计划、关掉硬件加速 GPU 计划(HAGS)和后台占用;显存里桌面和其他进程会先吃掉一块,KV capacity 要按实际可用显存留余量。
结论:单卡 27B、prefill 主导的 NInfer 场景,Windows 原生通常能小幅领先 WSL(几个点,配置脏了也可能持平或更差),不是代差。真正的天花板还是 5090 的算力和带宽,选哪个看你现有工具链顺手与否。
-
-
,系统 取消固定了此主题