
我是3080 20G OCULINK +3060 12G 雷电3 基本能跑到100左右
殷玉达
@殷玉达
-
RTX 3080 20GB 上以 256k / ~45 tk/s 运行 Qwen3.6-35B-A3B-Q4-K-M(ubuntu) -
RTX 3080 20GB 上以 256k / ~45 tk/s 运行 Qwen3.6-35B-A3B-Q4-K-M(ubuntu)这两参数你调大一点
BATCH="512"
UBATCH="256"
ctx 128K或者64K
K V的压缩尽量统一参数 turbo3 就可以
20g很容易oom,可以去huggface找找小一点的包,没有MTP 35A3B性能就不错 -
基于AI做一个一套Linux环境下的推理服务控制面板没学过编程,通过两个多月的迭代基本能够满足需求,就发布出来,全程hermes。
往论坛内各位多提意见,我继续完善。
https://github.com/coolwolfqs/llm-inference-monitor