RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型(160K,F16 KV CACHE?)
-
没买到第二张RTX 3090 (全新的要1万,黑猛禽也要9300),那就慢慢看吧。
这两天顺便折腾了一下,把P100 16G放在第二个PCIE上面跟3090做 8X/8X拆分,拆分是拆分了,但是也跑不起来。
最后索性把视觉塔卸载到P100上面,3090里面全部放权重。160K上下文+Q8 KVCACHE就这样跑着吧。
今天逛X的时候有个新发现,眼前一亮。号称12G权重,另一个X用户说双F16 都可以跑,这也过于逆天了吧。 以下是那个实验室自己发布的评测数据:


另一个X用户发表的,F16 KV CACHE,164K上下文:

按它这种算法 ,那RTX 4090 48G不得跑上480K上下文?
首先从hf-mirror.com,依然无法下载,依然是xet问题,看来我大天朝还没人下载过这模型。
然后modelscope居然已经有了(https://modelscope.cn/models/EschaLabs/Qwen3.6-35B-A3B-Escha-W2 https://huggingface.co/EschaLabs/escha-runtime-qwen3moe 可以把这两个URL丢 给HERMES,给它30G硬盘空间,然后坐等开玩),我让hermes自己折腾了 半小时:
安装阶段都是qwen 3.6 35b a3b搞掂的,后来有CUDA 13与CUDA 12.9的兼容性问题,切来切去太麻烦,就deepseek v4 flash搞掂的。
赶紧开玩:
起始有135左右,过了一会儿掉到了110多。 没有WEBUI还真不习惯,先拉个openwebui的镜像试试。tooleval 分数,掉分全部掉在了预填充上面:

-

WEBUI写出来的坦克大战,挺惊艳的,但是一动就卡死了。用hermes调用 它写出来的超级玛丽,画面相对惊艳,但是依旧进游戏之后,卡死动不了。感觉循环很严重:

另外这个模型需要单独的运行时和可执行程序,reddit有人质疑存在恶意软件风险:

一句话总结:有一定潜力,但不多,给我的感觉很像那个bonsai 27B,可以留足够大的空间给K V CACHE,但感觉总差点意思,很可能是原始权重与 k/v cache之间量化等级差异过大(权重约2-3BPW,K V CACHE却是Q8-F16等级) 。
缺点:1.没有视觉。 我还是回到我的初始方案。甚至让我想测一测UNSLOTH的Q3KM MTP的效果。
2.可执行文件是闭源的,有恶意软件风险,没把握的要在关掉之前让HERMES自己排查一下系统,晚上睡觉关机。 -
没买到第二张RTX 3090 (全新的要1万,黑猛禽也要9300),那就慢慢看吧。
这两天顺便折腾了一下,把P100 16G放在第二个PCIE上面跟3090做 8X/8X拆分,拆分是拆分了,但是也跑不起来。
最后索性把视觉塔卸载到P100上面,3090里面全部放权重。160K上下文+Q8 KVCACHE就这样跑着吧。
今天逛X的时候有个新发现,眼前一亮。号称12G权重,另一个X用户说双F16 都可以跑,这也过于逆天了吧。 以下是那个实验室自己发布的评测数据:


另一个X用户发表的,F16 KV CACHE,164K上下文:

按它这种算法 ,那RTX 4090 48G不得跑上480K上下文?
首先从hf-mirror.com,依然无法下载,依然是xet问题,看来我大天朝还没人下载过这模型。
然后modelscope居然已经有了(https://modelscope.cn/models/EschaLabs/Qwen3.6-35B-A3B-Escha-W2 https://huggingface.co/EschaLabs/escha-runtime-qwen3moe 可以把这两个URL丢 给HERMES,给它30G硬盘空间,然后坐等开玩),我让hermes自己折腾了 半小时:
安装阶段都是qwen 3.6 35b a3b搞掂的,后来有CUDA 13与CUDA 12.9的兼容性问题,切来切去太麻烦,就deepseek v4 flash搞掂的。
赶紧开玩:
起始有135左右,过了一会儿掉到了110多。 没有WEBUI还真不习惯,先拉个openwebui的镜像试试。tooleval 分数,掉分全部掉在了预填充上面:
