双卡 3090 qwen 3.8-27b dflash2 131k上下文 ,100+ t/s 有大神已经搞出来了?
-


https://github.com/oceanplexian/vllm/pull/1
感觉变革太快了。比起3.6时代还要疯狂啊!
如果有256K或200K上下文,我都愿意换用它这个方案!我自己目前是用双卡 qwen 3.8 w4a16的 awq模型,只有66t/s +256K上下文 ,还没机会测试超过131K的上下文。
其实我目前的感觉,没有nvlink的话,100K前还好,过了100K,nccl提供那点带宽就供给不上了,直接导致prefill 速度和生成速度都断崖式下降。 -
我觉得2000prefill 60decode 才是最适合的agent 用. 过了1500prefill 50decode 这条线 我宁愿长上下文 跟 更高准确率
一张卡 我昨天读我的本地文件 结果131k context 压缩了好多次
一张卡prefill 好像最多1000 总共花了50分钟... -
@applejuice 你现在那个卡还没修好吗? 单卡推理跑什么框架和模型?
我在国外,邮寄需要一个星期多
前两天搞到卖家手上,不知道他们几时才能给回复现在用着
Item Value Model Qwen3.8-27B UD-Q4_K_M (16.46 GB, sha256-verified, nextn head present) Engine llama.cpp b10498-60addddf3, static CUDA sm_86 Context 135,168 KV q8_0 / q8_0 Vision on (mmproj-F16) MTP draft-mtp, n-max 2
,地上有个🧼