速度不错 上下文短了点
Dady Pan
@Dady Pan
-
小白到能玩# 4080 SUPER 32G 跑 Qwen3.8-27B 无审查版(Q6_K) 实测61.7t/s 完整部署与实测指南,自己从27t/s一路调上来的,分享给大家 -
qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了早上类似的项目 mac上取已登录的网站cookie,权限给到,Q6检查了下环境迅速取到,W4bash倒了好多回合十几分钟,要我远程去界面确认钥匙链才取到。。。
-
qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了@imbiplaza-ASUS 差不多 45tok均速,我还考了low的思考等级,丢一个项目过一段时间再去看,本身也有其他会话一起处理别的事,不会干等着

-
qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了@terry 我觉得挺多 实测是真的提升 擦屁股干了几次都很顺利 给人一种很安心的感觉 均速度45tok也能接受
-
qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了等大佬测试结果,dflash2实际感受下来,复杂点会实现不完善,也出现部署服务失败,修复dsh会话bug直接干蹦,最后都是Q6擦屁股,但是sglang hicache多会话简直太好了,十几个会话都指向他,高频的128K2,其他中低频64K,完全无压力,平均速度都能70-80,,,,单会话100tok+,就这一点释放了其他设备;4080s32部署Q6 100K2 实现主框架写好文档,w4快速扫尾,Q6核查。。。
-
我换回3.6 35B了这卡本来就被吹高的
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
作业已抄,确实可以达到110+,截图测试了两个会话降了点,单会话110+稳稳的,测试场景是大前端代码分析重构 -
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ想抄作业, deepseek让我问问 torch、transformers、sglang、系统和驱动版本,,感谢!
结合另外一篇,ds总结是否正确?
