随机性很高,一个问题测不出来啥效果,实战和测试都差异 很大。
-
关于问AI大模型 *洗车* 的问题 -
3090单卡跑qwen3.8 27b q4km 上下文2456K达成,但是感觉生产力还是不太行。在线的不是不行, 是白天高峰期能力下降,我都是半夜用就没有问题。
-
双 3090 NVLink 从vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开@Leon-Y 二位的主板和CPU是什么样的呢? @applejuice
-
我换回3.6 35B了35B是文科生,擅长写文章吹水,收集资讯。 编程的话,就是俗称的抽卡了,看运气的。
-
Qwen3.8-27B 关掉推理~效率快太多 成果差不多看工作场景吧,编程,还有对账,涉及资金之内的,不差时间我都开最大思考
-
GLM 5.3 FLASH有点划算啊
体感 上和glm 5.3差不多,但是感觉挺划算的,我先站起来蹬。 -
reddit每日热帖欣赏 0828

-
reddit每日热帖欣赏 0828@terry 随便聊聊
-
刚注意到京东元器件这个区域,是东哥自营的吗?这问题要问强子:店铺倒闭之后你们京东官方兜底吗?
-
从孙宇晨 景甜事情想到的。。。

看来皮衣黄已经穷途末路了, 比特币故事讲不下去,又盯上AI. 前几天才120亿美刀收购hugginface, 现在要拉出孙宇晨了. 等这波AI泡沫破了,一定让白猪国和泡菜国,还有贾牌尼日,经济灰飞烟灭.
-
reddit每日热帖欣赏 0828

llama-server --host 127.0.0.1 --port ${PORT} --model ~/llm/models/Qwen3.8-27B-UD-Q5_K_XL.gguf --alias qwen38-27b --n-gpu-layers 99 --parallel 1 --flash-attn on --predict 16384 --ctx-size 24576 --cache-type-k q8_0 --cache-type-v q8_0 --spec-type draft-mtp --spec-draft-n-max 2 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --threads 8 --batch-size 1024 --ubatch-size 256 --no-mmap -
请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择之前试过几十个GGUF的QWEN 3.6 27B,感觉对于RTX3090显卡,最好的就体积在16-18G的。
今天看到byteshape居然都开始量化稠密模型了:

它只有这几种格式,相信有它自己道理:

我的问题是,目前在Q4 - Q6这个区间,最好的量化格式是哪家?
UD 3.0 ,Byteshape,还是 ?最好的框架呢? 我用过的有beellama buunllama ik llama 和官方的。
-
Qwen3.8-Flash-Next M5 Max实测看了一下,心仪的UD Q4 XL是111GB啊: Qwen3.8-Flash-Next-GGUF
/UD-Q4_K_XL 111 GB 我的配置是48G显存 64G内存,我不想卸载到SSD还差得远。不过有条32G的想挪过来换掉 就刚刚踩线
Qwen3.8-Flash-Next-GGUF UD-IQ4_XS 93.7 GB 这个不换内存 似乎还刚好,有点心动了。不过我的决定是,死等 byteshape出 Qwen3.8-Flash-Next的GGUF ,这家的MOE模型调校非常好。同等体积下总是比别人的格式更均衡。
-
Qwen3.8 Flash实测:跑分吊打27B,压制DeepSeekFlash,现实慢成乌龟,无法有效执行Agent任务,有待打磨!这个NEXT代表的意思是下一代预览,使用的下一代架构,还是要给它一些时间等实测。我只有64G内存就不玩了。如果我有80G或者96G+内存都会试试。
-
准备好迎接Qwen3.8-Flash-Next 125B A6B@GitNo2 395和3090是怎样连接的呢? 有点好奇。 不在同一个机器的两张显卡,有没有可能通过超高速光纤网络进行互联呢?
-
双卡别无脑刷同款模型:双 RX 7900 XTX 跑 Qwen3.8-27B 的异构分工与 MTP 实战调优和我的想法不同,我想的是左脑 理科生 ,稠密模型,慢工出细活。 右脑文科生,MOE模型,想象力丰富,关于编排,做领导。 合二为一,威力无穷。
-
准备好迎接Qwen3.8-Flash-Next 125B A6B@Quanta-Magic 16G显存,64G空余DDR5内存应该可以跑得很欢了。
-
准备好迎接Qwen3.8-Flash-Next 125B A6B对啊,就看它优化得如何了。 我一直的设想是,这种MOE是文科生,回答问题速度快,多轮下来,直击一个问题的各个方面,然后最后进行一个大总结,速度快,角度全。应该和同等价值硬件能跑稠密模型有得一拼,然而事实却总是打脸。 我最后还是会选择稠密,宁愿久一点,都不要错一点。
-
准备好迎接Qwen3.8-Flash-Next 125B A6B -
有人试过freetoken吗?现在很火我刚刚也看到呢,应该要吃MOE红利。 但是这个东西,也就骗骗新手吧。目前还是27B为主了

