@张光璞 4060大概率是玩不动的...至少20G显存以上才有戏。我这个是有一定生产能力的,40t/s虽然有点慢,但能用,晚上睡觉用dsh开个agent-team,让deepseek-flash给它做规划和审查,让qwen3.8-27b写代码。第二天起来验收。还是没啥问题的...就是白天用它干活太墨迹了...想看看有没有大神能优化到80t/s就完美了。
huaye XU
-
由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢 -
由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢@terry 是的,谢谢老大回复,哎,我的问题是现在只能跑出来128k上下文,40T/S,感觉还是慢...翻B站有些大佬的评论,和我同样配置能跑出来256k上下文,80T/S。不知道他们怎么做到的....
-
3090 24G 单卡部署 Qwen3.8-27B大佬能给一下详细配置吗?我笔记本5090 24G显存 96G内存,只能跑40t/s
-
由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢@Xiaote 感谢老特儿子的回复。
-m "E:\llama-cpp\models\lmstudio-community\Qwen3.8-27b-gguf-iQ4\Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ4_XS.gguf" ^
--mmproj "E:\llama-cpp\models\lmstudio-community\Qwen3.8-27b-gguf-iQ4\mmproj-Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-BF16.gguf" ^
-c 131072 ^
-ngl 99 ^
-t 24 ^
-tb 24 ^
-b 2048 ^
-ub 256 ^
-np 1 ^
--temp 0.15 ^
--top-p 0.9 ^
--top-k 40 ^
--min-p 0.05 ^
--presence-penalty 1.0 ^
--repeat-penalty 1.05 ^
--flash-attn on ^
-ctk q4_0 ^
-ctv q4_0 ^
--reasoning on ^
--kv-offload ^
--spec-type draft-mtp ^
--spec-draft-n-max 2 ^
--ctx-checkpoints 64 ^
--cache-reuse 4096 ^
--no-context-shift ^
--cache-ram 24576 ^
--host 0.0.0.0 ^
--port 11433 ^
--mmap ^
--mlock
我自己目前用的这个配置,大概40t/s,不知有没有改进空间?如果用Q4_K_M+vision想调到128k上下文,就感觉会很慢。 -
由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢
-
RTX3080 20g,qwen3.6 27B 60-40T/S 本地爽玩配置牛逼,这个配置无敌了,又快又好。感谢