跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
huaye XUH

huaye XU

@huaye XU
取消关注 关注
关于
帖子
7
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢
    huaye XUH huaye XU

    @张光璞 4060大概率是玩不动的...至少20G显存以上才有戏。我这个是有一定生产能力的,40t/s虽然有点慢,但能用,晚上睡觉用dsh开个agent-team,让deepseek-flash给它做规划和审查,让qwen3.8-27b写代码。第二天起来验收。还是没啥问题的...就是白天用它干活太墨迹了...想看看有没有大神能优化到80t/s就完美了。

    LLM讨论区 rtx5090 llama.cpp qwen-27b

  • 由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢
    huaye XUH huaye XU

    @terry 是的,谢谢老大回复,哎,我的问题是现在只能跑出来128k上下文,40T/S,感觉还是慢...翻B站有些大佬的评论,和我同样配置能跑出来256k上下文,80T/S。不知道他们怎么做到的....

    LLM讨论区 rtx5090 llama.cpp qwen-27b

  • 3090 24G 单卡部署 Qwen3.8-27B
    huaye XUH huaye XU

    大佬能给一下详细配置吗?我笔记本5090 24G显存 96G内存,只能跑40t/s

    AI硬件 rtx3090 qwen-27b

  • 由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢
    huaye XUH huaye XU

    @Xiaote 感谢老特儿子的回复。
    -m "E:\llama-cpp\models\lmstudio-community\Qwen3.8-27b-gguf-iQ4\Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ4_XS.gguf" ^
    --mmproj "E:\llama-cpp\models\lmstudio-community\Qwen3.8-27b-gguf-iQ4\mmproj-Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-BF16.gguf" ^
    -c 131072 ^
    -ngl 99 ^
    -t 24 ^
    -tb 24 ^
    -b 2048 ^
    -ub 256 ^
    -np 1 ^
    --temp 0.15 ^
    --top-p 0.9 ^
    --top-k 40 ^
    --min-p 0.05 ^
    --presence-penalty 1.0 ^
    --repeat-penalty 1.05 ^
    --flash-attn on ^
    -ctk q4_0 ^
    -ctv q4_0 ^
    --reasoning on ^
    --kv-offload ^
    --spec-type draft-mtp ^
    --spec-draft-n-max 2 ^
    --ctx-checkpoints 64 ^
    --cache-reuse 4096 ^
    --no-context-shift ^
    --cache-ram 24576 ^
    --host 0.0.0.0 ^
    --port 11433 ^
    --mmap ^
    --mlock
    我自己目前用的这个配置,大概40t/s,不知有没有改进空间?如果用Q4_K_M+vision想调到128k上下文,就感觉会很慢。

    LLM讨论区 rtx5090 llama.cpp qwen-27b

  • 由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢
    huaye XUH huaye XU

    由于经常异地出差办公,所以配的RTX 5090 Laptop 24G显存 96G内存的笔记本,求大神给个llama.cpp的启动配置以及qwen3.8 27b的量化版本选择。谢谢

    LLM讨论区 rtx5090 llama.cpp qwen-27b

  • RTX3080 20g,qwen3.6 27B 60-40T/S 本地爽玩配置
    huaye XUH huaye XU

    牛逼,这个配置无敌了,又快又好。感谢

    AI硬件 nvidia rtx3080
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组