跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

Dan XiaD

Dan Xia

@Dan Xia
取消关注 关注
关于
帖子
5
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • PVE HomeLab ( R9700x2+3090) 極限方案
    Dan XiaD Dan Xia

    @sarcoma 建议考虑容器,可以直接映射,一张显卡映射给多个CT。我的llama.cpp、comfyui、musubi-tuner等都是各自一个独立容器,共用一张7900XTX,保证各自的环境都是干净的,出问题也不会影响其他东西。

    AI硬件 rtx3090 r9700

  • 请教你们都是怎么解决上下文总是满了的问题?
    Dan XiaD Dan Xia

    @vanvj 上下文开的有点保守了。我跟你一样的显卡,一样的模型,不加载mmproj,上下文可以开到160K。多轮会话后累积上下文太长了prefill速度受不了,但是把--cache-ram、--cache-prompt、--cache-reuse都用上,其实也就还好。我实际使用最多拉到了110K,能忍。7900XTX跑llama.cpp最重要的一点是用vulkan,别用rocm。1c604772-da5a-4598-84b5-f7d951f52012-image.jpeg

    LLM讨论区 本地模型

  • Meta Muse Glimmer 30B实测:4090D 48G + Hermes + Codex Agent/编程测试,挑战Qwen 27B?请原谅我被逗笑了!速度飞快,编程一塌糊涂!
    Dan XiaD Dan Xia

    昨天拿了两段llama.cpp分别用vulkan和rocm跑相同模型的log,让Qwen3.6-27B和Muse Glimmer分别用svg把prefill速度随prompt增长而衰减的曲线画出来。

    这是Qwen3.6-27B画的:

    f8ba601a-e2a2-4618-aa82-b26a0e880783-image.jpeg

    这是Muse Glimmer画的:

    9ac1f9b2-93f0-467b-a29c-db043c9f7c02-image.jpeg

    能说啥呢?meta棒棒的!

    LLM讨论区 qwen-27b meta glimmer 本地模型 rtx4090
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组