跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

Grant HuangG

Grant Huang

@Grant Huang
取消关注 关注
关于
帖子
2
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 【RTX4060】【8G显存】运行Qwen3.6 35B A3B APEX-MTP包含两种方式及测试结果
    Grant HuangG Grant Huang

    @fcme 说:

    @Grant-Huang 说:

    是

    网页聊天的输入token特别短长点的基本上也就两三k,Hermes调用的话,默认提示词就20k以上,就300多的pp速度,你算一下需要处理多久吧。8g的卡只能是跑起来而已,用来驱动agent几乎不可用的。

    明白,就是对话开头prefill的上下文太大了,所以时间肯定长..

    AI硬件 llama.cpp rtx4060 nvidia

  • 【RTX4060】【8G显存】运行Qwen3.6 35B A3B APEX-MTP包含两种方式及测试结果
    Grant HuangG Grant Huang

    我的3070 8G显存也可以llama.cpp, 但是用Hermes调用就非常慢. 是什么原因呢?
    https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

    AI硬件 llama.cpp rtx4060 nvidia
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组