跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

Bin MaoB

Bin Mao

@Bin Mao
取消关注 关注
关于
帖子
4
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 真心求教Hermes agent运行本地oMLX的Qwen3.8-27B-MLX-4bit如何提速?
    Bin MaoB Bin Mao

    @stxpnet 说:

    我的建议是,让AI上谷姐和REDDIT去帮你找 大本营,总有大神会和你用同款机器,然后他会精调一个专门针对这个机型的框架和模型,然后你接个deepseek v4,设计 好提示词,让梁文峰直接帮你抄作业就完事了。 我等了几天已经等到了。 以下给你一个HERMES可用的提示词:

    去谷歌和reddit 帮我调研一下,最近7天内的,关于qwen 3.8 27b的模型比如(huggingface.co/zhnagchenchne/Qwen3.8-27B-GPTQ-W4A16 ),看看有哪些比较适合MacBook pro M5 MAX 128G 的,列最适合的10个,并用表格说明各自优劣势 ,我目前用的这个是 huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP ,感觉还行,但是离完美还有一些距离. 我比较喜欢【什么样的模型,用途主要是XXXX 】的。 如果reddit上找不到相关内容的话,可以从 huggingface.co/models?p=1&sort=created&search=qwen+3.8+27b 这个作为起点进去找找。 本会话可能要做为每日常规任务。主要目标是发掘一个适合 我本地 MacBook pro M5 MAX 128G 硬件的vllm或者sglang模型及框架 .

    👍 非常感谢,这个也很有帮助。。。马上办!

    AI硬件 hermes qwen-27b mac

  • 真心求教Hermes agent运行本地oMLX的Qwen3.8-27B-MLX-4bit如何提速?
    Bin MaoB Bin Mao

    谢谢各位的解答!按照xiaote的模式,我暂时应用起来了,慢点就慢点,熬着试试再说,实在不行继续用ds v4 flash外加agnes 2.5 flash,再次感谢!

    AI硬件 hermes qwen-27b mac

  • 真心求教Hermes agent运行本地oMLX的Qwen3.8-27B-MLX-4bit如何提速?
    Bin MaoB Bin Mao

    @kop-wang 说:

    “该如何解决hermes调用本地模型严重降速的问题”

    这就是统一内存的内存带宽太小导致prefill太慢导致的,无解。
    hermes的冷启动提示词大概在10k token左右,1000t/s的prefill能力,就需要罚站10秒。更何况M5 MAX 彪不到1000t/s
    而且prefill会随着上下文的占用线性变慢。

    那这岂不是只能继续用云端模型了?!哎,天了噜!!!

    AI硬件 hermes qwen-27b mac

  • 真心求教Hermes agent运行本地oMLX的Qwen3.8-27B-MLX-4bit如何提速?
    Bin MaoB Bin Mao

    电脑配置是MacBook pro M5 MAX 128G,因为不懂编程,一直使用deepseek v4 flash通过hermes做一些金融小模型的训练和量化编程,截止目前都很不错。

    介于ds开始涨价,而自己平常使用的token确实有点儿多,加之对LLM的专业能力范围不大,就想使用Qwen3.8-27B-MLX-4bit本地化部署,通过oMLX让hermes调用。结果发现在oMLX对话页面的速度是很好的,但是一连接上hermes就降速厉害,半天没个反应,速度严重拉胯。

    真心请教各位,该如何解决hermes调用本地模型严重降速的问题,另外,oMLX如何优化配置Qwen3.8-27B这个模型呢?我对上下文的长度有刚性需求,也不知道如何调整,先谢谢各位了!

    AI硬件 hermes qwen-27b mac
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组