跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
stxpnetS

stxpnet

@stxpnet
超凡大师
取消关注 关注
关于
帖子
336
主题
44
分享
0
群组
1
粉丝
1
关注
1

帖子

最新 最佳 有争议的

  • 关于问AI大模型 *洗车* 的问题
    stxpnetS stxpnet

    随机性很高,一个问题测不出来啥效果,实战和测试都差异 很大。

    LLM讨论区

  • 3090单卡跑qwen3.8 27b q4km 上下文2456K达成,但是感觉生产力还是不太行。
    stxpnetS stxpnet

    在线的不是不行, 是白天高峰期能力下降,我都是半夜用就没有问题。

    LLM讨论区 rtx3090 qwen-27b 量化

  • 双 3090 NVLink 从vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开
    stxpnetS stxpnet

    @Leon-Y 二位的主板和CPU是什么样的呢? @applejuice

    AI Agent rtx3090 sg-lang qwen-27b

  • 我换回3.6 35B了
    stxpnetS stxpnet

    35B是文科生,擅长写文章吹水,收集资讯。 编程的话,就是俗称的抽卡了,看运气的。

    AI硬件 qwen

  • Qwen3.8-27B 关掉推理~效率快太多 成果差不多
    stxpnetS stxpnet

    看工作场景吧,编程,还有对账,涉及资金之内的,不差时间我都开最大思考

    LLM讨论区 qwen-27b

  • GLM 5.3 FLASH有点划算啊
    stxpnetS stxpnet

    b0b17df8-e3df-4199-9c0e-4544aadb9600-image.jpeg 体感 上和glm 5.3差不多,但是感觉挺划算的,我先站起来蹬。

    随便聊聊 glm

  • reddit每日热帖欣赏 0828
    stxpnetS stxpnet

    03cfc3ad-b628-4e0b-afac-feb9d93ef603-image.jpeg

    8577da8a-e864-4198-bc43-3f3e77efc865-image.jpeg

    随便聊聊

  • reddit每日热帖欣赏 0828
    stxpnetS stxpnet

    @terry 随便聊聊

    随便聊聊

  • 刚注意到京东元器件这个区域,是东哥自营的吗?
    stxpnetS stxpnet

    这问题要问强子:店铺倒闭之后你们京东官方兜底吗?

    随便聊聊

  • 从孙宇晨 景甜事情想到的。。。
    stxpnetS stxpnet

    85bd3fca-d77b-4ccf-94ef-c3144e2c21fa-e82e4280d170162e3c55130a5a445202.jpg

    c49bc408-9286-4ac0-b4a0-d121ef739792-9d4c40339c999a667fbce01828af8609.jpg

    看来皮衣黄已经穷途末路了, 比特币故事讲不下去,又盯上AI. 前几天才120亿美刀收购hugginface, 现在要拉出孙宇晨了. 等这波AI泡沫破了,一定让白猪国和泡菜国,还有贾牌尼日,经济灰飞烟灭.

    随便聊聊

  • reddit每日热帖欣赏 0828
    stxpnetS stxpnet

    2e68e138-c458-48e5-8354-07be171ab016-image.jpeg

    1e83e08f-7cd3-4ab0-9e87-ad2bcb17eb94-image.jpeg

    llama-server
      --host 127.0.0.1 --port ${PORT}
      --model ~/llm/models/Qwen3.8-27B-UD-Q5_K_XL.gguf
      --alias qwen38-27b
      --n-gpu-layers 99
      --parallel 1
      --flash-attn on
      --predict 16384
      --ctx-size 24576
      --cache-type-k q8_0
      --cache-type-v q8_0
      --spec-type draft-mtp
      --spec-draft-n-max 2
      --temp 0.6
      --top-p 0.95
      --top-k 20
      --min-p 0.0
      --presence-penalty 0.0
      --threads 8
      --batch-size 1024
      --ubatch-size 256
      --no-mmap
    
    随便聊聊

  • 请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择
    stxpnetS stxpnet

    之前试过几十个GGUF的QWEN 3.6 27B,感觉对于RTX3090显卡,最好的就体积在16-18G的。
    今天看到byteshape居然都开始量化稠密模型了:
    598df9a8-1e1a-40da-a722-87ce88a785a2-image.jpeg
    它只有这几种格式,相信有它自己道理:
    8733184e-c74b-42e8-9428-a5f1a3a22ac0-image.jpeg

    我的问题是,目前在Q4 - Q6这个区间,最好的量化格式是哪家?
    UD 3.0 ,Byteshape,还是 ?

    最好的框架呢? 我用过的有beellama buunllama ik llama 和官方的。

    LLM讨论区 qwen-27b llama.cpp

  • Qwen3.8-Flash-Next M5 Max实测
    stxpnetS stxpnet

    看了一下,心仪的UD Q4 XL是111GB啊: Qwen3.8-Flash-Next-GGUF
    /UD-Q4_K_XL 111 GB 我的配置是48G显存 64G内存,我不想卸载到SSD还差得远。不过有条32G的想挪过来换掉 就刚刚踩线
    Qwen3.8-Flash-Next-GGUF UD-IQ4_XS 93.7 GB 这个不换内存 似乎还刚好,有点心动了。

    不过我的决定是,死等 byteshape出 Qwen3.8-Flash-Next的GGUF ,这家的MOE模型调校非常好。同等体积下总是比别人的格式更均衡。

    LLM讨论区 qwen mac apple-m5

  • Qwen3.8 Flash实测:跑分吊打27B,压制DeepSeekFlash,现实慢成乌龟,无法有效执行Agent任务,有待打磨!
    stxpnetS stxpnet

    这个NEXT代表的意思是下一代预览,使用的下一代架构,还是要给它一些时间等实测。我只有64G内存就不玩了。如果我有80G或者96G+内存都会试试。

    LLM讨论区 qwen deepseek

  • 准备好迎接Qwen3.8-Flash-Next 125B A6B
    stxpnetS stxpnet

    @GitNo2 395和3090是怎样连接的呢? 有点好奇。 不在同一个机器的两张显卡,有没有可能通过超高速光纤网络进行互联呢?

    LLM讨论区 qwen

  • 双卡别无脑刷同款模型:双 RX 7900 XTX 跑 Qwen3.8-27B 的异构分工与 MTP 实战调优
    stxpnetS stxpnet

    和我的想法不同,我想的是左脑 理科生 ,稠密模型,慢工出细活。 右脑文科生,MOE模型,想象力丰富,关于编排,做领导。 合二为一,威力无穷。

    LLM讨论区 7900xtx qwen-27b mtp

  • 准备好迎接Qwen3.8-Flash-Next 125B A6B
    stxpnetS stxpnet

    @Quanta-Magic 16G显存,64G空余DDR5内存应该可以跑得很欢了。

    LLM讨论区 qwen

  • 准备好迎接Qwen3.8-Flash-Next 125B A6B
    stxpnetS stxpnet

    对啊,就看它优化得如何了。 我一直的设想是,这种MOE是文科生,回答问题速度快,多轮下来,直击一个问题的各个方面,然后最后进行一个大总结,速度快,角度全。应该和同等价值硬件能跑稠密模型有得一拼,然而事实却总是打脸。 我最后还是会选择稠密,宁愿久一点,都不要错一点。

    LLM讨论区 qwen

  • 准备好迎接Qwen3.8-Flash-Next 125B A6B
    stxpnetS stxpnet

    4d97ff5f-db32-475e-8a89-ad0fe9de3801-image.jpeg

    1bc82737-f228-4a64-b5cd-20e9854ffce3-image.jpeg

    https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next

    这会是DGX Spark的梦中情模吗?

    LLM讨论区 qwen

  • 有人试过freetoken吗?现在很火
    stxpnetS stxpnet

    我刚刚也看到呢,应该要吃MOE红利。 但是这个东西,也就骗骗新手吧。目前还是27B为主了

    LLM讨论区 本地模型
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组