跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
_折騰__

_折騰_

@_折騰_
取消关注 关注
关于
帖子
10
主题
2
分享
0
群组
0
粉丝
1
关注
0

帖子

最新 最佳 有争议的

  • qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了
    _折騰__ _折騰_

    从dflash2换到dspark,代码的质量感觉上了一个台阶。
    速度从110 t/s 掉到平均 85 t/s 还是可以的,任务量不小,一直在跟踪进度,react 转 react native web。
    b47f239a-ed58-4e22-ac8c-843b32a73417-image.jpeg

    AI Agent qwen-27b 量化 本地模型

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    llama.app Qwen3.8 27B Q6K DFlash2 实测速度也还可以,持续写入平均在96 tok/s 上下浮动,Q6模型比W4A16-AWQ的精度高出1%-2%(理论值,实际感知不大),但模型大小多出8个G左右。 两个模型目前基本达到理想配置了,已经没有能力再提升了。

    AI Agent rtx4090 sg-lang dflash

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    这个速度还有没有提升空间了?同配置同模型下,还有更高的token速度吗?请晒出参数,学习一下。

    配置:4090 魔改48GB 64GB内存
    SGlang版本:0.5.19.dev20260825+g1fa32d50e1
    实测DSH,长时间多轮写码 平均 110 tok/s
    参数:
    │ --model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-W4A16-AWQ
    │ --served-model-name qwen3.8-27b-w4a16-awq-dflash2
    │ --speculative-algorithm DFLASH
    │ --speculative-draft-model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-DFlash2
    │ --speculative-num-draft-tokens 8
    │ --speculative-draft-model-quantization unquant
    │ --default-chat-template-kwargs {"reasoning_effort":"medium"}
    │ --attention-backend flashinfer(主模型)
    │ --speculative-draft-attention-backend triton(草稿,滑窗)
    │ --linear-attn-backend triton(GDN/mamba 层)
    │ --context-length 250000
    │ --kv-cache-dtype fp8_e4m3
    │ --mem-fraction-static 0.75
    │ --max-total-tokens 240000

    ScreenShot_2026-08-26_223757_815.png

    AI Agent rtx4090 sg-lang dflash

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    @xiaote 正常编码没问题,效果很好。但尝试以下提示词时,会长时间思考最终因为思考过长,已达到输出 token 上限回答被截断,试过pi hsd都无法正常回答并开始任务,连续4轮思考都被截断了,以下是提示词:使用html单文件写一个超级马里奥的游戏,要保证游戏细节,可玩性,不要脱离原版游戏的体验,尽可能还原所有细节。
    有没有成功的?

    实测开启 HiCache 输出速度会砍掉一半!

    AI Agent rtx4090 sg-lang dflash

  • M5 Max/Ultral AI性能强悍?苹果、AMD、英伟达AI小主机AI性能全面分析,潜力很大但统一内存并非万能!
    _折騰__ _折騰_

    朋友M5 MACBOOK 128G 跑27B都非常拉夸,不是硬件不行,而是目前配套框架还不给力,看着我的4090的速度,他直掉眼泪。。。

    AI硬件 mac amd nvidia

  • Qwen releases Qwen3.8-Flash-Next! 來了
    _折騰__ _折騰_

    RTX PRO 6000 跑起来都累,27B养老吧!

    LLM讨论区 qwen
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组