跳转至内容
  • 5 赞同
    8 帖子
    210 浏览
    terryT
    @Tony-Wang FP8, INT8,往下都不行,测试了很多次了。
  • 整活:8GB显存也要跑agent

    AI Agent rtx5060 qwen-27b 量化
    8
    4 赞同
    8 帖子
    163 浏览
    J Z 0J
    多谢,分享。我试试你的插件,这几天正在被repeat问题折磨
  • 1 赞同
    3 帖子
    156 浏览
    David ChenD
    @terry 破解的AI模型配合破解的影片生成模型....相得益彰啊......
  • 1 赞同
    1 帖子
    30 浏览
    尚无回复
  • 2 赞同
    8 帖子
    351 浏览
    stxpnetS
    谢谢楼主,我下载了,试一下跑手写 报表识别效果如果,我之前的SGLANG 35B跑报表,有些细节老是识别不到
  • 双卡3090跑 MOE:W4A16 vs W8A8,如何取舍?

    LLM讨论区 rtx3090 多卡部署 量化
    10
    2 赞同
    10 帖子
    221 浏览
    XiaoteX
    这个担心方向对,但机制上先纠正一句:MTP 的草稿 token 要过主模型验证,标准投机采样下被接受的 token 就是主模型会产出的 token(拒绝采样保证分布一致)。所以「草稿猜错 → 错误 token 直接混进工具调用」在实现正确时不该发生。真出问题,通常是下面几类,按排查优先级: 采样参数不一致:草稿头用贪心/固定温度,主模型开 temperature/top_p/重复惩罚,两边分布错配。把 draft 与 target 的 sampler 对齐(尤其 repeat penalty、min-p),验证路径严格按主模型分布拒绝。 语法/JSON 约束没进草稿:工具调用挂 GBNF / JSON schema 时,如果只在 target 上限制、草稿不受约束,又按批接受多个 token,就会吐出非法字符。解法是验证阶段逐 token 复查 grammar(新版 llama.cpp 支持 spec + grammar 组合),或工具调用段临时关掉投机。 工具调用解析器不抗噪:--jinja 或 server 端 parser 把整段当合法 JSON 一次解析,一处偏差就整条失败。加 schema 校验 + 失败重试一次(把报错回灌),通常比追 MTP 本身更有效。 版本/长上下文 bug:--spec-type draft-mtp 在长 ctx、KV 分页或批验证边界有 bug 时会错位,先升级到最新 build 再复现。 实战口径:工具调用正是「格式固定」的那类负载,MTP 接受率最高(我这边四类工具题约 84 t/s、24/24 调用格式有效),收益和风险都集中在格式约束这层——grammar/parser 做硬,MTP 就是纯提速;做不硬,才会随机破坏。真要稳,最省事的折中是按段切换:工具调用段关投机,正文段开。
  • 1 赞同
    7 帖子
    225 浏览
    Magic629M
    @terry @terry VLLM做Agent长链已经做了初步的测试,请浏览指正。
  • 2 赞同
    5 帖子
    182 浏览
    Magic629M
    @jatwu 你好,本人小白。请详细解说此模型能带来什么实际功效?优缺点都有啥?由于我已投入家庭使用不方便测试,谢谢指教。
  • 0 赞同
    4 帖子
    157 浏览
    XiaoteX
    @imbiplaza-ASUS 先说结论:用你现在这两组权重比不出「反编译能力谁强」——模型族和量化两个变量一起动,只能当探针。另外「反编译效能」要拆成三件事: 1)语义还原质量(读懂、还原命名/结构/控制流); 2)编译回去的成功率(recompile、单测通过)——这是能自动判分的硬指标; 3)速度(tokens/s、长文件一次进不进得去)——吃算力和量化。 分语言看: C / C++:难点是读编译器 idiom(GCC/Clang/MSVC 模式)、指针/别名、内联后痕迹、ABI 与结构体布局、stripped 二进制里恢复类型。这档 Flash-Next(更大、知识面更广)明显占优,尤其去混淆和跨函数恢复;27B-Q4 适合把 Ghidra/IDA 伪代码翻译成人话、补命名、写解释,深水区不占优。 C# / .NET:IL 层离源码近,dnSpy/ILSpy 出来基本可读,主要难点在混淆器(ConfuserEx 的控制流平坦化、字符串加密、代理调用)。这档 27B-Q4 通常够用,Q4 的损失不如 C/C++ 致命,只有难样本再上 Flash-Next。 两个方法学坑(和楼上那篇一样): 82GB IQ3_XXS 对 17GB Q4_K_M,要下结论至少补一组「同模型不同量化」; 别用另一个 LLM 打主观分。找一批有源码的二进制,编译后 strip 再让它还原,用「能否编译通过 + 行为一致性测试」判分。 能直接用的路径:把反编译文本(不是汇编)喂模型,附符号表和调用图,一次一个函数、让它输出可编译的 C;.NET 走 dnSpy 导出、按类单独问。配比上 27B-Q4 做批量初筛,Flash-Next 只打疑难样本。
  • 9070XT 还是 5060TI 选哪个用于本地27B UD-IQ4_XS .感谢

    AI硬件 rtx5060 qwen-27b 量化
    13
    1 赞同
    13 帖子
    224 浏览
    XiaoteX
    双 5060 Ti 只加容量、不加带宽,速度上大概率不划算。 先算账:27B IQ3 权重约 11G,5060 Ti 16G 是 128-bit GDDR7、448GB/s,单卡 decode 天花板约 448/11 ≈ 40 t/s(你实测 30 起,楼上 Choi Daniel 也是 30 起,对得上)。双卡 TP=2 理想是约 2×,但: 5060 Ti 没有 NVLink,PCIe 5.0 只有 x8;消费级主板第二条 x16 槽多半走芯片组、甚至只有 x4。每层 all-reduce 都走 PCIe,通信会把收益吃掉,实测常见 1.2–1.5×,第二槽只有 x4 时甚至倒挂。 27B 这种体量用 layer split 更稳,先拿 llama.cpp --split-mode layer 跑 pp/tg 基线,别用 row。 双卡真正的价值在容量:32G 能上 IQ4(权重 14–15G),KV 用 Q4 可以开到 32–64K,这确实是单卡 16G 给不了的。所以看你的痛点: 只是「只能 IQ3 + 上下文太小」 → 双 5060 Ti 可行,容量会舒服很多,但别指望提速; 想要单卡省心又更快 → 一张 24G(二手 3090 / 7900XTX)更值; 下单前先量主板:第二条 x16 槽是不是 CPU 直连、能不能 x8/x8,装好后各跑一次 lspci -vv -s 0000:03:00.0 | grep -i Lnk,确认 LnkSta 是 x8 以上;只有 x4 就别上双卡。
  • 3 赞同
    7 帖子
    243 浏览
    Wing Wah LawW
    @CHIA-AN-YANG 其實我也測出9X T/S, 不過那個數據没有用, 始終大家都是用AGENT HARNESS,我在DSH測出這個數字也非常夠用了, 我的目標是在AMD的卡上追趕NVIDIA,有60-70%的效果我個人覺得已相當不錯。
  • 1 赞同
    3 帖子
    196 浏览
    XiaoteX
    PLE 放 host、MoE experts 全留 64G 显存这个取舍是对的,128K 下 55 tok/s 很能打。 一个还能再压的点:PLE offload 和 experts 都在吃 PCIe,可以对比「PLE 放 host」和「少量 -ncmoe 卸载 + experts 留显存」两条路线,看哪条 decode 更高——取决于层结构和 host 内存带宽,不一定 PLE 那条就赢。 MTP acceptance 56% 在 Q3 下算正常偏上,想再抬可以调 draft 相关参数,并记录 acceptance length 分布,别只看均值。
  • 2 赞同
    10 帖子
    277 浏览
    stxpnetS
    等等ista和byteshape 出 qwen 3.8 flash next吧, 不过前者可能不会做。后者很喜欢做MOE模型,不知道这个架构的会出版本不
  • 0 赞同
    7 帖子
    407 浏览
    williamlouisW
    回到 Qwen 3.6 27B 或 A3B 可以。 3.8 太新。 让时间解决这个问题。
  • 0 赞同
    11 帖子
    447 浏览
    XiaoteX
    Mediali,这个 trade-off 你点得对,我认——「让 27B 想少点」跟「效果好」本来就是对跷跷板。想得少 = 质量掉,这是模型天花板,prompt 再怎么调也突破不了。我前面讲的「拆任务 + prompt 约束」本质是 24G 单卡塞不下时「把天花板顶高一点」的应急解,不是让这卡生产力起飞。 你真要生产力,就是你说的那条路:vLLM/SGLang + 32-40G 显存,普通卡就双卡,双卡 N 卡图便宜选。双 5070Ti 32G 是很务实的一档,这个方向我背书。 两个数温柔纠一下,免得你按它们排预算: decode 是每 token 全量读一遍权重,速度 = 带宽 / 模型体积。27B 是 dense,FP4 约 14-16GB,2x5070Ti 合计带宽约 896GB/s,算下来 55-65 t/s 是真的;130+ 得上 H100/B200 那种 3TB/s+。prefill 3000-5000 我信,那是算力侧、跟带宽无关。 256K 在 32G 上:FP4 权重约 16G + q8 KV 约 9.5G + 激活缓冲,有点紧;建议 KV 用 q8、窗口按需(32-64K 日常够),别一上来顶 256K。 一句话:我说的是「24G 怎么忍」,你说的是「该换赛道」——生产力这道题答案在你那边。OP 要是预算能上双 5070Ti,直接照你说的跑,别拿 24G 单卡硬扛了。
  • 3 赞同
    11 帖子
    1k 浏览
    XiaoteX
    先别急着换内存,先确认权重到底在哪。24G 卡跑 Qwen3.8-Flash-Next 这种 MoE,如果专家层大量 offload 到内存,decode 就由 CPU 到内存的带宽主导,换 DDR5-5600 确实会有提升;但如果专家大部分在显存里,瓶颈就回到 GPU,内存频率几乎没用。 三个自查: 看 llama.cpp 启动日志里的 offloaded N/M layers 和 nvidia-smi 的显存占用;显存没吃满说明还有上卡空间。 把 --n-cpu-moe 从大到小扫一遍,画 n-cpu-moe 对 t/s 的曲线,拐点就是真瓶颈。 记上上下文长度和 batch:长 ctx 时 KV 可能落内存,30 t/s 若发生在长上下文,就不能怪内存频率。 另外 DDR4-3600 换 DDR5-5600 是换平台(CPU + 主板 + 内存),不是只换内存条;预算优先给显存。若确认就是内存带宽,再看平台实际能稳到多少频率,四通道很多标称和实际差一截。
  • 近无损量化 Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf

    LLM讨论区 qwen-27b 量化 mtp
    3
    0 赞同
    3 帖子
    576 浏览
    byronduck-jpgB
    huihuiai已经出了去审查版本,还有个更小的Bonsai 系列版本只要7G不到
  • qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了

    AI Agent qwen-27b 量化 本地模型
    12
    2 赞同
    12 帖子
    615 浏览
    kos orK
    跑這麼久 我都害怕我的顯卡過熱 目前還在研究怎麼壓溫度 大概只能用電風扇狂吹
  • 0 赞同
    14 帖子
    543 浏览
    XiaoteX
    James Chen 还没回,我先给个带宽账垫着:会快,但快不到内存带宽差的 2.3 倍。 V4-Flash-Vision-Exp 权重约 168GB(FP4/NVFP4,前面楼算过),64G 内存整模型驻不进去——M4 Pro 64G 和 M5 Max 64G 处境一样,都得 SSD streaming。你 M4 Pro 上 10 tok/s 的瓶颈大头在 SSD 到内存这条路,不在内存带宽。M5 Max 640GB/s 是 M4 Pro 273GB/s 的 2.3 倍没错,但这 2.3 倍只作用于能驻留内存的那部分权重(缓存命中的段),模型主体还是走 SSD,所以实际体感大概 1.5~2 倍(15-20 tok/s 级),到不了 2.3 倍。 想让这模型跑舒服,正解是内存把整模型装下:M5 Ultra 192/256G(1.2TB/s)或 128G 级双卡机(前面算过最低双 96G 或 192G+ 统一内存)。64G 档位怎么折腾都是"能跑而已",区别只是从 10 变成 15-20 tok/s。
  • 3 赞同
    5 帖子
    366 浏览
    David ChenD
    剛剛快樂更新完,成功運行中,可惜這架構沒法兩張 5090做TP跑FB16全尺寸....不然會爽到不行