跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

老

老茶

@老茶
取消关注 关注
关于
帖子
17
主题
3
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 有个新想法打算今晚下班试验一下
    老 老茶

    IMG_7912.jpeg

    确实能租 2 个月,所谓的“无忧试用”

    AI硬件 r9700 llama.cpp rocm

  • 有个新想法打算今晚下班试验一下
    老 老茶

    @Bunsei 说:

    @terry 说:

    租的显卡?可以,写的详细点,分享下,还真不知道。但我提前预测下,rocm下的显卡通信绝对不好玩,你的主板不差吧,R9700理论上SG-Lang原生支持。

    是的,我还特意问了一下京东客服确认了一下,京东是能租卡的。我这块RX9070 大概是750元可以租2个月。可不是那种卡七天无理由的玩法。😂

    聊天记录

    有点意思,我也去看看

    AI硬件 r9700 llama.cpp rocm

  • 4090 48g 维修经历
    老 老茶

    @Hao-Wu 说:

    @terry 公布商家是有啥作用吗?你们是怎么看这个商家与这个事情?
    虽然维修了四次,但是和商家的沟通我觉得还是可以的,他们也一直积极的配合让工厂修。维修四次这个事情我觉得主要还是工厂的问题,商家也要承担商家到工厂之间的来回运费。毕竟也是个魔改卡,小工厂 做出来的品质可能也就这样了。京东自营好一些的可能能换卡,普通商家也是赚个差价,也基本不太可能给换卡。
    另外他们最近店铺宝贝都清空了,我问过要买也只能微信转或者对公转账开票。微信转账购买是我觉得比淘宝更不靠谱。如果对公转账开票,可以拟定合同写好保修时间条款也是个保障,只是有京东自营可以选择的话,明显京东自营更靠谱

    千万不要迷信对公转账啊,有坑——拖延交付3个月,再把公司注销了,你就只能走法院诉讼,律师费+2年诉讼期,只有哭的份。

    AI硬件 rtx4090

  • 邪修提速:本地qwen3.8+hermes agent
    老 老茶

    这个思路可以啊,有空干点重活试下效果

    AI Agent qwen-27b hermes agent

  • 寻章摘句老雕虫 Qwen3.8 27b DSpark 再调优:吞吐提升 32%
    老 老茶

    本机环境是 Qwen3.8 27b NVFP4+DSpark,受 github 上开源项目的启发,就用微信问了一下Dspark上的Hermes这个调优方案是否可行,Hermes 建议:

    “不需要升级整套——你的部署更完善(锁版、systemd、鉴权、Claude Code 补丁),且 DSpark 在你机器上的实测数字(贪心中位 34.7)高于远端 MTP 的报道值。

    值得单独摘两条过来(低风险、有实测收益):

    1. CPUSET 绑核:--cpuset-cpus 5-9,15-19 → 预期 +2–7%
    2. GDN 池修正:96 → 8×4=32 槽,释放状态内存给 KV 池(并发 8 不变)

    两条都只需重建容器,不碰模型权重。”

    tiaoyou02.jpeg

    微信上一声令下,远端的 Hermes 就吭哧吭哧开干!每 10 分钟汇报一次进度。直到调优结束,又跑了两轮测试。

    tiaoyou03.jpeg

    【调优后把测试报告发给DeepSeek V4 Flash 请他给写个总结】

    本次针对 Qwen38 DSpark 推理服务完成了 CPU 调度与 GDN 状态内存两项联合优化。通过将容器固定到 10 个 3.9GHz X5 大核,降低了 draft 生成、验证循环及 radix cache 管理等 CPU 关键路径的调度抖动;同时将 max-mamba-cache-size 从 96 修正为与当前并发需求匹配的 32,释放约 1.2GB 状态内存用于扩大 KV cache 空间。

    在相同 bench.sh 探针下,greedy 中位吞吐从 34.7 tok/s 提升至 45.7 tok/s,相对提升约 32%。其中 code 提升约 38%,reasoning 提升约 24%,free prose 提升约 12%;math 场景的峰值从 43.6 tok/s 提升至 53.2 tok/s,但该场景仍存在较大波动,需要增加样本进一步验证。

    两次综合复测分别达到 45.8 tok/s 和 45.7 tok/s,差异仅约 0.22%,说明本次性能提升具有高度重复性,并非偶发结果。综合判断,原配置同时存在 CPU 调度和状态内存过度预留问题,两项改动在 DSpark 架构下形成了明显的协同优化效果。

    AI硬件 qwen-27b dgxspark hermes

  • DGX单机也有春天——Qwen3.8-27B at 34-38 tok/s on DGX Spark (GB10) — one-command SGLang + NVFP4 + DSpark
    老 老茶

    @Bukong-Li 说:

    我刚搞了两台 dgx,现在测试v4的数据。现在在测试512k ,加24,32并发数据。

    豪华版🤩

    LLM讨论区 dgxspark qwen-27b gb10

  • 真心求教Hermes agent运行本地oMLX的Qwen3.8-27B-MLX-4bit如何提速?
    老 老茶

    小特说的“关思考”这步可以好好试一下,另外 Mac 本来就是个偏科生,这么低的功耗下,以纯学习为主,兼顾娱乐和影音, tok/s 能到 30 以上就不错了😁别指望太多

    AI硬件 hermes qwen-27b mac

  • DGX单机也有春天——Qwen3.8-27B at 34-38 tok/s on DGX Spark (GB10) — one-command SGLang + NVFP4 + DSpark
    老 老茶

    @applejuice 说:

    @soop-ladios
    单机2000pp 30decode 我真心觉得很好
    完全够用
    重要是省心 也不吵

    感觉现阶段dgx spark x2 唯一的好处就是 ds flash v4 百万长上下文

    是的,可 X2 的话电费又上去了😂 而且很容易引起家里领导的注意——为什么又多了个一模一样的盒子?!🤔

    LLM讨论区 dgxspark qwen-27b gb10

  • 发一个自测的 Qwen3.8-27B 鹈鹕骑自行车动画
    老 老茶

    X上这个讨论也很热门,结论是:降低思考强度的速度收益大,质量并不会有什么损失。

    LLM讨论区 qwen-27b

  • DGX单机也有春天——Qwen3.8-27B at 34-38 tok/s on DGX Spark (GB10) — one-command SGLang + NVFP4 + DSpark
    老 老茶

    @terry 说:

    @Rex-Fan 性能这么残暴?

    双机豪华版

    LLM讨论区 dgxspark qwen-27b gb10

  • 官网Deepseek V4 Flash答题翻车实录
    老 老茶

    哈哈哈~ 终究还是得有几个大模型在“手”——机😂这年头,手无寸“模”很难行走江湖咯

    LLM讨论区 deepseek

  • 官网Deepseek V4 Flash答题翻车实录
    老 老茶

    哈哈哈,是啊,这第一回合Deepseek是有点猝不及防,其实Deepseek Flash V4 在同一个地方翻了两次车,等围观群众多了再晒出来。“难道Deepseek收费上去了,智商却下来了么”——处江湖之远则忧梁圣啊~~~~

    LLM讨论区 deepseek

  • DGX单机也有春天——Qwen3.8-27B at 34-38 tok/s on DGX Spark (GB10) — one-command SGLang + NVFP4 + DSpark
    老 老茶

    DGX的低功耗、安静、CUDA原生支持是我选择它的原因,但跑起本地大模型者实拉垮,直到我看见github上这个项目——Qwen3.8-27B-SGLang-DGX-Spark

    MiaAI-LAB.png

    NVIDIA的官网也有推荐

    nVIDIA官网.png

    行动不如行动,火速通知Hermes——搞起!

    2026-08-17 01-16-04 实测结果对比屏幕截图.png

    结果是这个样子
    测试结论.png

    按照惯例,此时应该由亲爱的Deepseek V4 Flash做总结陈词:

    这个RadixArk版NVFP4模型可以理解成:为了在DGX Spark上跑出极致速度,而用“几乎无损的精度换数倍性能”的工程优化版本。

    它并非简单的“低精度阉割版”,而是一个经过精密设计的混合精度方案。下面从三个维度来帮你拆解:

    📊 精度与性能的平衡:为什么说“几乎无损”
    它不是纯4-bit:虽然名字叫NVFP4,但RadixArk的这个检查点是混合精度的。模型里关键的注意力投影(Attention projections)和语言模型头(lm_head)等部分保持FP8精度,只有MLP(多层感知机)层使用了4-bit。实际平均下来大约在6.5 bits/参数,比纯4bit精度更高。这种策略保护了对精度最敏感的部分。

    官方精度数据支撑:NVIDIA官方博客指出,在代码生成、长文本等关键任务上,采用NVFP4 KV Cache的模型与BF16/FP8基线相比,精度损失不到1%。Unsloth团队的数据也显示,NVFP4方案的top-1精度恢复率能达到92%–97%(其中代码任务为96.68%,聊天为92.15%)。

    实测能力不降级:从你实测的benchmark来看,这个模型在数学推理能达到43.6 tok/s,代码生成稳定在34 tok/s,且Hermes的tool calling评测得分达到92/100。这些都印证了它在实际智能体(Agent)和推理任务中的能力保持得很好。

    🚀 NVFP4的核心价值:专为Blackwell架构优化的“快车道”
    NVFP4不只是简单的4-bit量化,它是NVIDIA为Blackwell架构(如你的DGX Spark)专门设计的格式。

    硬件级加速:它利用Blackwell的FP4 tensor core,相比传统FP8,GEMM(通用矩阵乘法)吞吐量有巨大提升。

    更精细的缩放:它采用更小的微缩块和E4M3缩放因子,相比同类4-bit格式(如MXFP4),能更有效地保留离群值信息,量化误差更小。

    🎯 为什么DGX Spark需要它
    核心在于内存带宽墙。你实测35 tok/s的速度,已接近DGX Spark物理带宽的理论上限。如果用BF16或FP8模型,会被带宽严重限制;而NVFP4将权重从~28.5GB(FP8)压缩到~16.5GB,让数据搬运更快,DSpark投机解码才能发挥威力。

    💎 总结
    所以,精度的“代价”被控制在极低水平,而速度的“收益”是巨大的。它并非官方FP8的降级版,而是为你的DGX Spark硬件量身定制的、用微小精度换极致性能的最优解。

    它的高分推理成绩和稳定的35 tok/s表现,足以证明它在实际使用中是高度可靠的。

    LLM讨论区 dgxspark qwen-27b gb10

  • 官网Deepseek V4 Flash答题翻车实录
    老 老茶

    昨天在自己的DGX Spark上部署完Qwen3.8 27b NVFP4,本着闲着也是闲着的精神,就让Qwen3.8出个题考考Deepseek V4 Flash,正所谓:“发动模型斗模型。” Qwen3.8很快设计出来个损题:

    “六个销售员:甲、乙、丙、丁、戊、己。 每个客户恰好由一名销售员负责:A、B、C、D、E、F(每个客户一人,每人负责一个客户)。 六人的月销售额互不相同,取自:80、120、160、200、240、280(单位:千元)。 已知条件: 1. 乙负责 B。 2. 负责 D 的销售额是 280。 3. 甲不负责 A、D。 4. 己不负责 C、E。 5. 丙不是最低。 6. 甲比负责 A 的多 80。 7. 戊比负责 E 的多 40。 8. 乙比戊多 120。 问题:请列出所有满足全部条件的分配方案(每人负责哪个客户、销售额各是多少),并判断解的个数(唯一解/多解共N组/无解)。“

    我反手就贴给了Deepseek官网的Deepseek V4 Flash在线聊天框
    Qwen vs DS4_01.jpeg

    V4 Flash 光速给出了答案,这下Qwen3.8 笑弯了腰
    ,哈哈哈哈——不及格!
    Qwen vs DS4.jpeg

    DeepSeek V4 Flash 的回答:

    这是一个经典的逻辑谜题,可以用约束满足的思路来求解。我们一步步梳理,最终得到所有可能方案。

    一、从“谁是谁”开始
    先用已知条件整理出一些硬约束:

    乙 → B

    负责 D 的人 → 销售额 280,且这个人 不是甲(条件 3),不是己(己不负责 C、E,但不影响 D)

    甲不负责 A、D

    己不负责 C、E

    丙不是最低

    甲 = 负责 A 的人 + 80

    戊 = 负责 E 的人 + 40

    乙 = 戊 + 120

    二、用销售额差来推导
    销售额只可能是:

    text
    80, 120, 160, 200, 240, 280
    关键约束(条件 6、7、8):

    甲 - A = 80
    → 只有这些差值可以满足:
    (甲, A) 的可能对:

    (160, 80) → 差 80

    (200, 120)

    (240, 160)

    (280, 200)
    但甲不能是 280(因为甲不负责 D,280 是 D 的销售额)。
    所以留下:
    (160,80)、(200,120)、(240,160)

    戊 - E = 40
    可能对:

    (120, 80)

    (160, 120)

    (200, 160)

    (240, 200)

    (280, 240)

    乙 = 戊 + 120
    意味着戊只能比较小,乙比较大。
    排查:

    戊 = 120 → 乙 = 240

    戊 = 160 → 乙 = 280

    戊 = 200 → 乙 = 320 不可能

    所以只有两种情况:

    Case A:戊 = 120,乙 = 240

    Case B:戊 = 160,乙 = 280
    但 280 是负责 D 的人的销售额,乙负责 B,所以乙 ≠ 负责 D 的人 → 乙 ≠ 280。
    所以 Case B 排除。

    ✅ 确定了一个关键结论:

    乙 = 240(负责 B)

    戊 = 120

    三、由此推甲和 A
    前面得到的甲- A 对:

    (160, 80)

    (200, 120)

    (240, 160)

    但:

    乙 = 240 → 甲 ≠ 240

    戊 = 120 → 甲 ≠ 120,且 A ≠ 120

    唯一剩下:
    ✅ 甲 = 160,A = 80

    四、继续推戊与 E
    戊 = 120,且戊 - E = 40 → E = 80
    但 A = 80,销售额互不相同 → 不可能同一个销售额对应两个客户。

    → 矛盾。

    ✅ 最终结论
    这组约束无解(0 组方案)。
    不是唯一解也不是多解,而是条件本身自相矛盾。

    快速验证(逻辑链)
    乙 = 戊 + 120
    → 戊只能 120 或 160

    戊 ≠ 160(否则乙 = 280,但 280 是 D 的,乙 ≠ D)
    → 戊 = 120,乙 = 240

    甲 - A = 80
    → 排除甲乙冲突后,只能甲 = 160,A = 80

    戊 - E = 40 → E = 80

    但 A = 80 → 销售额重复 → 违反“各不相同”

    耳光响亮啊......

    【空口无凭 有图为证】
    Qwen vs DS4_01.jpeg

    【Qwen3.8老师给Deepseek小朋友解题】
    Qwen vs DS4_02.jpeg

    下面掌声有请看热闹的“友商“【ChatGPT5.6】总结这次翻车事件的关键点:

    DeepSeek回答中的主要问题不是简单算错,而是:

    1. 混淆“某人的销售额已被占用”与“该人能否负责某客户”;
      
    2. 错误排除了“A客户负责人销售额为120”的合法情况;
      
    3. 没有完整展开分支;
      
    4. 单一分支失败后没有回溯;
      
    5. 宣布“无解”前没有构造或回代候选方案;
      
    6. 将不完整推理包装成了“快速验证”。
      

    因此,本次回答应判定为不合格。

    本次失败不能简单概括为“不会逻辑推理”。更准确的能力画像是:
    · 局部差值推导:具备;
    · 初步约束传播:具备;
    · 实体与属性绑定:出现关键错误;
    · 分支完整性:不足;
    · 回溯能力:本次未表现出来;
    · 多解枚举:失败;
    · 最终自验证:缺失。

    DeepSeek V4 Flash在线版在这一次回答中表现出明显的变量绑定错误、分支遗漏和回溯失败,在要求“列出全部解”的严格约束满足任务中可靠性不足。

    LLM讨论区 deepseek

  • 一直没找到在DGX上能完全满意的一套模型配置
    老 老茶

    可以试下这个AEON https://github.com/AEON-7/AEON-7#-support-the-work

    LLM讨论区 本地模型 服务器

  • 關於本地版的模型
    老 老茶

    这块卡很有特点,300W的功耗,性能没有损失太多,后续升级潜力大,一直在关注。

    LLM讨论区 本地模型
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组