跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
guochaofacaiG

guochaofacai

@guochaofacai
取消关注 关注
关于
帖子
4
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本,跑 Qwen3.8-27B:显存频率 1107 MHz,解码 73.5 tok/s
    guochaofacaiG guochaofacai
    AI硬件 v100 qwen-27b 本地模型

    先说一下背景,本人80后,坐标上海,从2024年初开始用Claude总结会议纪要,写每周工作报告,到后来回邮件到后来用的越来越重.

    到今年7月的时候就发现20美金的Claude和20美金的Codex都不够用了,开始想要不要玩一玩本地模型,当时还不知道Terry和这个论坛,就通过Chat-GTP和Google来回对比花了3000不到买了块V100的洋垃圾,想着如果跑通了未来可以升级.

    没想到跑出了看起来似乎还不错的数字,这几天用下来感觉真的是能用了,加上Terry推荐的Harness,感觉Claude可以退掉了.

    7a18483ea1a96802b7b278e3a6ecddbd.jpg

    这是买回来卡和显卡坞时候拍的照片

    ccb505a4dd27b177311cbdd393163353.jpg

    我本人对技术和编程一无所知下面这些话和图都是Harness整理,AI味有点重,,大家凑合看看.

    图1.png

    一、身份与规格:原厂 Tesla 信息完整

    41a614a0-9244-42d4-92f4-c4d535f940b7-image.jpeg

    判断这张卡是原厂 Tesla 卡,依据就是这四项——它们同时出现在一张卡上,改卡很难伪造。

    外接链路:雷电口协商到 PCIe Gen3 x4。坞内供电是 2× PCIe 8-pin,额定 300 W,另有一路 CPU 8-pin 未使用。

    二、显存频率 1107 MHz,落在 V100S 规格上
    用 PyTorch 测 14.21 GB 张量的读写:

    9c9d8c36-a932-450f-b1f5-bfc62fd3c36e-image.jpeg

    1107 MHz 这个频率把这张卡归到了 V100S 规格,实测带宽也印证了这一点:984.5 GB/s 的纯读落在 1134 GB/s 理论值的 87%,是合理水平。另一个参照是 RTX 3090 的 936 GB/s,这张卡比它高。

    图2.png

    三、250 W 是硬件上限,满载全程没有降频

    57bfe71b-981a-40e6-ab79-6112b2ebc76f-image.jpeg

    峰值 284.4 W 超过 250 W 上限,这是 GPU 功耗采样的瞬时超调,持续时间极短。三项降频原因全程显示 Not Active,说明没有因为功耗撞墙而降频。平均功耗 207.8 W 低于上限 42 W,250 W 这个额度平时用不满。

    四、软件配置:llama.cpp 10964 加 MTP 投机解码

    893f6642-5509-41eb-844b-f1d6cdec8e3d-image.jpeg

    每一组都真实重载模型,负载是同一份 7026 token 真实材料加同一提示词,seed 固定,避免单次抖动。

    图3.png

    5.1 草稿长度 n-max=5,解码提升 11.2%
    28c2a0bc-d544-4013-a5f0-e0b8fa558c83-image.jpeg

    投机解码让草稿模型一次猜多个 token,n-max 是猜的长度。5 是甜点,8 开始回落——猜得越长,草稿本身出错概率越高,被主模型否决的浪费越多。

    5.2 批大小 16384/4096,预填充提升 30.7%
    4616347f-362b-47d8-8088-8550637db104-image.jpeg

    预填充是算力受限,加大批处理让 GPU 吃得更饱,这一组的收益比解码那一组更大。

    5.3 KV 缓存量化:无收益,未采纳

    --cache-type-k q8_0 --cache-type-v q8_0 跑出解码 73.2(对照 74.0),预填充 803.4(对照 806.7)。两项都略低,未采纳。

    六、一个必须写出来的错误:用通用提示词测出来的结论是反的

    第一轮调参,我用「写一篇行业分析」这类通用提示词做基准,得出「n-max 越大越慢」的结论,差点把投机解码关掉。

    换成真实抽取负载(要求输出 FACT | 主题 | 内容 的结构化格式)重测,结论直接反转。

    原因在草稿接受率:

    b5fee81c-7c48-4489-b3ca-67991779286c-image.jpeg

    结构化抽取的输出格式高度可预测,草稿模型几乎每次都猜对;自由写作没有可预测的套路,草稿十次里错七次。同一张卡、同一个模型,差 2.2 倍。

    这条经验比任何一组参数都值钱:判断本地模型够不够快,必须用自己真实的负载去测,通用 benchmark 在这里会给出完全错误的结论。

    05_context_and_workload.png

    七、最终结果:解码 73.5 tok/s、预填充 857 tok/s

    --ctx-size 65536 -b 16384 -ub 4096 -np 1
    --spec-type draft-mtp --spec-draft-n-max 5

    95d44b1d-a6a6-4c82-967b-4d4990166bfc-image.jpeg

    04_final_performance.png

    九、我拿来做什么工作:

    1. 投研报告的资料抽取——几万字行业材料进去,输出结构化的数字登记表与事实表

    2. 会议纪要提炼——录音转写稿进去,出主题、结论、行动项

    3. 本地翻译——中英文材料互译

    不跑 ComfyUI 生图,不做模型训练。负载以长文本读取和结构化输出为主,解码占七成、预填充占三成,正好是这张卡带宽优势能吃满的地方。

    写在最后

    先谢 Terry。DeepSeek Harness 这套东西是从你的 YouTube 频道看到的,还有很多需要向你和大家学习.

    作为一个小白现在似乎已经跑通了本地模型部署了,下一步肯定是无尽的硬件,软件折腾,时隔快20年再一次在论坛发帖,好多青少年时期"玩电脑"的回忆又涌现出来,岁月如梭,祝大家开心.

  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组