跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

Ray WangR

Ray Wang

@Ray Wang
取消关注 关注
关于
帖子
19
主题
3
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 你们的Hermes都是怎么网上冲浪的?
    Ray WangR Ray Wang

    爬取网页用什么工具最好啊?好的衡量标准就是快、稳定、能最大程度规避放机器人机制。

    我本地部署的Firecrawl,用着还行,但是实在是太慢了,爬一个网页有时候要几分钟...

    SearXNG只能搜索,爬具体网站还得靠别的工具。

    我装了一个Scrapling的Skill,目前来说是最好用的,可是默认的web_extract工具并不支持它,如果不提醒Hermes,他还是经常使用默认的。

    各位大佬爬网页这一块子是怎么搞的呢?

    AI Agent hermes

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @kos-or 我之前看到过有个CAD harness,可以让ai做cad,但是具体还没研究过。我搞CAD不专业,打印机买来给儿子打印玩具的...

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @kos-or 🙄 我太懒了,主要我有条件扔地下室,所以直接摆了一台风扇在那24小时吹着... 压力测试了一下,E5其实发热不大,然后GPU的话还有专门的机箱120mm风扇吹着,问题也不大。

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @AGI 哎,我这台机器本来也是准备进柜的。但是几年前买这个机柜时候啥也不懂,买的是那种很浅的,只能放点Switch这些小设备...

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @applejuice 没有,感觉用不到,我也没有VGA线哈哈。过几天我把IPMI装上就完全满足我需求了。

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @passss 嗯,现实就是,哪怕限制到300w,瞬时峰值还是有可能冲到400w以上。

    我之前挖矿7、8台GPU一起跑,而且美国这边是110v家用电,上大瓦数不好上,所以我用的都是多电源模式。现在这个配置是两个850w电源,中间用一个add2psu(下图)同步启动器。2号电源的24针插到这上面,然后接一根molex到1号电源上,就可以做到两台电源同时启动了。

    两个电源分别带一个GPU,完全够用。这套东西是经过广大矿工考验的😅 ,安全可靠。你有条件的话可以也像我这样再加个电源,我觉得比折腾一个大电源省事一点。

    5be28026-d948-439d-8940-d7ec6cf45b01-image.jpeg

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @applejuice 好像跟我这code成绩差不多,但你功耗低很多,明天我跑一下试试

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @kos-or 我买的25cm的,一言难尽,放到最边上有点短会有点扯,放到中间又很长有点折,但好歹没什么大问题,建议你架子到手了以后,把gpu排好了,自己测量一下再买线。

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @applejuice 话说你跑大模型大概能到多少TPS呢,我看你之前的作业,只有烤机,没有写跑分

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @applejuice 地下室,随便它怎么叫唤我也听不到,延迟的事情我得研究一下。

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    @terry 这是我家地下室😂

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    对了,说到Ubuntu,这里也有个坑,我这套配置现在没法装26.04,U盘安装时菊花一直转,症状可以参考这个帖子:https://askubuntu.com/questions/1567178/ubuntu-26-04-installer-freezes-at-get5-cdrom-resolute-main-amd64-packages-on-o

    里面提供的解决方法是装完server版再手动加desktop,我直接改装24.04了。

    AI硬件 x99 rtx3090

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    Ray WangR Ray Wang

    以下大部分是比较罗嗦的流水账,技术内容在分割线后。

    前阵子入坑了本地AI。手上有两张3090,但是自己用的机器机箱、电源只够跑一张。而且平时要打打游戏,用Adobe系列软件,需要占用显卡,来回释放显存也很麻烦。想着再配一台电脑吧,但是看了看现在内存、SSD的价钱,还是算了吧。

    后来看了牢特视频,了解到了洋垃圾的世界。果断某东搜索华南金牌,到官方店下单了一整套X10X99套餐,带两个U,4x32G ECC拆机条,一个2TB长城NVME,总共6000(机箱散热器这些重的大的东西就没买了)。说实话玩洋垃圾似乎有点小贵,但是比起在美国装新机器还是便宜太多了,而且将来淘汰下来还可以跑我那一堆乱七八糟的docker服务。虽然美国Aliexpress也有X99套装,但是买着感觉就是不如京东旗舰店放心。又花了700元子运到了美国,大概一个星期就到了。

    e4d5a08f-cafd-4db5-a017-7b15a298d241-eda36dbeb1f234fb7695b3f90b3eb730.jpg

    两个洋垃圾当年不远万里离开了北美机房温柔乡,被送到了深圳冰冷的仓库里,现在终于回到了家乡的温暖怀抱。我把几年前挖矿用的开放式机架和两个电源废物利用,给他搭了个窝...

    3e086e4c-6619-4f03-b2e1-850bed6ed23b-17ef967d0a90eb439414c6534c580730.jpg

    77d10cff-dfa1-4e4f-8123-4a340e91a469-99ab7faab906937db2d43e200019ccbc.jpg

    装机一切都算顺利,只是到最后就是不POST,主板报"Ad"码。售后小哥跟我一起排查了一遍,4条内存8个插槽排列组合搞了一遍也没点亮屏幕。最后发现是因为显示器接的是HDMI,主板上有个3针跳帽负责切换显示模式。插在AB上面是VGA,把它给换到BC上面屏幕就成功亮了... 华南金牌东西是挺好的,就是说明书完全没用,不知道将来会不会对其他人有所帮助。

    d59dea89-6e5a-4186-b2f8-8a038942e430-1cbbc8acfc06938991fd0805583723f6.jpg

    接下来就是装Ubuntu,装各种必要的软件,然后就是跑分了。

    ================================分割线================================

    直接跑Github上 club-3090 的懒人包,以前我都是跑单卡的,现在终于能跑双卡了。用的是vllm,AutoRound INT4 量化,FP8 KV,MTP n=3,262K上下文。

    两张卡我都按推荐的限制到了290W。用的是最新的595驱动,13.2 CUDA。

    ========== NARRATIVE (prompt=65 chars, max_tokens=1000) ==========
    === warmups (3) ===
      warm-1     wall= 19.64s  ttft=   184ms  toks=1000  wall_TPS= 50.91  decode_TPS= 51.40
      warm-2     wall= 19.46s  ttft=   188ms  toks=1000  wall_TPS= 51.39  decode_TPS= 51.89
      warm-3     wall= 19.02s  ttft=   188ms  toks=1000  wall_TPS= 52.58  decode_TPS= 53.10
    
    === measured (5) ===
      run-1      wall= 19.03s  ttft=   146ms  toks=1000  wall_TPS= 52.56  decode_TPS= 52.97
      run-2      wall= 19.25s  ttft=   187ms  toks=1000  wall_TPS= 51.94  decode_TPS= 52.45
      run-3      wall= 20.46s  ttft=   145ms  toks=1000  wall_TPS= 48.88  decode_TPS= 49.23
      run-4      wall= 19.59s  ttft=   193ms  toks=1000  wall_TPS= 51.06  decode_TPS= 51.57
      run-5      wall= 18.44s  ttft=   143ms  toks= 972  wall_TPS= 52.70  decode_TPS= 53.11
    
    === summary [narrative] (n=5) ===
      wall_TPS       mean=  51.43   std=  1.57   CV= 3.0%   min=48.88   max=52.70
      decode_TPS     mean=  51.86   std=  1.59   CV= 3.1%   min=49.23   max=53.11
      TTFT          mean=   163ms  std=   25ms  min=143ms  max=193ms
      PP tok/s       mean=   1.00   std=  1.37   CV=136.9%   min=0.00   max=2.50
    
    ========== CODE (prompt=78 chars, max_tokens=800) ==========
    === warmups (3) ===
      warm-1     wall= 10.25s  ttft=   152ms  toks= 691  wall_TPS= 67.39  decode_TPS= 68.41
      warm-2     wall=  7.23s  ttft=   183ms  toks= 478  wall_TPS= 66.11  decode_TPS= 67.82
      warm-3     wall=  8.92s  ttft=   183ms  toks= 556  wall_TPS= 62.36  decode_TPS= 63.67
    
    === measured (5) ===
      run-1      wall=  7.08s  ttft=   186ms  toks= 466  wall_TPS= 65.81  decode_TPS= 67.58
      run-2      wall= 11.91s  ttft=   185ms  toks= 784  wall_TPS= 65.85  decode_TPS= 66.89
      run-3      wall= 11.79s  ttft=   184ms  toks= 771  wall_TPS= 65.41  decode_TPS= 66.45
      run-4      wall= 11.58s  ttft=   188ms  toks= 746  wall_TPS= 64.43  decode_TPS= 65.49
      run-5      wall= 12.38s  ttft=   185ms  toks= 800  wall_TPS= 64.61  decode_TPS= 65.59
    
    === summary [code] (n=5) ===
      wall_TPS       mean=  65.22   std=  0.67   CV= 1.0%   min=64.43   max=65.85
      decode_TPS     mean=  66.40   std=  0.88   CV= 1.3%   min=65.49   max=67.58
      TTFT          mean=   186ms  std=    2ms  min=184ms  max=188ms
      PP tok/s       mean=   2.50   std=  1.77   CV=70.7%   min=0.00   max=5.00
    

    综合的看就是写作文能跑到50多T/s,写码大概65+T/s。虽然感觉已经很够用了,但是离项目上描述的69/89还有一定的距离,具体还要再多跑一下多调试一下。

    ae32a004-3647-432e-b429-419a2fa9dd9e-image.jpeg

    AI硬件 x99 rtx3090

  • 怎么看Nvidia最新发布的RTX Spark?会是电商、视频利器吗?
    Ray WangR Ray Wang

    综合来看,这完全就是DGX Spark笔记本版,另外加上了Windows(因为原本的DGX Spark是Linux)。也不知道目标群体是谁... 媒体通稿都是划时代的大新闻,实际上毫无新意。

    DGX Spark根本就不是一个推理机,而是用来做原型训练的,在把正式训练交给GB300之前,用小的Spark集群做测试,因为二者架构相同。现在把这套照搬到Windows笔记本上,着实是有点搞笑了。真要搞推理,跑LLM跑不过Mac,跑图跑视频跑不过4090/5090,当然了不可否认,大显存对跑长视频很有帮助。

    唯一能想到的应用就是超轻薄游戏本...?

    AI硬件 nvidia

  • 需要理解怎么搬运Windows下的wan2.2到Linux
    Ray WangR Ray Wang

    你所谓的界面是comfyui吗

    局域网调试好,在server启动以后,到另一台电脑上浏览器通过server的ip启动图形界面就行了

    comfyui所谓的图形界面实际是个内网网站,所以搭载它是不需要显卡的,就好像老特运营这个论坛是不需要显卡的

    AI音视频画图 wan linux

  • 来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕
    Ray WangR Ray Wang

    @joker_chang https://github.com/noonghunna/club-3090

    照这个抄作业,不过前提是装linux,3090用llama.cpp方案,最低也能跑到20 tokens/s。用vllm方案可以跑到50+。

    玩大模型还是别用windows了

    AI硬件 nvidia 多卡部署

  • Pro 6000都是怎么玩?
    Ray WangR Ray Wang

    @王一民 说:

    PRO 6000如果只聊单线程prefill和decode性能,只是和5090相当。
    PRO 6000的优势主要在于ECC认证的显存、官方静音涡轮卡(MAX-Q版本)以及多出来的64GB显存。

    所以公式很简单,如果你认为64GB ECC认证显存的价值>40000人民币,或者你想玩静音阵列(比如MAX-Q * 3)跑deepseek v4 flash,你就可以买。
    否则就不买。

    这里有几个原因。
    1、96GB显存,其实跑不下大的Moe模型。122B的Q5量化就爆了。
    2、对于小模型,96GB显存又过于overkill。
    3、多个模型服务跑在一张显卡上,目前没有一个最佳实践做资源隔离。会降低效率。(因为你一定是用Agent来驱动LLM,所以必然是多个模型同时运行)。

    谢谢,所以我的第一感觉应该是没错的,6000确实很屌,但是我目前可能用不太到。真正需要的时候再换好了。

    AI硬件 rtxpro6000

  • Pro 6000都是怎么玩?
    Ray WangR Ray Wang

    哈哈哈,算上小特基本2:2了。也是公说公有理婆说婆有理。小马过河只能自己去试了😂

    AI硬件 rtxpro6000

  • Pro 6000都是怎么玩?
    Ray WangR Ray Wang

    最近想更新一下我的配置,平时用Openclaw帮我做调研,写码,也用comfyui跑图。我算了一下,咬咬牙其实可以上一张Pro 6000。

    但Pro 6000在我眼里就是皇帝的金锄头

    我手里已经有一块3090了,如果再加一块3090,我就可以比较舒服的跑Qwen3.6 27b了,甚至还能并行。如果我需要做图,我还可以再加一张3090,单独用来跑comfyui,跟另外两张3090协同。

    但是如果只装一块Pro 6000的话,虽然好像可以把两种模型都装进显存,但是似乎却不能协同作业?也就是说虽然我可以并行很多大模型,但是却不能同时作图?

    当然了,一张Pro 6000的耗电低得多,但我还是觉得我目前的工作吃不满96gb显存。我这种情况是不是买两张魔改4090更合适?

    AI硬件 rtxpro6000
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组