跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

lukun geL

lukun ge

@lukun ge
取消关注 关注
关于
帖子
9
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 请教一个加配显卡配置的问题.
    lukun geL lukun ge

    @terry 怀着无比激动的心情,观看了坛主的视频大作,借住坛主的影响力,人生首次登上了世界主流媒体平台,文章谈论的话题中有个别字眼也让众多技术男产生了颅内高潮.
    言归正传,坛主视频中提到双3080配置,我已经开始采购了,x99主板加双3080,总造价大概11000元,能够达到256k的上下文,足以支持一个2到3个人研发团队进行对数据安全有要求的编程工作.
    对于双卡配置,我还是有些想法,可以做进一步的交流和确认:
    1.目前H3这种视频工作流已经走上主流,趋势上对显存的占用会越来越大,需要考虑整体硬件配置的升级路线.
    2.对于H3 comfyui的工作流,全部模型套件由多个子模型构成,这些模型其实不需要放到同一张卡上,比如占用最大的H3 DiT 和Qwen 3L,可以分到两张卡上,其中H3 DIT有两个模块,也可以分到两张卡上.当两张卡的显存总数足够放下全部H3 套件的时候,comfyui的工作流可以不设置成lowram模式,这样就可以降低对于系统内存的要求.
    总结起来,双卡配置可能要分三个阶段,起步阶段,单纯考虑H3模型的comfyui配置,48+20/24的显存配置,可以实现整体H3模型全部载入,无需启用lowram模式; 第二阶段,更大的模型出现的时候,比如即将推出的flux3,也许就需要考虑48+32的双显卡配置,或者进入到第三阶段的48+48双显卡配置.双48配置,还是要比pro6000便宜很多,对于效率要求不高的用户,还是一个更好的选择.
    我有3点还是心存疑问:
    1.为什么3090会被炒的这么高,6月我搞了一个3090,只要6k,现在需要7k到9k,为什么大家不选购7900xtx?
    2.R9700的价格似乎一直都比较稳定,这个性价比当前看还比较高的显卡,为什么没有像3090一样涨价?
    3.双R9700和单4090 48G的价格在一个数量级,为什么选择双R9700的少?双R9700的性价比,无论是跑LLM还是comfyui,在延展性上都有优势,就是速度低点.

    AI硬件

  • 请教一个加配显卡配置的问题.
    lukun geL lukun ge

    @terry 你说的使用comfyui,内存占用的问题,我已经遇到了,内存占用最多可以达到62G,工作流配置不合理的时候还会出现内存溢出的问题。应该是H3的全部组件都在内存里常驻,有一点我目前还没搞清楚,当48g显存可以把H3全部的35G模型文件完全载入,理论上内存不应该到62G,只有一种可能是FL2VA 或 Ref2VA这两个基础版本,在不同的工作流中会被交替调用的场景下,才需要提前放到内存里做好准备。

    AI硬件

  • 请教一个加配显卡配置的问题.
    lukun geL lukun ge

    背景:
    服务器有一个4090 48G,64G内存,主板有2个pcie 5*16的插槽,需求为再买一张显卡,解决qwen 27b越狱模型和comfyui同时运行的需求,有需要写视频剧本的需求,有编程的需求,hermes日常事物的需求;

    选择有三个:
    1.3080 20G,缺点:qwen 27b 在sglang环境下,上下文太小;价格3500元左右;从实际应用的场景,我判断应该可以pass 3080,20g的显存缺乏上下文的支持,模型串行部署在两个显卡上之后,token输出的速度应该过慢.
    2.7900xtx 24g,qwen27b模型能运行,上下文可以到64k,还是感觉刚刚及格线;价格:5500元;,比3090的性价比要高,近期3090的价格本着9000的区间在前进,但是24g显存还是过于鸡肋,或者有实际应用的朋友可以分享一下,24g显存在我的需求场景上也是够的.
    3.R9700 32G,qwen 27模型应该可以得到128左右的上下文.价格11000左右,京东自营.R9700 32G,无疑可以满足现有要求,除了贵5500,显卡带宽没有7900高,其他都挺好.

    问题:
    1.从实际应用的场景,风向一下经验,这a卡和n卡同时在一起的时候,是否存在ubuntu下的兼容性问题;我的查询结果是不会,还是做一下真实应用的确认.
    2.从实际应用者的角度,分享一下大家如何兼顾本地模型和comfyui工作流同时在线的需求,是否这是一个伪需求,或者是一个低频的需求,其实没必要配两张卡.

    AI硬件

  • DeepSeek V4 Flash爆火,调用量破纪录,但是梁文锋谈话泄露华为芯片短期内供货不足,V5训练还得仰仗英伟达算力集群,会被CUDA生态锁死吗?
    lukun geL lukun ge

    在deepseek R1出现的时候,资本市场就对这场竞争给了结论性的回应,大模型的护城河并不高,美国的公司无法一枝独秀。当然这个护城河“不高”是有前提的,就是玩家得能够入围所谓的“斩杀线”,人才,电力,芯片都得具备,才有当玩家的资格。
    国内的模型能力能跟住第一梯队,离不开自己的电力和人才储备,还有一个重要因素来自对美国模型的蒸馏。所有模型的训练,都需要有高质量的数据,数据清洗的过程普遍依赖人工标注的,特别是科学类的论文,而蒸馏是获得高质量标注数据的捷径。换句话讲,国内模型的进步很大程度上被美国模型拉着进步的。
    未来芯片问题终究会被解决,决定竞争胜负终究会是性价比,openai和anthropic都不是未来国内玩家的主要对手,毕竟在一个维度上竞争,全世界都不是国货的对手,这个在电动车领域已经体现的淋漓精致了。国内公司真正的对手来自spaceX,太空算力中心30万亿美金的故事才是最大的威胁,老马的愿望万一实现了,才是真正的“维度”竞争,这个方案的核心是占据特定的卫星轨道资源,这种特殊的轨道资源是有限的,先到先得,目前spaceX的单公斤发射成本还是国内的20分之一左右,有望拉到百分之一的差距数量级,这种差距不是2年能赶上来的,因此spaceX才是未来国内公司最大的竞争对手。

    随便聊聊 huawei deepseek nvidia

  • 关于ai 模型,我有话说,也是吐槽一下chatgpt 5.6 sol 吧!,重点是关于模型背答案这个事情。
    lukun geL lukun ge

    ai目前的架构完全不支持产生人类的意识,从物理层面,人类是先有意识,后有计算能力的,现在ai想通过计算能力来产生意识,本来就不符合物理规律。但是,ai即使没有产生意识,它也会让人类短期内大量失业,人类当前的社会分工,大部分是流程化和计算类似的工作,而不是意识类需要创新和思考的工作。这就给能驾驭ai的人,一个人干100个人的工作的能力。残酷现实是:ai并没有提升整个社会的生产力,它只提升了生产效率。因此就会出现新方向的就业机会前还看不到,老的就业岗位的饼的大小也没有发生变化,但人的需求量降低了,失业就是必然结果。
    失业的结果很大可能会催生游戏和娱乐产业的蓬勃发展,将来要为领着社会失业保障的失业群体打发时间创造条件。

    LLM讨论区 本地模型 gpt

  • SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署!
    lukun geL lukun ge

    @terry 我理解你的意思了。其实本质上radix机制省掉了prefill的时间,按照输出速率40t/s,vLLM每次都要3到5秒prefill,一下就会落后120token到200token,就算能让output速率到60t/s,也是需要6到10秒才能追平prefill阶段浪费的时间。更何况两个技术的token速率在优化后是基本相当的。真实应用中,模型解决一个问题,会频繁的发现问题,解决问题,就会频繁有input和output过程,每个input过程都是prefill的过程,利用缓存省掉prefiill时间,才是sglang的最大速度优势。

    AI Agent sg-lang qwen-27b hermes

  • SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署!
    lukun geL lukun ge

    @Xiaote 我发现4090的功率从450w降低到300w,频率从3100降低到2100后,token输出的速度几乎没有变化。帮我列出,sglang fp8的详细参数设置,以及评估kasimat AEON FP8-MTP这个模型的稳定性和优劣势。

    AI Agent sg-lang qwen-27b hermes

  • SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署!
    lukun geL lukun ge

    @terry 请问sglang下token输出能达到多少呀?我使用vLLM,Q4下,越狱模型shawnw3i/Huihui-Qwen3.6-27B-abliterated-AWQ-MTP,能否达到130t/s.但是确实风扇狂转是真的,我也是4090魔改的显卡。

    AI Agent sg-lang qwen-27b hermes

  • 基于RAG-WIKI 理论,我做了一套本地知识库,用于客服机器人.
    lukun geL lukun ge

    技术从来都不是护城河,common sense才是,所有的问题的根源都来自common sense不common

    Mark专区 rag
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组