NVFP4号称不是无损,但损失小到感知不到,几乎等同于FP16,这可比Q4强不少。
comeN
-
买了2张5060Ti,谁能跑最便宜的Qwen 27B? -
3080 20G*2的有没有,来交流啊兄弟们速度差距有时候不是硬件差距是模型不同,我原版的27B-Q4KM能跑62,同样的27B-Q4KM另一个就只能跑57,配置和MTP都一样.
-
小白想上4090 48G 生图\视频 配什么主板套最省钱省心LTX2.3能生成什么样的视频,是否能达到你要的效果,你最好用现有显卡试试。LTX2.3做做动漫和单场景视频还行,其他场景你需要自己试试才行。
-
新手不要碰DGX Spark(重要事情说三遍)不知道RTX Spark会如何,这种arm架构的不能自己改系统?
-
买了2张5060Ti,谁能跑最便宜的Qwen 27B?双5060TI 16G跑英伟达专门为50显卡优化的Qwen3.6-27B-NVFP4-MTP的表现比双3080-20G还好,NVFP4的优化号称无损Q4,速度40-70T,论坛里面有人发的。
-
3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑一般200K就够用,超过200K的大任务你最好交给DeepSeek-v4-flash的API解决问题。
-
一个AI编程白,请求指点。下个WorkBuddy用免费的积分跑DeepSeek-v4的两种模型,不够加个自定义的DeepSeek-v4-flash的api,啥问题直接丢给他。
-
廉頗老矣,尚能飯否? 測試tesla V100 32Gx2 部署Qwen 3.6 27B Q8模型V100的16G版便宜,32G可不便宜,32G的性价比就不如双卡3080-20G,要输顺序加载1张32G和1张16G的能跑起来Q4KM的就更有价值.
-
怎么看Nvidia最新发布的RTX Spark?会是电商、视频利器吗?看起来挺玄乎,还得看出来以后价格合理不,这算力放在笔记本上还要看真要是部署能跑出多少速度。
-
3080 20g 千问 3.6 27bq4 k m llama 跑Hermes配置 实在搞不定 折腾2天了下载Trae CN和WorkBuddy,全让这俩弄,让他们直接给你写启动的bat,要优化或者改什么东西直接让他们干,弹警告直接复制粘贴过去,Trae CN是默认模型,WorkBuddy用DeepSeek-V4的flash和pro模型,遇到那些优化配置搞不懂直接把网址给这俩让他们帮你配置,不满意就让他们仔细读网址,从来,没有解决不了的问题!
-
「疑问」这样子的温度不会有问题吗?正常GPU80多度,显存90多度,跑大模型中间会有间隙不会一直高温
-
山寨X99主板,32G DDR3内存,两张5060TI 16G llama.cpp Qwen3.6 27B NVFP4版 40-70T/S 现在够用未来会更好。50系列能用NVFP是厉害啊!表现比双3080-20G还好
-
3080 20G*2的有没有,来交流啊兄弟们@rock-shi 我后来把MTP改成2跟你这个速度差不多,才发现MTP不是越高越好
-
RTX3080 20g,qwen3.6 27B 60-40T/S 本地爽玩配置单卡3080-20G就这速度?我双卡3080开MTP=3输出代码时候才47Token/s
-
3080 20G*2的有没有,来交流啊兄弟们我也是双卡3080 20G跑qwen3.6 27b在llama能跑32T,MTP=3能写代码能达到47T
-
小白求助:2*2080Ti 22G还是2*3080 20G3080 20G双卡非涡轮的声音还是比涡轮的小,我现有用的就是一直3卡槽和2卡槽的3080-20G。我也挖过矿留下的那张矿卡用到现在也没坏,跑大模型对显卡负担比挖矿小不用一直跑。
-
大佬们你 这3090 这成色能入吗? 5500矿卡看运气,挖矿的时候是超频显存降频GPU,外表根本不影响运气好坏!