Qwen3.8 27b Q4KM + Llama.cpp/Vulkan + 7900XTX 本地AI性价比之王,MTP吐字快,Vulkan Prefill效率提升,N卡也能玩Vulkan!
-
首先,修正一下昨天视频中的一些错误。比如我说7900 XTX 5000块钱,这张卡其实已经涨了2000块钱,涨到7000了,这个情况我没有注意到,上个月还是5000块钱。3090其实也涨了不少,现在都涨到9000以上了,甚至有的卡要1万多块钱。
我之前给大家推荐的卡,都是我自己要么在用,要么是论坛有人在用,他们跑过了,有真实的测试数据在论坛里。这些数据都是比较信得过的人发布的,因为大家在长期的发帖交流过程中,都知道对方是什么样的人,人家也有真实的照片,有真实的截图,我才去推荐这样的卡。
那么我没有推荐的卡,或者说我在视频中比较容易嘲讽的卡,就很多人问我什么V100到底行不行,然后什么MI210怎么样。我说这些卡是工业垃圾,并不是说它们在所有情况下都不能用,而是说对于我频道的绝大部分观众来说,你这些卡买了之后,它就是这也不行,那也不行。
你看V100 32G,前一阵子过年的时候要5000块钱,现在它还能卖到5000吗?我看闲鱼上面3000多块钱卖的多的是。这张卡如果真的那么好,为什么现在这么多硬件在涨价,它反而在跌价呢?

另外就是要修正一下,llama.cpp最近的强势崛起,并不是因为DeepSeek Harness带来的。DeepSeek Harness确实要比其他的Agent,比如Hermes、OpenClaw要敏捷得多,效率也要高得多,但是它基本上跟Codex是处于同一个水平的。Codex可能比它还要再成熟一点,但是效率方面,我觉得DeepSeek Harness目前还是排第一。
但是llama.cpp的崛起,最主要的是因为Vulkan加上MTP。这一波补丁打上去的同时,Vulkan的管理团队把它以前显卡管线、渲染管线这个旧病给修复好了。之前它有一个计算指令,就要去内存跟显存交换数据,单个请求在CPU跟显卡之间疯狂地高频交换,消耗了大量的资源,这样效率肯定是非常低的。
尤其是在你有大量长上下文、提示词非常夸张的情况下,你一次性给它输入,直接会导致它的prefill卡死,速度相当慢。但是Vulkan最近好像是更新了驱动,把它从单次请求改为批量一起打包、一起请求、一起交换,那么这样的效率就要高得多。
这也就是为什么最近使用Vulkan驱动的llama.cpp,在预填充上面速度快了很多。让你感觉是不是这个显卡KV缓存做得更好了,或者说调度效率提高了,其实就是预填充这一块有了革命性的变化。
另外,就是关于Qwen3.8 27B,它的能力究竟怎么样。我必须说,你说它去取代DeepSeek V4 Flash、取代DeepSeek V4 Pro,这个纯粹属于扯淡,这不可能。这个模型的尺寸就在那里。
就像我在开发中经常举的一些展示例子,包括这个八卦图,它没有一次能画对。为什么?因为它这一块的知识权重有问题。从3.5开始就有,3.6没更新,3.8这一块也没更新,因为它属于比较偏僻的知识。
但是我们知道,我们开发APP,它不仅仅是考验模型的编程能力。就是在编程能力方面,我承认Qwen3.8 27B确实是非常牛逼的,它的能力经过我实际的编程测试,是没有问题的,绝对属于顶级的、第一流的。

但是你做长链任务、做长链推理,包括做APP,还是做剪辑器这样复杂工程开发的时候,它有很多知识并不是编程知识。你这个模型的尺寸就这么大,你怎么可能会比300B、比1.6T参数的模型更智能呢?你如果真能这样做到,那阿里巴巴还需要开发超过27B的模型吗?它全部重仓压这个27B稠密模型不就行了吗?这些都是常识问题,我觉得没有必要去争论。
但是对于我们现在来说,Qwen3.8 27B有一个比较好的应用方式,就是它能够取代我们大部分的日常编程工作。比如说我们使用DeepSeek V4 Pro,把这个APP的框架设计好,功能模块划分好,这种方式我们只需要通过口述跟它交流就行了。DeepSeek V4 Pro是可以把它处理好的,无论是通过DeepSeek Harness,还是通过Codex来对接都可以,把它设计得非常好。
设计好了之后,具体的功能,比如说你顶帖中遇到一些Bug,或者登录之后信息展示得不对,或者说你要单纯地开发一个登录功能,像这样的功能,Qwen3.8 27B是可以非常好地完成的。
而且就算是设计程序本身,只要你不是给它输入一大段比较繁杂、说得又不专业的指令,你可以先把设计文档、设计思想拿去跟ChatGPT网页版聊天。尽量不要选择什么入门的,像GPT-5.6 Luna,你就选择5.6 Sol,或者跟在线的DeepSeek聊天,把这个文档设计好,然后把它丢给Qwen3.8 27B,它也是能够搞好的。

就是编程能力,我以前认为它可能只能完成80%的日常工作,但是经过我这两天的测试,我基本上可以判断,它能够完成85%,甚至完成90%的开发工作。你可能只有10%的工作是需要用到在线API。
至于日常的指令执行,它确实没有V4 Flash那么智能,但是也是可以做到的,这个就要看你对于精度的要求了。它有的时候会犯一些很傻逼的错误,但是这种情况比较少,我认为风险是可控的。就是说,如果用它来驱动Hermes、Codex或者DeepSeek Harness,帮你做一些日常的运维工作,它也是完全胜任的。
在这种情况下,我们别忘了它还是一个多模态模型。它的多模态响应确实TM的有时候让人着急,但是它是原生多模态,这个是它比DeepSeek比较明显的优势。
另外就是关于N卡。N卡在使用CUDA驱动的时候,它的MTP接收率是不高的,导致它跑llama.cpp效果不好。但是N卡有SGLang生态,如果说你是大显存的N卡,那么你跑SGLang,把CUDA Graph设置好,它的效率是非常高的,这个体验还是非常棒的。
但是如果你就是想跑llama.cpp,因为你的显存不够,比如说你是3090 24G,那你去跑SGLang,不是找罪受吗?你最起码得双卡,还得买一个好一点的主板。在这种情况下,你去跑Vulkan版本驱动的llama.cpp就可以。

因为Vulkan不仅仅对于AMD显卡能跑,你用英伟达显卡它也能跑,而且跑起来的效率我已经测试过了,还是非常不错的。也就是说,llama.cpp由于Vulkan驱动,它咸鱼翻身了。最起码我们不用消耗大量的资源,用很高的门槛去跑SGLang。
再加上Qwen3.8 27B稠密模型这个神级模型的存在,我们现在就没有必要被在线模型涨价所困扰了,因为我们绝大部分工作都可以在本地完成。这个我已经实测过了,我后面会做专门的教程视频,就是小头像,然后把屏幕录下来的那种视频,给大家看一看它实际工作的效果。
不过我还是那句话,一分钱一分货。我们用Qwen3.8开发的时候确实是慢的,但是你一边聊天,一边看电影,或者一边玩游戏,一边等它出结果,我认为这个是完全可以接受的。
还有,最后我再提一下,大家不要在视频下方反复发消息劝我好好休息,甚至要多喝开水之类的。哎呦,我是个中年老男人,知道吗?都不是什么小伙子,更不是你们的梦中情人,我也不跟你们搞基。要生活怎么安排,我这点生活自理的能力还是有的。
我没有像你们想象的那样一天到晚去加班。说实话,我这几天更新视频多了,并不是因为我要疯狂地推进我这个频道的发展,单纯只是因为我这几天搞开发,我没有精力去做英语视频。然后做中文视频的门槛很低,成本很低,我就打开摄像头,对着摄像头一顿逼逼,连稿子都不用写,这视频就搞完了。
不需要像英语视频一样去构思、写稿子,然后去校验语法、生成语音、配图,做完之后我还得去看它的效果,发布了之后我还得去维护评论,就没这些事情。所以说我就多发一点中文频道,这个纯粹就是节奏的问题、取舍的问题。
然后就是我的黑眼圈比较重。哎呀,我到油管上来是赚钱的,说实话是为了柴米油盐奔波的,不是为了来跟大家装逼、炫富的。如果真那么关心我,我这个频道有打赏的功能,10美金、20美金,那刷的人多了去了,最多的有刷100美金的,是不是来者不拒?咱就是为了钱,不寒碜。
另外,我们别太把自己当回事。我一直对我频道的观众说,咱既然已经穷了,咱就要像穷人一样去活着,不要端着架子。你说咱有钱的时候,说不好听的,在KTV一个晚上花个几万块钱,那还叫事情吗?好汉不提当年勇,现在咱为了一张几万块钱的显卡,就能犹豫十天半个月才敢去买,甚至为了几百块钱的API调用费用,去学什么部署本地Qwen3.8 27B。
就像以前那种经济水平,这不纯粹是浪费生命吗?你一帆风顺的时候、风风光光的时候,有那种活法,咱能活、能生存、能装逼,机会来了咱当仁不让。但是咱穷的时候,也没什么压力,也一样能够开心地活着。赚点钱维持一下生活,存点款、还还债,搞不好一年两年债务就清了。之后咱的事业说不定又会,不能说重回巅峰,起码能让自己过上一个相对体面的生活,那不就够了吗?
生活就这么点事,你说还要什么自行车?这样不挺好的吗?
我经常在视频中跟大家引用一些诗句,今天我就给大家聊一聊我喜欢的两个大诗人,相信在中国也都是家喻户晓的,李白、杜甫,一个诗仙,一个诗圣。你说你们是想像杜甫一样活着,还是像李白一样活着?
杜甫一辈子忧国忧民,你从他的诗句中看出无限的悲伤。“感时花溅泪,恨别鸟惊心。”“床头屋漏无干处,雨脚如麻未断绝。”“艰难苦恨繁霜鬓,潦倒新停浊酒杯。”这一辈子就没什么开心的时候。
偶尔小酌一下,“肯与邻翁相对饮,隔篱呼取尽馀杯。”说不好听的,可能连个下酒菜都没有。杜甫不是没有人包养的,有大腿的。他去成都也当了一阵子官,也是投靠了当地一些有权有势的人,只不过后来这个人死了,好像是。因为我现在有点老年痴呆了,很多故事记不清楚具体的人物和事了,但是这个事情应该是有的,就是曾经也是抱过大腿的,在成都好像是帮他盖的草堂。
那你已经是这个D样了,说不好听的就是逃难了、避乱了,那你就下田劳动耕作呀。诗句中怎么写的?“黄四娘家花满蹊,千朵万朵压枝低。”人家能花满蹊,你也生活在那附近,你就不能把自己的房子弄得好一点吗?
你干嘛要住在这个茅屋里面呢?写什么《茅屋为秋风所破歌》。人家的茅屋能够修得遮风挡雨,你的茅屋为什么就漏呢?还什么“安得广厦千万间,大庇天下寒士俱欢颜”。你不要想解放全世界,解放全世界是你解放自己之后的事情。

我们中国人怎么说?修身齐家,治国平天下。你得先修身齐家。生活有诗和远方,但是大部分都是苟且。既然咱已经到了追求柴米油盐的时候,咱就不装逼。还TM天天休息好,还在乎黑眼圈。我要有吴彦祖的长相,我还会做这个科技频道吗?说不好听的,麻豆视频里的主角搞不好就由我出演。
我们再看看李白是怎么活的。李白一辈子也是不如意,但是人家就是到处游山玩水,经营粉丝。“赠汪伦,桃花潭水深千尺,不及汪伦送我情。”汪伦不仅送了他人情,也送了他盘缠,招待了他十天半个月,吃好喝好了。
你看人家李白的生活,“兰陵美酒郁金香,玉碗盛来琥珀光。但使主人能醉客,不知何处是他乡。”就不要总多愁善感,有些乡愁是可以的,不妨碍你去品尝美酒。
生活不如意的时候,“花间一壶酒,独酌无相亲。举杯邀明月,对影成三人。”跟明月、跟自己的影子,咱也能来几杯。顺遂的时候,咱可以写一些豪言壮语,“天生我材必有用,千金散尽还复来。”“俱怀逸兴壮思飞,欲上青天揽明月。”

但是不如意的时候,你要看得开。“抽刀断水水更流,举杯销愁愁更愁。人生在世不称意,明朝散发弄扁舟。”跟自己较劲干什么呢?是不是?有这个功夫,多写几个程序,多做几个视频,那钱不就来了吗?那10美金、5美金,那也是钱呀,苍蝇也是肉,积少成多。
我说实话,我的生活是比大多数人都好的。我是自己不如意,自己破产了,但是我的家庭条件相对而言是比较好的。就我们家,我是不用为衣食住行犯愁的,包括我的儿子也不用我去养活。像我开的车、我用的电脑,大部分东西都是我姐我妹买的。就我一分钱都不赚,我家人也能把我照顾好。
可是咱身为一个男人,总得有点担当。可以在家里面休息个一年两年,沉沦个一年两年,那你总得出来做事。总不可能说,老子过去做大生意的,咱是挣大钱的,现在为了一个视频百八十块钱、两百块钱、五十块钱,咱就抛头露面的,拉不下面子。
你有什么拉不下面子的?都是爷们,咱就面对生活的艰辛,都不容易。就不要多愁善感,也不用太过关心我。我又不是宇宙的中心,我也更不是你们的情人,更没有跟你们有捡肥皂的共同爱好。好吧,都把自己管好就行了。
-
才几天 3.8 27B 就折腾的这么好了 逛这个论坛收益满满