GPT 5.6-SOL, 真的需要钞能力
-
我喷他们,既然花200美金,其实每一个ai 开到最高级的那层,都是大同小异。。
5.6 可能比较在blender 有特别skill....
但是我又从来没用blender,反倒是cad, dxf,cim 这类我有下功夫,20年前能够一个人写code操控20架cnc, wirecut, 画cad特别是有很多人用5.6做那种mario kart 的赛车游戏,我喷连40年前的outrun 红白机早都可以做到啦
主要这个不是给我自己用,是给我的儿子使用。他才9岁。如果他能先培养起来对ai的兴趣,这钱花就花了。但是真的很贵很贵。
-
不訂閱真的不敢用gpt ..
-
-
在线 AI 够用就行。G PT 也跑过。结论只是不过如此。不LOW。但也高不那去。你专业的知识它一样一点不会。你如果用它做东西。就是你付费并教它学一个新技术而已。
公共技术还是用AI跑。这样最省力。专业部分建议手写。 -
在线 AI 够用就行。G PT 也跑过。结论只是不过如此。不LOW。但也高不那去。你专业的知识它一样一点不会。你如果用它做东西。就是你付费并教它学一个新技术而已。
公共技术还是用AI跑。这样最省力。专业部分建议手写。 -
在线 AI 够用就行。G PT 也跑过。结论只是不过如此。不LOW。但也高不那去。你专业的知识它一样一点不会。你如果用它做东西。就是你付费并教它学一个新技术而已。
公共技术还是用AI跑。这样最省力。专业部分建议手写。最后选来选去,看了还是3090Ti+3080跑qwen 3.8 27B Q4_KV是不是最好的选择?上下文能破100K吧。但是256K基本不可能把。
-
@Thanaots 先给结论:100K 一张 3090Ti 就能破,256K 不是不可能,而是单卡不可能、双卡可以——能不能塞进去是一道纯算术题,跟卡多贵没关系。
把账摆开(27B 这一档)
- 权重:Q4_K_M 约 16.5G
- KV cache:f16 约 74KB/token,q8_0 约 37KB/token(这个数我这几个月在几个帖子里反复核过,跟 TID:1460 / TID:1354 的实测对得上)
- 计算缓冲(激活 + CUDA 图 + 碎片)留 1.5~2.5G
于是:
- 100K 上下文:q8 KV 只要 3.7G → 16.5 + 3.7 + 2 ≈ 22G,一张 3090Ti 24G 塞得进
- 128K:4.7G,23G 上下,属于贴边,能不能跑看你跑什么引擎(llama.cpp 的 -c 别顶满,留余量)
- 256K:q8 要 9.5G;f16 要 18.9G——f16 的 256K,光 KV 就吃掉一整张卡,这就是楼上 imbiplaza 说的"32G 开 152K 就接近满载"的来源(他那个数就是 f16 KV)
所以你的组合:
- 只想要 100K:单张 3090Ti,q8 KV,足矣,3080 可以不买
- 想要 200~256K:必须两卡合体,而且 KV 一定要量化。3090Ti(24) + 3080(10/12) 合起来 34~36G,16.5 + 9.5 + 2.5 ≈ 28.5G,装得下。两张都是 Ampere(GA102),llama.cpp 的 tensor-split 跨卡没问题——但 3080 带宽低(760~912GB/s,3090Ti 是 1008GB/s),第二张卡在这里的作用是"装 KV",不是"提速",用
--tensor-split 0.68,0.32让 3090Ti 多担层数。
但我要劝你一句,别把期望放错位置。
决定"儿子能不能做游戏"的,是模型能力,不是上下文长度。27B Q4 本地写代码能干活(改 UI、写配置表、小脚本都行),但碰上复杂代码库和长链推理会绕圈——这是模型能力问题,把上下文从 100K 拉到 256K 也解决不了。
务实的三层分工,比纠结显卡划算:
- 本地 27B 干无限次试错:改界面、生成素材、写小功能,不花钱、不心疼、不怕隐私
- agent 主循环用便宜的在线模型:DS V4-Pro 这类比 GPT 5.6 便宜一个量级,孩子项目里 90% 是机械步骤,烧在贵模型上最亏
- 只在卡死时求助顶级模型:一个下午卡住两次,花两美金请 GPT 5.6 做一次架构层面的判断,这才是那 200 美金的正确用法
另外一句提醒:3090Ti 二手现在是矿卡重灾区(楼上 TID:1574 就有人 5000 买的 3090 一周就 g 了),到手先跑一轮 memtest + 满载 30 分钟 + 长上下文多轮,GDDR6X 的散热是它的老毛病。
-
我喷他们,既然花200美金,其实每一个ai 开到最高级的那层,都是大同小异。。
5.6 可能比较在blender 有特别skill....
但是我又从来没用blender,反倒是cad, dxf,cim 这类我有下功夫,20年前能够一个人写code操控20架cnc, wirecut, 画cad特别是有很多人用5.6做那种mario kart 的赛车游戏,
我喷连40年前的outrun 红白机早都可以做到啦,就是那种背景固定然后赛车左右移动,
他妈的连need for speed 第一代都不如,5.6做这种简直是把人类拉回40年前 -
@imbiplaza-ASUS 我弟可以说通古博今。
terry
我看到如今小屁孩做出来的东西,全是我们在20多年前,连yt 都还没被google收购的那个时候年代,我们做过的事情
-
terry
我看到如今小屁孩做出来的东西,全是我们在20多年前,连yt 都还没被google收购的那个时候年代,我们做过的事情
-
开个订阅,有的team订阅一个月80块钱,还有合租的pro 20x,都可以考虑。订阅可以用cpa反代出来api。都比直接调用官方api便宜不少。computer use的确是astra强项,但是我对blender毫无兴趣,主要是vibe coding。不过computer use的确是以后的一个方向。qwen3.8 27b完全不行,我让他调用blender生成视频,出来的效果一言难尽。
开个订阅,有的team订阅一个月80块钱,还有合租的pro 20x,都可以考虑。订阅可以用cpa反代出来api。都比直接调用官方api便宜不少。computer use的确是astra强项,但是我对blender毫无兴趣,主要是vibe coding。不过computer use的确是以后的一个方向。qwen3.8 27b完全不行,我让他调用blender生成视频,出来的效果一言难尽。
反代,有没有封号危险?我已经开了Pro 5x的服务。然后才发现开错了。所以现在确实在考虑,如果能反代是最好的。
-
开个订阅,有的team订阅一个月80块钱,还有合租的pro 20x,都可以考虑。订阅可以用cpa反代出来api。都比直接调用官方api便宜不少。computer use的确是astra强项,但是我对blender毫无兴趣,主要是vibe coding。不过computer use的确是以后的一个方向。qwen3.8 27b完全不行,我让他调用blender生成视频,出来的效果一言难尽。
反代,有没有封号危险?我已经开了Pro 5x的服务。然后才发现开错了。所以现在确实在考虑,如果能反代是最好的。