@terry 我感觉能力上不比PRO差还要小胜一点,个人觉得比FLASH要强上一点的,在5.2基础上做了后训练肯定还是有提升的。
我在开发一个魔兽世界插件,游戏内外数据联动,游戏内脚本循环搓一些专业物品,然后采购出售,然后有一个局域网多机管理系统;相当于我一个人控制整个地精挂机系统,基本上是往全自动的方向上开发;

@terry 我感觉能力上不比PRO差还要小胜一点,个人觉得比FLASH要强上一点的,在5.2基础上做了后训练肯定还是有提升的。
我在开发一个魔兽世界插件,游戏内外数据联动,游戏内脚本循环搓一些专业物品,然后采购出售,然后有一个局域网多机管理系统;相当于我一个人控制整个地精挂机系统,基本上是往全自动的方向上开发;

首先第一点,个人觉得GLM的编程能力比PRO要强一点,所以相同价格情况下肯定是GLM更好一点;
然后是价格对比,GLM我订阅的400多那个档次,连续包月大概是430块的样子,我就取整为450元!而且V4 PRO以最低价来计算!
然后我们以450元的这个价格来计算两者的tokens额度差异;
我以全缓存命中来计算的话V4 PRO的额度算下来约为3000M的用量,实际上应该是不会超过这个的因为缓存命中肯定不可能100%;
然后是GLM这边,他采用的积分那种计费模式,我正常的编程缓存率如图大概就是97%以上,然后用用图里面数据算下来每周大概是622M的样子,然后就可以大致推算出月额度在622M/7*30=2669M的样子!
然后说一下实际情况V4 PRO未命中算4.5元,是缓存命中价格的30倍;GLM这边未命中的倍数大概只有4倍,输出的倍数都差不太多,因为输出一般占比比较小,所以也就不做比较了!
总结下来就是:
V4 PRO在同等情况以最低价格来计算额度其实可能和GLM 5.3差不多的!
如果考虑到还有高峰期的情况,V4 PRO完全不占据优势了,V4 PRO每天高峰7个小时还不区分周末,GLM则是每天4个小时算作高峰,周末还不算高峰!
最终的个人结论就是:GLM在提供更强能力情况下是非常值得选择的,如果是高峰时期都必须用到的那GLM优势更大!



主要是他这个强行压缩成 800×800 以内的图太伤了,很多细致活干不了,只是要能达到4K分辨率才算完美;QWEN 3.8 27B设置识别分辨率之后在识别大图上面配合OCR的校正基本上不会出什么问题了;
典型应用场景就是我需要把EXCEL手机照片转化成表格,这个V4 Flash在压缩之后应该就识别不清楚了;
@stxpnet 因为涨价了
成本暴涨5倍以上,算下来我还不如用GLM 5.3,已经转投阵营!算上闲时价格也不见得比pro高,GLM每天就4个小时高峰,非高峰额度消耗50%!


@stxpnet 不是说开了思考Xhigh比较容易陷入死循环吗?我看他们的截图有超过6%可能性;
@kos-or V4 FLASH MAX这么强的吗?和PRO基本上就差不多了;
Qwen3.8 27B估计就是输在长链任务上
@terry 有两个渠道,一个是移动自建的,一个是火山的,我主要就是担心模型能力不如官方;渠道上游提供商没问题,只是可能有中间商赚差价,不过最终只要能够给出有竞争力的价格就行;
@terry 这方面我就不专业了,最近有人跟我对接火山方舟的DeepSeek API资源,能够拿到折扣价;他这种抖音下面自建的和官方的模型能力是不是一样的呢?还是说在什么地方存在性能差距?
感觉还是上下文长度限制了本地模型的能力;压缩几次就记不住前面的了。
那有可能是codex开发的问题,之前都是用的OPENCODE,刚好今天涨价换了codex,我还要继续研究一下
如果没有找到原因的话,这要是一天放开了跑得跑到1000元消费了
今天涨价之后不知道为何账单起飞,请问大家存在这个情况没有?
今天我开始使用CODEX进行魔兽世界插件开发,用官方脚本对接的CODEX,刚开始用的pro模型发现缓存命中暴降觉得会不会是配置大问题,切到FLASH还是很低的缓存命中率,想问一下大家用CODEX是不是也有这个情况?还是说有什么我没发现的配置导致的这种情况;
之前我用OPENCODE开发的时候没有发现命中率这么低的情况,基本上都是保持在98%以上,不知道为何今天价格上去了缓存命中又降了,这是双向提价啊!




我倒是对这个价格比较感兴趣,我有同学在大学有这类AI实验室,看看能不能淘到一些设备
他这个应该是多镜头分别生成的吧,如果能够单镜头40秒的话那就牛逼了
等几天各个大佬都优化的差不多了,我去研究无限时长的版本
@laobenxiong 本来还纠结GLM-5.2抢不到,现在完全不想抢!
今天起来写东西,时不时就出现
The model provider failed after retries. I kept raw provider details out of chat; check gateway logs for diagnostics.
你们有这种情况发生吗?

FLASH版本更新之后进行了两天较高强度的工作,感觉模型能力提升非常大。
第一天我把主力Hermes的全部技能进行了修正优化,把Hermes的智力提升了一个档次,当然智力的提升和FLASH能力的提升也有很大关系,主要是对技能重构,精练语言,查漏补缺等操作,降低后续Hermes使用过程中的token消耗;
第二天我是基于QWEN TTS的一个版本进行了系统化的升级,根据我自己的使用方案进行了详细调整,最后文本转语音效果达到我的预期;
整体使用下来FLASH最大的进步就是知道自己该干什么了,不像以前你要一步一步的进行指导,思考能力上了一个大的台阶,而且还能主动进行周边的信息参考和探索保证不会出现意外的BUG。
如果为了项目的准确性和严谨性在低价的基础上多消耗token是值得的;一下午用15元就我个人感觉来说是正常费用,我一天造卫星也是要用30多元。我是每一步结果都会让Hermes和子代理复核多遍保证结果的可用性,出来的代码BUG非常少,及时出现了也能很快修正好。flash比之前预览版好太多了。
工业时代体力劳动被替代的就是简单重复大规模的劳动,剩下的是必须要人力参与的复杂场景劳动,比如修理这类;
AI时代脑力劳动被替代的不止是简单重复的劳动了,连精细化的脑力劳动也被替代了,甚至部分原本工业时代不能被替代的体力劳动在AI的支持下也被部分替代;
我在想10年之后还会有什么工作算是好工作呢?还请大家集思广益