<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[OxAlpha是GLM5.3？实测编程很强，强于Qwen 27B和DeepSeek V4 Flash，不如V4 Pro! 1M上下文翻车，召回准确率不够！]]></title><description><![CDATA[<p dir="auto">谈一下大家关注的 OxAlpha。大家都把这个模型叫做“牛”来，也是蹭热点了，确实有这个意思。Alpha 是即将发布的版本，Ox 是牛。我们知道著名的牛津大学叫 Oxford，它那个地方 Oxford，Ford 就是渡口的意思，这个牛津就是牛的渡口，可能是那个地方集中贩牛，还是运输牛？</p>
<p dir="auto">大家都说这个模型非常牛逼，普遍猜测是 GLM 5.3。由于之前我把小米的 MiMo 误认作 DeepSeek V4，所以我也就不装逼了，这次我们不瞎定论，就说大概率它是 GLM 5.3。大家说这个编程能力特别牛逼，一定要我测试一下。事实上我对 GLM 的尿性摸得比较准，你说这家模型不行吗？它的编程能力确实是不错的。但是你说它很牛逼吗？它比 DeepSeek V4 Pro 牛逼，我是打死都不信的。性价比那更不用说了，除非你在某些时间段买到了它的 Coding Plan，否则光 API 调用肯定是不能跟 DeepSeek 相比的。我就把结论先放在这里，那么我们带着这种主观偏见进入测试，看看能不能打脸。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/cc3da509-2eea-4219-bc35-5eedb7ee3582.jpeg" alt="OpenRouter AI 大模型排名2026-8-24" class=" img-fluid img-markdown" /></p>
<p dir="auto">从这个地方开始，就我开发这个 App 的会话，后期我就把它固定了，不切换会话了。我不管测试什么模型，无论是 DeepSeek V4 Pro，还是 GPT，还是千问 3.8-27B 的 Q4、Q5、FP8 版本，Q5 已经被我删了，没有必要了。它的驱动是 7900 XTX 还是 4090D 48G，它的框架是 llama.cpp 还是 SGLang，我都一视同仁。除了在这里，我还会在 DeepSeek Harness 或者 Hermes 上对它们进行比较详细的测试。</p>
<p dir="auto">但是今天比较可惜，OpenRouter 上面给我开放的免费额度，按理说应该每天有 1000 次调用，但是我只调用了很少的几个任务，它就不让我调用了。其实我前面为什么不想测试，就是因为我白天让它给我干了三个任务，它就罢工了。我就觉得这个模型没有必要去测试，知道吗？就非常烦。你要么就不要开放免费，你要开放免费，就把量给足了。你又免费立牌坊，吸引别人过来用你，然后执行了几个任务之后，我操，额度就超了。你这不是浪费别人的时间吗？你都不值得我花配置的这点时间。</p>
<p dir="auto">那么抛开这些主观偏见，它的能力如何呢？我个人感觉是在千问 3.8-27B、DeepSeek V4 Flash 之上，但是应该是不如 Pro 的，最起码它肯定不会比 Pro 强。那你说为什么在 DeepSeek V4 Flash 以上？就是当时它在实现一个功能的时候，App 里面有多处使用到同样的头像跳转功能，但是它们实现在不同的函数里面。它觉得应该把它封装到一起，然后在实现新功能的时候，就把这个问题统一了。这个东西如果你不跟千问去讲，不跟 V4 Flash 去讲的话，它是不会关心这些话题的，它就关心你当下的功能。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c08b6440-9858-4884-b74c-76ee6e1dfcdd.jpeg" alt="OxAlpha Codex开发界面" class=" img-fluid img-markdown" /></p>
<p dir="auto">这个 GLM 有点像什么？有点像 Claude，有点像 GPT 5.6 Sol 里把 Thinking 给它开高一点，是比较像美国的模型的。这就说明它的基础能力是不会差的。但是我也必须说，它的响应速度真的是慢成狗屎。就这么一个简单的小功能，它给我花了 6 分钟时间搞定。如果是 V4 Flash 的话，两分钟之内肯定能搞定。如果是千问 3.8-27B，用 7900 XTX 在本地驱动的 128K 上下文 Q4_K_M 量化版本，它的时间应该跟这个差不多，或者说大概七八分钟，比 OxAlpha 要略慢一点。作为一个在线模型，我认为慢成这个鸟样，已经是没有什么意义了，这是一个非常大的短板。</p>
<p dir="auto">然后它是有识图模式的，执行一些小的 Bug 修改，它都能搞得定。你还别说，现在开发这个 App 已经成为我的小乐趣了，我也不急于把它完成，但是每天把这些 Bug 完善一下，把这些小功能完善一下，都挺好的。这样子多好，是一个消遣，省得我测试模型就凭自己去瞎想，想一些大家不太认同的偏僻任务。那就在实际的开发中来完善这些小功能，它实际上现在已经基本上能用了，只有一点点地方需要再完善，慢慢来吧，不急。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/12ac84e2-9b2a-4f81-9c24-1b8dc158d687.jpeg" alt="OxAlpha编程实测.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">我打算是在过年的时候再给它上线，因为现在网站的网页版本，其实在手机上适配已经非常好了，然后在 PC 端的适配也是非常漂亮，已经足够大家使用了。我看过阵子要么就抽点时间来把这个 App 完善一下，如果大家想用的话，把它提前发布也可以。就是不着急，这是我的一个消遣项目。</p>
<p dir="auto">另外就要提一下，它号称是 1M 上下文，我个人感觉它的召回准确率是非常低的，它不行。它给我的感觉是，上下文长度最起码相比于千问 3.8-27B 在我本地给它开放的 128K 上下文，是没有什么明显优势的。怎么说呢？我打断它的指令，然后给它发一个新的消息，就像这样，它实际上会搞错我的意思。这个就是上下文召回准确率不够，用专业的术语来讲，就是大海捞针实验中它的得分不高。它的上下文是有这个长度，我说什么，它也能从这个上下文中去捞，但是它捞得不对，准确率不高。</p>
<p dir="auto">要知道你跟 DeepSeek V4 Flash 或者 V4 Pro 沟通的话，尤其是 V4 Pro，它的上下文召回准确率，我可以说是非常高的。我之前多次展示过，这个上下文到 700K 之后它还没压缩，是实打实地给你跑 700K 的上下文，它也是标称 1M。OxAlpha 就这么几轮会话，我讲实话，它这个召回就出了问题，甚至我都怀疑它的上下文有没有千问稳，我都不好说。那些非常尬吹 GLM 特别牛逼的，我也只能说你们开发的项目可能还是简单了一点，或者说你们迭代的轮数、迭代的步数都不够。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/ce60e3ca-1d92-4dc3-8d35-3daab1da9307.jpg" alt="kimi minimax glm deepseek.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">真正实打实的项目，你只要把它拉进来，就很容易看出问题。讲实话，就这个项目，比起我做的那个剪辑器，难度要低很多，低不止一个级别。但是 DeepSeek V4 Pro 在我用 Harness 驱动它的时候，就 DeepSeek Harness 加 DeepSeek V4 Pro 去开发这个剪辑器的时候，它表现出来的那种在长上下文环境中的召回准确率，是令我印象非常深刻的。我其实在以前的视频中贴过图，大家可以去找一下。因为我现在用 OBS 录屏，我就不打算后期配图了，这样子我制作视频的成本比较低，但是之前我是明确发布过的。</p>
<p dir="auto">就在 Hermes 上，当时我的设置是 512K 上下文，它在 Hermes 上跑 512K 的时候，这个召回准确率是一点问题都没有的。然后我在 DeepSeek Harness 上面是 700 多 K 上下文，它的召回准确率也是非常高的。这个东西是硬实力，再怎么样吹牛逼是没有用的。但是你说这个模型它本身不能用吗？我觉得它的编程能力，我个人认为对于代码的理解，它的能力是在 DeepSeek V4 Flash 之上的。它执行任务的成功率也是蛮高的，基本上一次就成功。</p>
<p dir="auto">但是如果你打断它的会话，给它发的指令描述得不够详细，它捞取上下文的准确率，我认为甚至是不如千问 3.8-27B 的。你要用非常准确的语言给它描述你的目的。然后就是这个用量，就是我批评的，要么就不要免费，你要免费就拿出点诚意，这样子弄得挺不好的。就好比一个花枝招展的少妇，给你各种撩骚，各种姿势给你摆好了，结果你一进去，发现七八个彪形大汉在房子里，这不就仙人跳吗？就是这种感觉，非常不好。</p>
<p dir="auto">然后就是关于 GLM，我谈一下我的看法，包括 Kimi，包括 MiniMax。你要明白这些公司，它们的模型并不是奔着要成为通用大模型的王者来的，它们都是主打一些细分领域。像 MiniMax 主打多模态，Kimi 就是主打这种长线复杂任务，把模型的规模做到跟 Anthropic、OpenAI 去对标。那么 GLM 它是主打编程，就是在各自的领域，我认为其实做得都挺不错的。但是它们的模型，我还是那句话，没有性价比。</p>
<p dir="auto">如果你真的是赶巧买到它们有性价比的 Coding Plan，那你们偷着乐，用起来是没有问题的。但是不要到处宣传，说它们比 DeepSeek V4 Pro 强，说什么性价比又好，这个我觉得有点扯淡了。最后我们再回到 <a href="http://OpenRouter.AI" rel="nofollow ugc">OpenRouter.AI</a> 上，我们来看一下，现在排名第一的 DeepSeek Flash 0731，它的 04R3 排名第五，然后 V4 Pro 0423 排名第十。前十名中有三个是 DeepSeek，这个强悍的实力就不用我多吹了。</p>
<p dir="auto">这个模型好不好，其实我们要相信大多数人的判断。<a href="http://OpenRouter.AI" rel="nofollow ugc">OpenRouter.AI</a> 是全世界最大的 AI 聚合网站，它这上面的用户绝大部分是外国人，甚至大部分是美国人，中国用户可能占 5% 左右。在这个平台上，除了偶尔搞活动的，或者像英伟达这种长期免费的模型，大家都是要掏真金白银来投票的，要刷信用卡来投票的。这些模型好不好，其实来这里参考，就很容易看出来。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/8c095891-d1ce-4d04-9843-a54ae4b65062.jpeg" alt="xiaomi mimo V2.5 openrouter" class=" img-fluid img-markdown" /></p>
<p dir="auto">然后关于它的免费模型，我要说一下，就是它每天应该是有 1000 次的调用额度，不过可能有些模型它给得不够。像小米 MiMo，为什么我给它的评分很高？就是我一直觉得这个模型是非常不错的，就是因为雷布斯在测试这个模型的时候，人家给的用量是非常足的，你放开用，用量非常足。现在人家上线了，你看，也得到了整个市场的认可，能排名到跟 DeepSeek 比一比，这也是非常牛逼。像英伟达这些免费的模型，就属于聊胜于无，虽然是免费的，但是我基本上也不用它。总之这个平台挺好玩的，大家没事可以上来玩一玩。</p>
<p dir="auto">以后我有空可能会做一些第三方的算力租赁、托管平台，这种算力租赁平台有什么特色的服务，到时候做一些视频跟大家评论一下。反正现在有了 OBS，我只要对着镜头瞎 BB，也不用写稿子，弄完之后丢给 AI 去剪辑，这视频就出来了。而且这种视频不会被平台判为 AI Slop，因为我有一张脸，虽然这张脸不太帅气、不太好看，在右下角可以被平台检测作为真人，那我的视频生产成本就大大降低了。</p>
<p dir="auto">大家有什么问题，可以到论坛跟我交流沟通。有的时候你们在评论区发评论，我可能并没有回复，并不是说我装逼，而是我的时间真的是比较紧张。因为我也给你们讲过，提到过很多次，我要挣钱，我比较穷，我同时做好多个频道，就没有那些时间。如果你们去论坛发帖，我有空一定会回你们；如果没有空的话，论坛有很多大神，这些人的实力都不在我之下，而且他们分享的各种方案都非常非常好。</p>
<p dir="auto">有各种各样的，你看 5070 Ti 双卡，什么千问 3.8、Q2、Q6、SGLang，这些部署方案都有，各种卡实际上都有，各种主板、各种显卡、各种搭配方案。我们的这些大神、管理团队都是非常不错的，你的问题一定会得到解答。</p>
]]></description><link>https://lcz.me/topic/1282</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 02:43:56 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1282.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 24 Aug 2026 02:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to OxAlpha是GLM5.3？实测编程很强，强于Qwen 27B和DeepSeek V4 Flash，不如V4 Pro! 1M上下文翻车，召回准确率不够！ on Mon, 24 Aug 2026 03:55:23 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 不值得，没V4和Qwen的待遇，太极图不是谁想上谁就上的。</p>
]]></description><link>https://lcz.me/post/13686</link><guid isPermaLink="true">https://lcz.me/post/13686</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 24 Aug 2026 03:55:23 GMT</pubDate></item><item><title><![CDATA[Reply to OxAlpha是GLM5.3？实测编程很强，强于Qwen 27B和DeepSeek V4 Flash，不如V4 Pro! 1M上下文翻车，召回准确率不够！ on Mon, 24 Aug 2026 03:36:53 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 准备用INTEL 的B70部署 3.8-27B，我想试试单卡部署的性能。到时候写教程贴出来。</p>
<p dir="auto">H3 在B70上用着还是相当不错的，只是针对NV的加速的啥的没办法用上。</p>
]]></description><link>https://lcz.me/post/13680</link><guid isPermaLink="true">https://lcz.me/post/13680</guid><dc:creator><![CDATA[sirwang]]></dc:creator><pubDate>Mon, 24 Aug 2026 03:36:53 GMT</pubDate></item><item><title><![CDATA[Reply to OxAlpha是GLM5.3？实测编程很强，强于Qwen 27B和DeepSeek V4 Flash，不如V4 Pro! 1M上下文翻车，召回准确率不够！ on Mon, 24 Aug 2026 03:13:08 GMT]]></title><description><![CDATA[<p dir="auto">终于等到OxAlpha出来了，我以为老特会用他来测试那个太极图。。。</p>
]]></description><link>https://lcz.me/post/13676</link><guid isPermaLink="true">https://lcz.me/post/13676</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Mon, 24 Aug 2026 03:13:08 GMT</pubDate></item><item><title><![CDATA[Reply to OxAlpha是GLM5.3？实测编程很强，强于Qwen 27B和DeepSeek V4 Flash，不如V4 Pro! 1M上下文翻车，召回准确率不够！ on Mon, 24 Aug 2026 03:03:56 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/sirwang" aria-label="Profile: sirwang">@<bdi>sirwang</bdi></a> 浪费时间，上下文是残疾。</p>
]]></description><link>https://lcz.me/post/13670</link><guid isPermaLink="true">https://lcz.me/post/13670</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 24 Aug 2026 03:03:56 GMT</pubDate></item><item><title><![CDATA[Reply to OxAlpha是GLM5.3？实测编程很强，强于Qwen 27B和DeepSeek V4 Flash，不如V4 Pro! 1M上下文翻车，召回准确率不够！ on Mon, 24 Aug 2026 03:02:03 GMT]]></title><description><![CDATA[<p dir="auto">小米的没用过。不清楚咋样。  这个OX现在吹的很厉害， 国内不少UP主之前就有了内测权限然后也有不少软文出来。</p>
]]></description><link>https://lcz.me/post/13668</link><guid isPermaLink="true">https://lcz.me/post/13668</guid><dc:creator><![CDATA[sirwang]]></dc:creator><pubDate>Mon, 24 Aug 2026 03:02:03 GMT</pubDate></item><item><title><![CDATA[Reply to OxAlpha是GLM5.3？实测编程很强，强于Qwen 27B和DeepSeek V4 Flash，不如V4 Pro! 1M上下文翻车，召回准确率不够！ on Mon, 24 Aug 2026 02:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/HysoQsDl3n8" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="HysoQsDl3n8" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/HysoQsDl3n8/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/13657</link><guid isPermaLink="true">https://lcz.me/post/13657</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 24 Aug 2026 02:00:00 GMT</pubDate></item></channel></rss>