Kimi K3编程,SVG绘图,Agent能力实测,能力不错,但成本较高,过度思考,风格很像Claude,能够做到国产平替,但是不如Deepseek等有性价比!
-
Kimi K3发布引起了广泛热议,在部分性能的测试中,它超越了Claude Fable 5、GPT 5.6这样的美国旗舰模型。总体上,它的跑分也是达到了和这两个模型差不多的水准,略有落后,但肯定是一个档次了。

说实话,这个话题值得我这样的嘴炮多做几期视频谈下,我会在“老特说”那个频道里评论下这件事。但是评论之前我先得实际测试下,看看它好不好用。还是老的三件套:生成八卦网页,还有用SVG图像表达钍基熔盐堆运行原理、薛定谔的猫思想实验,因为以前几乎所有的热门模型,我都用同样的内容测试。不过在此之前,我先把模型接入Hermes,测试起来方便一点。
我在MacBook上配置了个新的Hermes助手小乐,过程很简单,就是让我的虚拟儿子小特自远程登录上去配置,没花什么钱就搞定了,速度也很快,接入了HY3以及Opus 4.8热身一下,才开始上主菜,就是Kimi 3。
首先在命令行界面让它生成一个八卦网页表达中国的传统文化,

它花了有十几分钟,给我拿出了一个成品,效果还是相当不错的,只有很少的基础BUG。它的模型规模意味着训练时塞入了更多知识储备,对八卦的阐述比较到位。但是请注意,这个过程耗费的时间太久,DeepSeek V4 Flash Pro,甚至是Qwen 3.6都是在很短的时间内就完成了,效果也都还是过得去的。
Kimi的优势在于它会自己调用工具查看网页,查看结果哪里异常,这个部分通过hermes配套的工具实现。发现问题后它进行了多轮修正,这就是Harness工程最有价值的地方。但是这也是它和Claude、GPT这些模型最坑的地方,它把harness内置,导致做个最简单的任务,都有可能触发过度思考。是的,效果好了5%,但是多花了几十倍上百倍的钱。这个小任务它消耗了我1.2美金,我都给惊呆了。DeepSeek应该1毛钱就能搞定。
但也不用在意,当初玩OpenClaw测试Claude,我没注意把API余额干到了负数,现在也是见怪不怪了。切换到电报交互,我比较习惯这样,看到Mac终端这种屎黄色的配色我真的是痛苦,UI设计人员一定在生活中遭受了某种常人难以理解的苦难。
还是老样子,给它发命令,让kimi生成一个SVG图像表达钍基熔盐堆运行原理图,它给的效果也挺不错,但是说实话,中规中矩,和Qwen 3.6一个水平吧。你要说好,那不如DeepSeek和小米的MIMO的入门版本。比如小米mimo的图不仅是配色优秀,而且是动态的。雷布斯的模型最近在OpenRouter上调用量很高,排名第二,仅次于免费的腾讯HY3,是有点东西的。我很早之前测试的时候就说了我挺看好它,现在市场表现也验证了我的看法。
再让它生成图表达薛定谔的猫思想实验,这次它画得不错,配图逼格也够,抓到了要点。
但要说惊艳肯定是谈不上。总之就是编程能力我是简单测试,总体上它属于优秀的那一档,Harness工程做得很好,非常像Opus。Fable 5我没测过,因为我觉得太贵了,测了没意义,我反正用不起。我感觉Kimi走的路线就是模仿Claude,GLM则是有点像GPT。
下面再说下Agent能力,这个就非常主观,因为接入Hermes,再傻逼的模型,就算是现在免费的腾讯HY3,也能维持基本运转。但是不得不说,就我个人体感而言,接入Hermes最好的模型还是DeepSeek V4 Flash,响应速度极快,执行命令干脆准确。kimi有点思考过度,而且它的响应速度也不如DeepSeek。我知道模型内置大量Harness,对于小白是很有价值的,对于金融、医疗这样有大量高价值数据的行业,是非常好用的。这些企业不缺钱,但它们没技术积累,需要模型能够自主进行长链分析,帮助员工做出业务决策。在这样的情况下,Claude、Kimi这种模型的价值还是很高的。
也就是说,Kimi值这个价格,它毕竟比美国的模型便宜很多,能够做到基本平替。X上有大量的对比。比如Kimi K3和Fable 5调用Seedance 2.0生成视频,或者调用一些3D软件建模,二者表现旗鼓相当。在这些复杂应用场景中,既要比拼知识库,也要比拼长链决策,它们的表现确实会比DeepSeek V4 Flash这种纯工具模型好很多。

但是内置Harness在接入Agent的时候是一个灾难,因为重复计算、响应慢、过度解读导致执行不干脆,账单爆表不实用。它们这些模型强大,有一个前提,就是DeepSeek这样的价格屠夫不搞Harness工程,这显然是不可能的。事有轻重缓急,DeepSeek已经融资招人,Harness在路上了。
我们必须说,Harness工程也是护城河,不是谁想搞谁就能搞好的。但是比起魔改Transformer、提出Engram、追求极致缓存和底层算子优化,它真的就不算有难度。Fable 5发布后不久,我在视频里明确说过,Anthropic的跑分神话维持不了一年,因为这就好比鸠摩智用小无相功催动少林七十二绝技,它能做,其他公司也能做。我当时明确说了中国的GLM、Kimi等企业会是Anthropic以及OpenAI的噩梦,因为它们会长期陪跑,走的路子就是AO两家的刷分路线,圈高端客户。
如果DeepSeek是个耐用的帆布包,那么kimi、claude这些就属于LV、Gucci。你不能说买LV的人都傻,人家第一是不在乎,第二是相比于钻营省钱实用,他们更关注使用体验以及附加价值。有些有钱人买东西,低于一定的价格他会怀疑的。
但是我相信,我评论区的大多数观众老爷们,买个5000块钱的显卡都要找下优惠券,我们就不要装逼了。相信我,kimi k3这种高端货不是我们用得起的。如果有复杂的专业任务,可以试试看;如果仅仅写个网页,搞个自动化脚本,维护下论坛和服务器,老老实实把DeepSeek V4 Flash用好,就足够了。没人买卡宴来跑滴滴,如果有,那他一定是为了泡妹,而不是为了赚那点外快。
关于HY3,我也做了测试,没啥惊喜,但也都够用。据说它定价也挺便宜,比如比DeepSeek V4 Flash略高,考虑它是多模态模型,有一定可玩性。国产选择越来越多了,抽时间整理下发出来吧。
-
傻逼KIMI 超级老用户一枚报道。
-
看了报告又重燃了我对 KIMI 的希望。冲一波。
-

已经冲了。软路由换CLI 太费劲了。支持一下。被坑了。就当 爱国了。 -

已经冲了。软路由换CLI 太费劲了。支持一下。被坑了。就当 爱国了。 -
拿 它 做 导演。看看输出效果。用它的 K3集群。出的剧本细节能丰富些。现在 提示词有瓶颈。
-
就多模态来说 KIMI K3 非常有用。已经用 K3 制作生产力工作流 成功。做到了 单图,识别,导演 配音 6阶段视频生成。合成出片。人工部分只有 提供图片到最后验片。










