GLM-5.3和Kimi K3该怎么选?
这周新模型出得太猛了,一天出来好几个,我连挨个点开试一下的时间都不够,脑子确实有点转不动了。
这次 GLM-5.3 出来,最值得看的其实是它和 Kimi K3 放在一起比。
这两个模型个头差很多:
GLM-5.3 的“底子”大概是 7430 亿的参数,但实际干活时只调用其中 400 亿左右。Kimi K3 总共有 2.8 万亿的参数,实际调用 1040 亿。
换句话说,Kimi K3 的“总储备”差不多是 GLM-5.3 的四倍,照理说应该碾压才对。但神奇的是,在写代码和当智能助手这类任务上,两个模型打成了平手。
具体来看官方给出的几个测试成绩:
第一个测试(模拟命令行操作),GLM-5.3 是 28.3 分,Kimi K3 是 17.4 分
第二个测试(长周期编程项目),GLM-5.3 是 66.9 分,Kimi K3 是 67.5 分,略高一点点
第三个测试(自动化流程任务),GLM-5.3 是 48.2 分,Kimi K3 是 46.7 分
GLM-5.3 在操作命令和自动化这块更厉害,Kimi K3 在需要长时间跑的大型编程任务上还稍微占点优势。
另外还有个很明显的变化,就是网络安全这块。
在网络安全相关的测试里,GLM-5.3 拿了 84.5 分,Kimi K3 是 80.0 分;另一个更硬核的安全测试里,GLM-5.3 直接 54.4 比 32.2,领先了一大截。所以 Z.ai 这次直接把“网络安全防御”写进了 GLM-5.3 的定位里,不是没道理的。
最后一点值得说的是,GLM-5.3 这次没有换更大的“底子”。
官方的意思就是,这次主要是在原来的基础上把训练做得更精细、更深入。对比上一个版本,命令行测试从 4.6 分直接涨到 28.3 分,编程项目测试从 46.2 涨到 66.9,进步非常明显。
Kimi K3 走的是“堆料”路线——用更大的模型、更新的结构、加上原生多模态能力来往上冲;GLM-5.3 走的是“挖潜”路线——在现有的底子上把专项能力打磨到极致。
这两条路哪个更好,比单纯看谁分数高几分有意思多了。

京ICP备2024094994号-17
评论 (0)
还没有评论,来发第一条吧