← 返回文章列表

Kimi K3都出来了,为什么还在聊GTC上的那场演讲?

作者:星阙内容团队 发布时间:2026-07-20 更新时间:2026-09-09 09:09:28

#

7月17日凌晨,月之暗面发布了新一代大模型Kimi K3。

2.8万亿参数,全球首个开源3T级模型,综合智能水平仅次于Claude Fable 5和GPT-5.6 Sol这两个前沿闭源模型。

消息一出,行业刷屏。但如果你留意过,会发现一个时间差:GTC 2026大会是3月份的事,杨植麟在那场演讲里详细拆解的是Kimi K2.5背后的技术路线。

K3都出来了,为什么还要回头聊一场讲K2.5的演讲?

## 一场关于"地基"的演讲

杨植麟在GTC上讲的核心内容,可以概括为一句话:把Transformer用了十年的三个基础组件全部换掉了。

Adam优化器(2014年)、全注意力机制(2017年)、残差连接(2015年)——这三个东西从问世起陆续成为行业标配,几乎没人质疑过它们是否"足够好"。

月之暗面分别做了替代方案:

1. Adam → MuonClip

传统Adam优化器在超大规模训练中效率见顶。MuonClip是一种二阶优化器,每次梯度更新都被转换为各方向彼此正交的形式,带来约2倍的token效率提升。团队还引入QK-Clip机制,在训练中实时检查每个注意力头的最大logit,一旦超过安全范围就同步缩放Q和K的投影,解决了万亿参数规模下logits爆炸的稳定性难题。

2. Full Attention → Kimi Linear

标准全注意力计算量随上下文平方增长。KDA(Kimi Delta Attention)混合线性注意力机制通过细粒度的通道级门控和分块循环更新,首次在短上下文、长输入和长输出任务上全面超过全注意力架构。在128K甚至1M超长上下文中,解码速度提升5到6倍。

3. Residual Connection → Attention Residue

将传统的固定累加替换为对前序层输出的注意力机制,让每一层都能根据输入内容有选择地聚合信息。实验显示,这一改动带来了约1.25倍的训练效率提升。

当时杨植麟说了一句话:"很多以前认为是标准的东西,现在都是可以被挑战的。"

这句话放在K3身上,恰好得到了验证。

## K3是什么?是把那套"新地基"盖成了楼

如果你只看K3的参数和榜单,可能会觉得它只是一次常规升级——参数更大、分数更高。

但仔细看它的技术架构说明,会发现端倪:Kimi K3基于自研的KDA混合线性注意力机制和注意力残差技术构建。KDA就是Kimi Linear背后的架构,注意力残差就是Attention Residue。

换句话说,GTC演讲里说的那套"新组件",在K3身上变成了正式落地的技术底座。

这并非简单的参数堆叠。K3还进一步扩大了MoE稀疏度:结合Stable Latent MoE框架,在896个专家中高效激活16个。通过模型结构、训练方法和数据配方的协同优化,K3相较上一代整体扩展效率提升了约2.5倍。

## 一个更值得关注的信号:技术路线图的可信度

GTC演讲的真正价值,不在于它介绍了什么新技术,而在于它提供了一个可以被验证的框架。

杨植麟当时把Kimi的进化逻辑归纳为三个维度:Token效率、长上下文、智能体集群。他说如果能将这三个维度的技术增益相乘,模型将表现出远超现状的智能水平。

回头看看K3:

维度GTC演讲的承诺K3的兑现Token效率MuonClip带来2倍token效率提升MuonClip支撑了2.8T参数的训练稳定性长上下文Kimi Linear在100万Token以上优势明显KDA架构让100万Token窗口真正可用智能体集群多智能体并行协作完成复杂任务K3可自主完成引力波分析等长程任务三个方向,全部验证了。

一场3月份的演讲,7月份发布的新模型,中间隔了不到四个月。那套技术框架不仅没被推翻,反而被更充分地证明。这说明月之暗面手里有一套稳定的技术演进路径,而不是每次发布都另起炉灶。

## 一个意外的插曲:K3暂停C端订阅

K3发布后仅数小时,便登顶AI代码工具评测榜单Arena,成为首个拿下该榜榜首的中国大模型。

但7月19日,Kimi团队发布紧急公告:自Kimi K3发布以来,用户请求量已大幅超出预估,逼近现有集群的承载极限,即日起暂停C端新用户订阅。

公告中提到,后续恢复订阅时将拆分Kimi主权益和Kimi Code权益,以便更精准匹配算力资源。

这个插曲恰好说明了一个问题:那套"新地基"盖出来的楼,确实足够吸引人,吸引到算力都扛不住了。

## 一点延伸

杨植麟在GTC演讲最后提到过一个观点:十年前的研究往往更看重新想法的发表,但受限于算力,很难通过不同规模的实验来验证。而现在研究者可以进行严谨的规模化实验,从而得出更可靠的结论。

这也是为什么Kimi能够从那些看似"老旧"的技术中挖出新突破的原因——因为有了足够的资源去验证那些以前只能停留在纸面上的想法。

GTC演讲提供的是一个"设计图",K3提供的是"建成后的楼"。

回头看那场演讲,不是怀旧,而是为了理解——这栋楼的地基,到底是怎么打的。

Kimi K3的完整模型权重计划于2026年7月27日前公开。届时,全球开发者都可以下载运行这套2.8万亿参数的开源模型。