Kimi K3:Moonshot AI 如何实现规模化

Kimi K3 : comment Moonshot AI est passé à l’échelle

Silicon.fr by Clément Bohic 2026-07-28 12:51 Original
摘要
月之暗面(Moonshot AI)发布了开源旗舰模型Kimi K3,该模型拥有近3万亿参数和896个专家,通过混合注意力、深层残差连接及稳定MoE训练等技术实现了百万令牌上下文,训练效率较前代提升2.5倍。模型采用宽松许可,但要求月活超1亿或月营收超2000万美元的商业产品须显著标注“Kimi K3”,且MaaS供应商若年营收超2000万美元需另行签署商业协议,此举或影响大型企业的采用。

为打造数千亿参数、近千名专家的旗舰模型Kimi K3,Moonshot AI 在序列长度、网络深度和模型宽度三个方向上重构了信息流通方式。

在序列长度上,模型采用混合注意力机制,以3:1的比例交错部署KDA(Kimi Delta Attention)与MLA(Multi-head Latent Attention)层。前者利用恒定大小的循环状态压缩内存占用,后者则负责维持全局上下文。针对网络深度,“注意力残差”机制取代传统残差连接,使每一层都能选择性获取并加权所有前序模块产生的表示。在模型宽度层面,Stable LatentMoE 专为稳定896名专家的训练而设计,其核心任务是均衡负载,避免专家过度使用或闲置。此外,每个 token 所选的16名专家并不直接处理完整的隐藏维度,而是先将表示压缩到低维潜在空间,专家计算完成后再扩展回原始维度。

后训练融合了监督微调、强化学习与蒸馏,并将上下文窗口逐步扩展至百万 token。为高效管理专家并行,Moonshot AI 自研了依赖静态计算形式的并行库,为每个 token 预留固定大小的显存缓冲区,从而免除 GPU 执行动态尺寸调整指令。同时,通过微虚拟机技术,可在数十毫秒内暂停与重启沙箱,支撑智能体场景下的注意力轨迹延续。团队还将 KDA 模块的基本操作融合进单个定制 GPU 内核。这一系列技术使 Kimi K3 的规模效率较前代 Kimi K2 提升2.5倍。

Kimi K3 已配套 vLLM、SGLang 和 TokenSpeed 推理工具,并采用 MIT 式宽松许可证,但对大型企业设有额外限制:过去12个月(含子公司)收入达到2000万美元的 MaaS 提供商,需与 Moonshot AI 另行商谈商业协议;任何月活跃用户超过1亿或月营收达到2000万美元的商业产品或服务,必须在界面清晰标注“Kimi K3”。这与 Meta 对 Llama 模型施加的7亿月活用户商业许可门槛类似,反映出开放权重模型在商用化过程中对巨头客户的特殊约束。

Summary
Moonshot AI has unveiled Kimi K3, a 3000-billion-parameter open-weight model with 896 experts, achieving a million-token context window through novel architectural techniques like hybrid attention and Stable LatentMoE, which deliver 2.5x scaling efficiency over its predecessor. The model is released under a permissive MIT-like license, but large enterprises offering MaaS with over $20M in trailing revenue or services with 100M+ monthly active users must secure a commercial deal or clearly attribute "Kimi K3" on their UI. This licensing strategy mirrors Meta's approach with Llama, restricting unfettered use by major commercial players while still fostering broad developer adoption.

Moonshot AI’s latest open-weight flagship, Kimi K3, scales to nearly 3 trillion parameters and almost 1,000 experts, forcing a rethinking of information flow across sequence length, network depth, and model width.

For sequence handling, the architecture employs a hybrid attention mechanism that interleaves Kimi Delta Attention (KDA) and Multi-head Latent Attention (MLA) layers at a 3:1 ratio. KDA layers maintain a constant-size recurrent state to limit memory consumption, while MLA layers preserve global context. Network depth benefits from an Attention Residuals mechanism that replaces standard residual connections, enabling each layer to selectively retrieve and weight representations from all preceding blocks.

To stabilize training across the 896 experts, Kimi K3 introduces Stable LatentMoE, which balances expert load to prevent under- or over-utilization. Additionally, instead of routing the full hidden dimension through each of the 16 experts activated per token, the architecture first compresses inputs into a lower-dimensional latent space where experts compute, then expands outputs back to the original dimension.

Post-training combined supervised fine-tuning, reinforcement learning, and distillation, with the context window gradually extended to one million tokens. For expert parallelism, Moonshot AI built a custom library that leverages static computation forms: each token is assigned fixed memory buffers, eliminating dynamic size-change instructions on the GPU. To support agentic workflows, training harnessed microVMs capable of suspending and relaunching sandboxes in tens of milliseconds, and elementary KDA block operations were fused into a single tailored GPU kernel. According to the company, these techniques delivered 2.5× the scaling efficiency of Kimi K2.

Kimi K3 ships with inference tooling for vLLM, SGLang, and TokenSpeed. Its MIT-like license is highly permissive except for large enterprises: any model-as-a-service (MaaS) provider that, including subsidiaries, has generated at least $20 million in revenue over the trailing 12 months must negotiate a commercial agreement with Moonshot AI. Separately, any commercial product or service with more than 100 million monthly active users and/or at least $20 million in monthly revenue is required to display “Kimi K3” on its user interface—this applies even if the product is not a MaaS offering. For context, Meta imposes a similar constraint on its Llama models, requiring a commercial license for services with over 700 million monthly active users.

Résumé
Moonshot AI a dévoilé Kimi K3, un modèle open-weight de 3 000 milliards de paramètres et 896 experts, optimisé pour gérer de longues séquences et stabiliser l’entraînement via des mécanismes d’attention hybrides et une architecture à espace latent compressé, atteignant un rendement d’échelle 2,5 fois supérieur à son prédécesseur. Sa licence permissive impose toutefois aux fournisseurs de MaaS et aux grands services (plus de 100 millions d’utilisateurs ou 20 millions de dollars de chiffre d’affaires mensuel) de négocier un accord commercial avec Moonshot AI et d’afficher la marque « Kimi K3 », une restriction comparable à celle de Meta pour ses modèles ouverts.

À une échelle de quasiment 3000 milliards de paramètres et près de 1000 experts, il faut repenser la circulation de l’information.

Ce chantier a guidé le développement du dernier flagship open-weight de Moonshot AI : Kimi K3. Il s’est décliné sur trois dimensions : longueur de séquence, profondeur de réseau et largeur de modèle.

Sur le premier aspect, Moonshot AI a exploité un mécanisme d’attention hybride. Il entrelace, à raison de 3 pour 1, des couches KDA (Kimi Delta Attention) et MLA (Multi-head Latent Attention). Les unes exploitent un état récurrent de taille constante pour limiter l’empreinte mémoire. Les autres permettent de maintenir le contexte global.

Le mécanisme dit Attention Residuals agit sur le deuxième aspect. Il remplace la connexion résiduelle classique et permettant à chaque couche de récupérer et pondérer de manière sélective les représentations issues de l’ensemble des blocs précédents.

Stable LatentMoE intervient sur le troisième aspect. Comm son nom l’indique, il stabilise l’entraînement à l’échelle des 896 experts de Kimi K3. Son rôle : équilibrer la charge, pour éviter que certains soient sous-utilisés ou surutilisés. En complément, plutôt que de faire passer la totalité de la dimension cachée à travers chacun des 16 experts que sélectionne chaque token, l’architecture les compresse dans un espace latent de plus faible dimension où les experts effectuent leurs calculs. Les sorties sont ensuite réétendues vers la dimension d’origine.

Des microVM pour tenir le million de tokens

Le post-entraînement a combiné fine-tuning supervisé, apprentissage par renforcement et distillation. La fenêtre de contexte a été progressivement étendue, jusqu’au million de tokens.

Pour gérer le parallélisme des experts, Moonshot AI a développé sa propre bibliothèque. Elle exploite notamment des formes de calcul statiques. Elle réserve en l’occurrence à chaque token des tampons mémoire fixes, de sorte que le GPU n’a plus à exécuter des instructions dynamiques de changement de taille.

Pour maintenir la trajectoire d’attention dans le cadre des usages agentiques, l’entraînement a mis à contribution des microVM permettant de suspendre les sandbox et de les relancer en quelques dizaines de millisecondes. Moonshot AI y a ajouté un regroupement des opérations élémentaires des blocs KDA dans un unique noyau GPU personnalisé.

L’ensemble de ces techniques lui a permis affirme-t-il, d’atteindre un rendement d’échelle 2,5 fois supérieur à celui de Kimi K2.

Kimi K3, sous licence permissive, mais…

Kimi K3 est fourni avec de l’outillage d’inférence pour vLLM, SGLang et TokenSpeed. Il a une licence MIT-like très permissive… sauf pour les grandes entreprises.

Celles qui fournissent une offre MaaS (models as a service) doivent négocier un accord commercial avec Moonshot AI dès lors qu’elles ont déjà – filiales comprises – réalisé au moins 20 M$ de CA sur 12 mois glissants.

Une autre exigence s’applique. Elle n’est pas limitée aux fournisseurs MaaS. Elle impose d’afficher clairement « Kimi K3 » sur l’UI de tout produit ou service commercial qui compte plus de 100 millions d’utilisateurs actifs par mois et/ou dégage au moins 20 M$ de chiffre d’affaires mensuel.

Meta impose une limite du même genre pour ses modèles Llama à poids ouverts. Doit prendre une licence commerciale quiconque exploite des produits ou services comptant plus de 700 millions d’utilisateurs actifs par mois.

À consulter en complément :

Qui est Moonshot AI, l’éditeur des modèles Kimi ?Mistral AI change d’approche pour l’apprentissage par renforcement

AMD entre vraiment dans le jeu des racks IA exascale

L’IA agentique change les méthodes de travail : Doctolib l’expérimente auprès de ses développeurs

Cohere et Aleph Alpha : les noces de l’IA souveraine

Illustration principale générée par IA

The post Kimi K3 : comment Moonshot AI est passé à l’échelle appeared first on Silicon.fr.

AI Insight
Core Point

Moonshot AI 发布近 3000 亿参数的开源权重模型 Kimi K3,采用潜在 MoE、混合注意力等新架构提升扩展效率与训练稳定性,并附带对大型服务商的商业许可限制,影响开源 AI 生态。

Key Players
  • Moonshot AI — 中国 AI 初创公司,开发 Kimi 系列大语言模型,总部位于北京。
Industry Impact
  • 计算/AI: 高 — 潜在 MoE 与混合注意力等架构创新直接推动大规模模型训练和推理的扩展效率。
  • ICT: 中 — 有条件开源许可(MaaS 年收入超 2000 万美元需商业协议)影响云服务与模型即服务市场。
Tracking

强烈跟踪 — 该模型在架构扩展性上的突破可能成为行业基准,其商业许可策略可能引发开源模型商用条款的连锁反应。

Related Companies
Meta
mature
neutral
AMD
mature
positive
Mistral AI
startup
neutral
Doctolib
scale-up
neutral
Cohere
startup
positive
positive
neutral
Categories
人工智能 软件 云计算
AI Processing
2026-07-28 13:29
deepseek / deepseek-v4-pro