首页
看点啥
插画图片
首页 看点啥 月之暗面Kimi开源Kimi K3模型权重与关键技术

月之暗面Kimi开源Kimi K3模型权重与关键技术

2026-07-29 0

Kimi K3的模型权重、相关技术报告以及支撑模型训练的几项核心技术组件,近日由人工智能领域参与者@月之暗面Kimi向外界公布。

公开内容与开源组件

作为开源项目对外发布的内容包括MoonEP、FlashKDA和AgentEnv,这三项核心技术用于支持模型训练。与此同时,发布方还上线了Kimi K3模型的主要权重文件;随附技术报告对训练过程的关键方法和结果作了详细记录。

技术组件简介

用于提高并行计算效率的基础设施技术是MoonEP,优化数据处理的加速算法是FlashKDA,AgentEnv则属于模型训练的特定环境配置工具。将这些技术开源,旨在向行业提供参考实现。

发布背景与行业影响

通过共享模型权重及核心技术,发布方此次行动体现了其在人工智能技术领域的开放态度,也为业内研究者和开发者提供了宝贵资源。业内人士认为,这类开源举措有助于提高相关技术领域的透明度并促进协同发展。

2.8万亿参数混合专家能力开放:Kimi K3模型正式公开

月之暗面旗下Kimi K3模型已正式公开发布,这是CNMO科技提供的消息。该模型原生具备视觉理解及超长上下文处理能力,目前可供自由下载和部署。

模型核心参数与特性

作为月之暗面当前参数规模最大的模型版本,Kimi K3采用混合专家(MoE)架构,参数总量达到2.8万亿。

混合专家(MoE)模型是一种通过将任务分配给多个专家子网络来提升处理能力的机器学习架构。

远超行业普遍水平的100万token上下文窗口已由该模型实现,图像识别与理解也获得原生支持。

开放下载与部署

模型文件的获取途径是官方渠道;拿到文件后,用户可将其用于包括但不限于商用产品集成或内部研发实验。

自由使用授权

模型可供各方按需求部署在不同场景,并向终端用户提供相应功能,因为CNMO科技提到其使用不带附加限制条件。

凭借高参数量与MoE架构的结合,Kimi K3在多模态交互领域具有明显优势,企业可直接获取模型并用于处理复杂认知任务。

自动化模型构建能力迎来提升 Kimi K3技术报告与模型权重发布

详细说明KDA+AttnRes、Stable LatentMoE、MoonViT-V2等技术细节的Kimi K3技术报告已经同步上线;它介绍的是模型训练方法,与Kimi K3模型权重一同公开。

长上下文建模新突破

为实现高效长上下文建模,KDA+AttnRes采用以3:1比例混合KDA和Gated MLA的技术方案。借助块级注意力残差,该方案改善了跨层信息流动,并为模型训练带来更多灵活性。

KDA+AttnRes将模型训练中的KDA与Gated MLA按3:1比例混合,通过块级注意力残差增强信息流动。

高稀疏度训练稳定方案

896个路由专家中,每个token会激活16个,这是Stable LatentMoE技术的运行方式。为避免模型训练出现不稳定性问题,该方案引入Quantile Balancing机制与SiTU-GLU,使极高稀疏度条件下的训练仍保持稳定。

作为视觉编码器,MoonViT-V2使用从零开始的next-token prediction训练方法,不需要对比预训练。它在取得SigLIP初始化基线效果的同时,使优化过程更加稳定,并降低了模型训练的复杂度。

多领域评估体系完善

通用推理、通用Agent和编程Agent三大领域均纳入后训练与评估环节。该模型依靠百万token上下文的强化学习基建与大规模任务合成,对近20个内部评测集完成完整评估,由此确保多场景下的可靠性和适用性。

研究者由此次公开的Kimi K3模型权重及技术报告获得了更深层次的模型构建思路,自动化模型构建能力也因此有了新的标准。按照行业专家的观点,人工智能模型的发展将被这些技术的应用进一步推动。

内容来源:https://www.moyubuhuang.com/keji/202607/96404.html

喜欢(0)

上一篇

艺术与历史考据太难?用 GPT 多模态大模型识别文物画作并生成学术级背景科普

下一篇

AI商品视频制作工具怎么选?从商品图到营销视频完整流程解析

猜你喜欢