首页
看点啥
插画图片
首页 看点啥 刚刚,Kimi K3正式开源,2.8万亿参数面向全球,硅谷巨头震动了

刚刚,Kimi K3正式开源,2.8万亿参数面向全球,硅谷巨头震动了

2026-07-29 0

智东西7月28日报道,刚刚,月之暗面发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术MoonEP、FlashKDA和AgentEnv。

Hugging Face CEO Clem Delangue发文后,Kimi 超过4000个赞让K3仅用30分钟便升至趋势榜第一。发布后的增长速度迄今未有更快纪录

拥有2.8万亿参数的Kimi由月之暗面在此前7月17日发布 K3,很快被不少网友冠以“中国的Fable 5时刻”之称,原因在于其基准测试及实际体验均表现出色。

Kimi K3开源后,北美AI基础设施创企OsmanticAI的创始人兼CEO Ahmad发文,将Kimi K3称为“本地版Fable 5”,并“强烈建议大家下载体验”,这样“他们永远也夺不走我的Fable 5”了。

数字员工Devin开发主体、美国知名AI创企Cognition宣布,Kimi K3现已接入Devin桌面客户端与命令行工具(CLI),并称:“在FrontierCode 1.1评测基准上,Kimi K3是我们测试过首款性能逼近前沿水准的开源模型。”

Nebius、Baseten、Fireworks等海外AI基础设施厂商随即宣布Day 0适配Kimi K3。Nebius称:“Kimi K3是首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步。”

华 为昇腾CANN宣布对模型MXFP4量化实现Day0原生支持,并提供在昇腾950PR/DT系列和Atlas A3系列集群部署实践。同时,趋境科技宣布,基于开源大模型推理引擎SGLang,完成了Kimi K3在华 为昇腾910C超节点上的Day0适配,并同步开源相关适配成果。

围绕Kimi K3上线前的讨论同样十分热烈,甚至有网友发帖调侃,Hugging Face还专门为Kimi K3拥有一个用于预热的网页。

截至Kimi K3正式上线前半小时,已有近3700名开发者等候;而在上线10分钟前,Kimi 404曾在K3上线页面短暂出现。

模型权重地址: https://huggingface.co/moonshotai/Kimi-K3

01 三大关键Infra技术开源,2.8亿参数模型权重全面开放

Kimi 原生视觉理解能力和100万token上下文窗口均由K3支持;其本身属于混合专家(MoE)模型,参数量为2.8万亿。

下载、部署Kimi如今对每个人开放 K3模型。它既能自由嵌入面向终端用户的产品,也能供内部研发自由使用。

Kimi K3此次还同步开源了训练系统,即Infra基础设施层的三项Infra技术:AgentEnv、MoonEP和FlashKDA。

面对超大细粒度MoE,MoonEP提供了一套高性能通信库;即便专家并行通信处于不均衡状态,它也能保持极致效率。该技术属于三项开源Infra技术之一。

FlashKDA是Kimi 在英伟达H20上,与flash-linear-attention基线相比,prefill速度获得提升的是Delta Attention高性能算子达到1.72-2.22倍,使用时能够直接替换原有后端。

高保真且强隔离的运行环境由沙箱系统AgentEnv提供,面向大规模Agent训练,并能借助快速快照、恢复及分叉处理大规模并行Agent工作流;这一系统由其同KVCache.ai合作开发。三者之中,FlashKDA已在此前开源,AgentEnv和MoonEP则在本次发布时正式开源。

跨层信息流动借助块级注意力残差得到增强;在此基础上,KDA+AttnRes按3:1混合Gated MLA和KDA,从而实现长上下文建模的高效化

每个token在Stable LatentMoE中会从896个路由专家里激活16个;训练处于极高稀疏度时,稳定性由Quantile Balancing和SiTU-GLU维持。

无需进行对比预训练,MoonViT-V2视觉编码器便可从零以next-token prediction展开训练;达到基线效果的同时,优化过程也变得更加稳定。

模型后训练覆盖通用推理、通用Agent、编程Agent三大领域的大规模任务合成,同时接入百万token上下文强化学习基建;近20个内部评测集也已完成完整评估。

02 编程、Agent及视觉能力全面提升,获多维评测验证

从官方公布的评测结果来看,Kimi K3在多个方向体现出较强能力,其中包含视觉理解、编程与Agent任务。

若聚焦编程能力,Kimi 多项测试凸显K3的表现,包括软件逆向Program Bench、终端运维Terminal Bench 2.1,以及超长时序持续开发SWE Marathon。

其中,SWE Marathon、Program Bench均取得第一,Terminal Bench 2.1达到88.3分,与GPT-5.6 Sol接近;在高难度软件工程任务FrontierSWE中,Kimi K3以81.2分位列第二,仅次于Claude Fable 5。

在Agent和知识工作场景中,Kimi K3同样展现出较强的任务执行能力。在网页深度调研BrowseComp、办公自动化Automation Bench、Excel财务建模SpreadsheetBench 2等测试中取得领先,其中BrowseComp达到91.2分,Automation Bench和SpreadsheetBench 2均排名第一。

但面对APEX-Agents、综合白领任务GDPval-AA v2等更接近真实办公流程的评测时,Kimi K3与Claude Fable 5等顶级闭源模型之间仍有差距。

在视觉能力方面,Kimi K3在图表理解CharXiv、文档分析OmniDocBench等任务中表现较强,其中OmniDocBench达到91.1分,超过参与对比的多款模型;但在部分视觉推理任务中,Kimi K3仍存在差距,例如零样本视觉工具任务Zerobench低于Claude Fable 5。

Kimi内部也测试了Kimi K3的工程能力。在GPU内核优化测试中,Kimi K3需自主完成代码分析、内核重写和性能验证,覆盖AttnRes、KDA、MLA等GPU计算任务。结果显示,在最高推理强度下,Kimi K3表现接近Claude Fable 5(含回退机制),并超过Claude Opus 4.8、GPT-5.6 Sol和GPT-5.5。

在知识工作方面,Kimi内部Internal Knowledge Work Bench测试显示,在统一开启最高深度思考模式后,Kimi K3在通用推理、深度文档分析和金融专项三类任务中的表现均超过GPT-5.5和Claude Opus 4.8。

03 生成游戏、设计芯片、分析科研数据:Kimi K3处理复杂任务

Kimi K3发布后,智东西在Kimi K3 Max模式下实测了该模型的多模态与代码生成能力。在要求生成3D横版格斗游戏的测试中,提示词涉及“被霸天虎入侵的破败城市地图”、“低多边形风格”、“5种擎天柱阵营角色”、“5种霸天虎变种敌人”等复杂设定。Kimi K3仅用一次就完成了游戏创建,没有出现错误。

海外开发者@He1s_Sammy在游戏设计场景下对比测试Kimi K3、GPT-5.6 Sol、Fable 5三款模型,向三者输入完全相同的提示词,围绕方案质量、游玩体验、调用成本综合评估。

从测试结果可以确认,Kimi 游戏设计中表现最优的是K3:产出内容拥有自然节奏,也能抓住玩法核心。相比之下,由GPT-5.6 Sol和Fable 5生成的游戏普遍存在节奏过快的问题。

在价格方面Kimi K3:9.5/10,调用成本0.030美元(约合rmb0.2元)、Fable 5:7.5/10,调用成本0.38美元(约合rmb2.57元)、GPT-5.6 Sol:7/10,调用成本0.11美元(约合rmb0.74元)。

根据官方所展示的案例,Kimi K3具备更长程的任务执行能力。在芯片设计任务中,K3利用开源EDA工具和Nangate 45nm工艺库,经过48小时连续自主运行,独立完成芯片构建、优化与验证。

K3在科研领域一次处理391个GWTC-5引力波事件,通过20多个并发子智能体完成分析,最终形成2张表格、7张科学可视化图,并整合10多篇论文的文献内容。

它在GPU编程领域从零打造出MiniTriton,这是一款类似Triton的编译器,负责把开发者所写程序转换成GPU能够执行的代码,在部分场景中性能甚至优于现有工具。

04 结语:全球开发者的工具箱里正迎来中国开源模型

对于Kimi K3,海外开发者的反应和半年前已经不太一样了。半年前,DeepSeek-V3开源时,海外社区的讨论更多是“又一个中国模型”。而到了Kimi K3,话题变成了“它比Claude Opus强”、“开发者正在把Fable换成K3”。

影响力持续扩大,也意味着受到关注和限制的风险随之增加。就在Kimi 美国参议员比尔·哈格蒂和蒂姆·斯科特已提出议案,希望扩大商务部权限并以此限制外国对手接触AI技术,此时K3开源正在引发热议。去年,美国商务部还考虑过将DeepSeek、月之暗面、阿里Qwen团队等中国AI实验室放进实体清单;白宫则考虑过颁布行政令,让使用中国模型的美国企业承担安全事件责任。此外,禁用中国开源模型的提案曾由Anthropic、OpenAI等美国闭源AI企业提出。

对此,商务部将其定性为“典型的人工智能霸权主义行径”。商务部还指出,近200家美国初创企业已敦促政府保留对中国开源模型的访问,因为这些企业认为,切断访问会削弱美国企业竞争力。

既然美国企业本身也在使用中国开源模型,制裁便缺乏合理性。AI能力正由少数企业掌握的技术优势,转化为全球开发者皆可调用的基础工具,而这一趋势不会因一纸制裁令发生改变。

喜欢(0)

上一篇

英伟达出手,AI视频检测工具实测:整体偏弱,但总比没有强

下一篇

OpenAI 用 80 万条消息打破职业边界:43.5% 的工作查询,早已离开自己的工位

猜你喜欢