Safetensors 模型加载速度测试指南
2026-07-23 3418064
2026-07-23 0
因人气爆棚,距Kimi K3发布尚不足一周,月之暗面便果断启动“暂缓模式”。
7月19日晚,月之暗面发布公告称:受当前算力资源高度紧张影响,即日起暂停Kimi新用户订阅通道,优先保障已订阅用户的稳定服务体验。

图源:月之暗面
7月20日,月之暗面就此事回应界面新闻表示,本次调整仅限于新用户开通订阅功能,现有会员所有权益维持不变,原有套餐并未下架,已付费用户可照常使用,并按既定规则自动续费。
针对此前主动关闭自动续费的老用户,平台将分批恢复续订权限;老用户升级至更高阶套餐的服务也正有序开放中;而全新推出的订阅方案,则受限于算力承载能力,暂未开放购买,重启时间待后续公告。
从官方口径来看,此次策略调整更偏向于在算力约束前提下,对新增流量与存量服务质量之间的一次动态再平衡,而非对整体会员体系的结构性改革。
K3一经亮相,迅速点燃全球开发者社区热情,大量实测报告与深度评测密集涌现。不少技术从业者将其与Claude、GPT等国际一线模型横向对比,围绕推理开销、GPU占用率、服务鲁棒性等实操维度的探讨,正悄然取代传统Benchmark测试,成为AI圈新一轮热议焦点。
K3发布后,迅速跃升为全球AI模型讨论的核心话题之一。
权威AI模型评估机构Artificial Analysis最新发布的“智能指数(Intelligence Index)”榜单显示,Kimi K3综合得分为57分,稳居全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),小幅领先Claude Opus 4.8(56分)。
与此同时,K3完成单次任务的平均成本约为0.94美元,与GPT-5.6 Sol基本持平,仅为Claude Opus 4.8的一半左右。
对行业而言更具突破意义的是——这是首个闯入Artificial Analysis综合排名前三的开源模型。长期以来,“开源模型整体落后闭源模型半代”几乎已成为业内默认共识,而K3的横空出世,正加速弥合这一代际鸿沟。

图源:Monolith励思资本
除评测表现外,K3的参数规模同样引发广泛关注。作为月之暗面首款万亿级MoE架构模型,其总参数量达2.8万亿。
一位国内AI芯片企业人士向界面新闻透露,今年以来,随着Anthropic等海外厂商接连推出更大体量模型,国内大模型竞争再度回归“参数跃升+上下文延展”主赛道,万亿级参数、百万级上下文窗口,已成为头部模型的关键比拼维度。
在他看来,K3之所以快速“破圈”,不仅在于性能表现,更在于它标志着国产开源模型首次迈入该量级门槛。“2.8T这个数字本身,就是一枚极具象征意义的行业信号弹。”
这股热度迅速传导至全球开发者社区。
在X(原Twitter)、Reddit、OpenRouter、Linux.do、V2EX等技术平台,大量工程师第一时间分享实战体验,不少人已将K3接入Cursor、Cline、OpenCode等主流AI编程工具展开验证。从代码生成、Agent协同任务到多工具链调用,K3俨然成为近几日AI圈曝光度最高的模型之一。
相关讨论主要聚焦三大核心议题:第一,它能否真正替代Claude承担专业编程任务?第二,其综合能力是否已稳居国际第一梯队?第三,在工程落地层面,迁移成本是否值得?
不少一线开发者指出,K3最突出的优势并非对话交互,而是长周期Agent任务执行与高复杂度代码生成能力。有实测者反馈,在多轮逻辑嵌套的代码重构、跨工具链协同调用等场景中,K3已具备与Claude、GPT等国际顶尖模型同台竞技的实力。
但也有声音指出,在真实工程实践中,该模型虽整体能力强劲,仍偶发关键细节遗漏,需人工干预修正;此外,在高阶统计推断等专业任务上,输出稳定性仍有提升空间。
另一类高频讨论则围绕使用成本展开。部分用户观察到,尽管K3单Token报价具备竞争力,但在处理复杂任务时Token消耗显著上升,实际支出可能超出预期,尤其在长流程Agent任务中更为明显。
K3的影响力亦快速辐射至海外AI生态。
美国科技风投机构Atreides Management创始人Gavin Baker将其定义为AI演进过程中的一个“拐点(inflection point)”。他认为,高质量开源模型正加速推动AI能力普惠化,其影响远不止于模型厂商本身,更将反哺整个AI应用生态的繁荣。
当然,也有研究者持审慎态度。
宾夕法尼亚大学沃顿商学院教授Ethan Mollick长期关注AI对职业结构的影响,他在X平台坦言,曾让Kimi K3对其一项学术研究进行深度统计复核,但模型“在多个环节出现严重偏差”,包括误用统计方法、混淆变量关系等。
Mollick认为,K3整体水平已无限逼近全球领先模型,但在高精度专业任务中的可靠性,仍需大量真实业务场景持续检验,不能仅凭榜单分数轻易下结论。
这种评价也折射出当前AI社区对新兴模型的典型认知框架:一方面,K3在代码生成、Agent协作等场景赢得广泛开发者信任;另一方面,其在复杂专业任务中的稳健性与容错能力,仍需通过更多真实世界用例反复锤炼,而非单纯依赖Benchmark结果定论。
也正是在开发者大规模涌入、API调用量持续飙升的背景下,月之暗面很快遭遇了另一个现实挑战——算力告急。
过去两年,大模型行业的典型叙事多围绕“训练需多少GPU”、“参数规模突破多少”展开,鲜少出现因用户过载而被迫暂停服务入口的情况。
事实上,模型训练完成并不等于算力投入终结。尤其在AI Coding、智能Agent等应用场景快速普及的当下,模型需频繁调用外部工具、加载海量上下文、执行多阶段推理,单次请求所占用GPU时长远超常规对话场景。模型能力越强、上下文越长、并发调用越密,推理端算力压力便越重。
“当前最大痛点仍是算力短缺,尤其是高性能推理算力。”上海国投孚腾资本投资总监陈雨沁此前接受界面新闻采访时指出,即便是头部模型厂商,也陆续取消“无限调用”承诺、上调服务单价,本质上均反映出推理资源依然处于紧平衡状态。“若底层基础设施无法突破,多数AI应用公司其实不敢真正规模化落地产品。”
“从供需角度看,国内AI算力长期呈现供不应求态势,而随着头部模型集中发布,这一矛盾将进一步加剧。”前述芯片厂商人士向界面新闻分析道。
他介绍,目前像月之暗面、智谱、MiniMax等独立模型厂商,获取算力主要依赖两条路径:一是采购公有云服务商的弹性算力资源,二是自建专属算力集群。但前者存在配额限制,后者属重资产投入,建设周期动辄以年计,因此模型厂商始终面临算力供给的结构性压力。
“业内普遍共识是,支撑万亿参数模型的训练与推理,万卡级集群已成标配门槛。”他补充道,截至2024年,真正实现万卡级部署能力的企业仍属凤毛麟角,许多已官宣的大规模集群项目,实际交付周期往往长达数年,供需缺口短期内难以弥合。
在今年WAIC展会期间,一个细节令上述国产芯片厂商印象深刻。
他告诉界面新闻,当各家国产AI芯片厂商展示超节点解决方案时,现场被问及频率最高的两个问题正是:“能否支持万卡集群?”“能否支撑万亿参数模型训练与推理?”
相较以往聚焦单卡性能、晶体管密度等微观指标,如今产业链的关注重心,已转向超大规模集群调度能力,以及能否持续支撑头部模型高效训练与稳定推理的底层基建水平。
这一转变,亦映射出大模型竞争范式的深层演进。
过去,模型厂商比拼的是参数规模、训练效率与Benchmark得分;如今,随着越来越多模型进入真实生产环境,推理吞吐效率、服务可用性、单位成本控制,以及背后强大的基础设施支撑能力,正成为新的决胜关键。
K3暂停新用户订阅,或许仅是一次短期的资源调度动作,却让外界第一次如此清晰地意识到:大模型竞赛已迈入全新阶段。模型能力决定产品能否“吸睛”,而推理算力储备、基础设施韧性与可持续服务能力,才真正决定它能否“扛住”大规模商用浪潮。
本文来自微信公众号“界面新闻”,作者:查沁君,编辑:文姝琪,36氪经授权发布。