森之国度70级套装效果全览
2026-07-22 3417281
2026-07-22 0
花旗半导体分析师Peter Lee指出,Kimi K3或引发“杰文斯悖论”——即技术效率提升虽压低单次使用成本,却可能刺激需求激增,最终导致服务器DDR5与eSSD等通用内存的总消耗不减反增。美银证券则强调,中国开源模型能力持续跃升,并不会促使美国AI巨头缩减算力投入;相反,模型差距收窄将抬高头部玩家维持技术领先所需的成本门槛。
Kimi K3正将AI投资者拉回一个根本性命题:当模型变得更便宜、更高效,芯片与内存需求是否必然下滑?花旗与美银证券均给出否定答案——效率红利未必压缩硬件支出,反而可能撬动更大规模的应用落地,从而推高整体资源消耗。
据追风交易台披露,月之暗面推出的Kimi K3具备2.8万亿参数量,支持百万级token上下文窗口及长周期智能体任务。花旗半导体分析师Peter Lee判断,即便Kimi K3实现大规模商用,服务器端DDR5与eSSD等通用内存需求仍将稳步上升。
美银证券半导体分析师Vivek Arya在7月17日研报中亦明确表示,美国前沿AI实验室更倾向于扩大而非削减算力投入。若中国开源模型持续逼近国际一线水平,OpenAI、Anthropic与Google等领军者将不得不依赖更大训练规模、更强推理负载以及更快的产品迭代节奏,以巩固自身差异化优势。
这意味着市场对Kimi K3的价值评估,不能仅聚焦于单次推理成本下降。真正关键在于:低价是否带来更高频次调用、更长任务链路,以及更大量token生成。若答案为肯定,GPU、HBM、DDR5、eSSD、高速网络及推理系统均有望延续增长动能。
花旗将Kimi K3视为AI产业链中“杰文斯悖论”的典型潜在载体。该理论核心在于:技术进步带来的单位使用成本下降,往往激发需求爆发式增长,最终使资源总消耗不降反升。
Kimi K3的核心吸引力正在于其“低成本+高性能”的双重属性。公开报价显示,缓存命中场景下输入费用为每百万token 0.3美元,输出费用为每百万token 15美元。其完整权重计划于7月27日正式开源,目标直指长周期智能体任务支持。
花旗认为,模型价格下探并不会自动削弱硬件采购意愿。恰恰相反,更低门槛可能显著提升开发者与企业部署AI智能体的积极性。而智能体并非传统问答式交互,而是持续性任务流,在执行过程中不断生成、读取与处理token。调用量与任务长度同步攀升,将把单位成本降低重新转化为整体资源占用上升。
因此,Kimi K3对半导体产业链的影响逻辑,并非“单次调用更省”,而是“总token吞吐量是否放大”。这正是花旗持续看好服务器DDR5与eSSD需求增长的核心依据。
Kimi K3融合三大关键技术:Kimi Delta Attention、Attention Residuals与Stable LatentMoE。其中,Kimi Delta Attention旨在优化百万token上下文下的计算开销;Attention Residuals支持跨网络深度选择性表征检索;Stable LatentMoE则进一步提升稀疏激活效率——每个token仅触发896个专家中的16个。
月之暗面官方技术文档指出,该架构使Kimi K3相较K2的扩展效率提升达2.5倍。高稀疏性叠加超长上下文能力,构成其运行成本压缩的关键基础。
但花旗提醒,这并不意味着推理端资源压力消失。Kimi K3仍属重载型模型,实际部署需依赖多节点集群,超级节点配置普遍超过64颗GPU。尤为关键的是,百万级上下文与智能体连续任务将大幅拉升KV Cache占用,进而加剧推理阶段内存带宽与容量压力。
KV Cache规模直接关联DDR5高频存取性能与eSSD缓存/存储能力。对内存厂商而言,决定性变量并非某款模型是否“更省算力”,而是低价之后模型被调用频次、单次调用产出token数量,以及智能体任务链的实际延展长度。
美银证券观点与花旗形成协同印证,但视角更聚焦GPU与AI基础设施层。Vivek Arya指出,中国开源模型实力增强,并不会倒逼美国AI巨头削减算力预算;相反,模型能力收敛将进一步推高领先者维系竞争优势所需的基础设施投入。
美银证券分析称,一旦开源模型持续缩小能力鸿沟,OpenAI、Anthropic与Google将被迫加大训练数据规模、强化学习循环与合成数据构建强度、提升测试时推理负载,并加快产品上线节奏,以此构筑新的护城河。
这一逻辑并不取决于某一时点的榜单排名。大模型排行榜本就动态更迭,但企业真实采购决策锚定的是稳定性、低延迟、高可用性,以及更低的“单位有效产出”综合成本。当模型能力日趋同质化,竞争重心自然向底层基础设施转移——包括GPU、HBM、高速互连网络与推理系统。
因此,美银证券强调,Kimi K3类模型的出现,绝非简单等同于“模型越高效,芯片越少用”。更具现实性的演进路径是:模型竞争白热化,头部厂商为保持代际领先而持续加码算力基建。
Kimi K3采用MoE(Mixture of Experts)架构,实现了模型总参数量与单次推理实际激活参数量的解耦。这一设计虽缓解部分计算压力,却也将基础设施瓶颈从纯算力维度,转向显存带宽、专家路由调度、响应延迟与集群互连能力。
美银证券特别指出,MoE推理对系统提出更高数据搬运效率、专家模块动态调度及大规模计算集群协同能力要求。英伟达已明确提出,现代MoE推理需依托更大GPU域。其测算显示,GB300 NVL72在主流开源模型上的每瓦性能,最高可达Hopper平台的25倍。
CoreWeave围绕Kimi K2.6的实测结果亦佐证此趋势:即便开源MoE模型每次仅激活部分专家,若要在推理速度与性价比上保持领先,仍高度依赖经深度优化的英伟达GB300/GB200 NVL72基础设施。
这意味着,模型权重或将逐步走向标准化与商品化,但支撑其高效运行的GPU、高带宽内存、高速互连网络与推理系统,不仅不会贬值,反而可能因调用量扩张而成为竞争焦点。
美银证券援引OpenRouter平台数据指出,模型调用量仍处于快速增长通道。作为聚合多家模型实验室API的第三方平台,OpenRouter的token消耗量持续攀升,其中中国AI实验室模型的token使用量已超越非中国实验室模型。

该数据虽不能完全映射所有企业与终端用户场景,但至少表明:开发者在开放模型生态中的选择正在发生结构性变化。模型价格下探与能力跃升,正推动调用量持续扩容,而非被单一模型的效率提升所抵消。
企业付费意愿亦同步增强。Ramp数据显示,截至2026年6月,约55%的美国企业已为AI模型、平台或工具支付订阅费用,显著高于美国人口普查局BTOS调查中21%的基准估计值。细分来看,Anthropic企业采用率达42.4%,OpenAI为39.5%。
不过,AI支出分布仍高度集中。头部1%的企业用户,人均月度AI支出高达4833美元;前10%用户为516美元;而整体中位数仅为11美元。科技与媒体行业订阅率达79.8%,大型企业采用率为65.5%,明显高于中型企业(61.3%)与小型企业(48.7%)。

这组数据共同指向一个结论:AI应用仍处扩散初期。若低价模型持续降低使用门槛,未来增量需求或将来自更广泛的企业群体、更多元的开发者生态,以及更丰富的智能体应用场景。
花旗与美银证券达成一致共识:Kimi K3的战略意义,不在于它是否让单次推理更经济,而在于它能否撬动更大体量的工作负载释放。
对花旗而言,最直接受益环节是服务器DDR5与eSSD——长上下文、KV Cache膨胀与智能体任务特性,将持续推高内存访问频次与存储容量需求。对美银证券而言,核心受益方向则是GPU、HBM、高速网络与推理系统,因为模型层面的竞争升级,终将传导至基础设施层的持续投入。
美银证券还补充指出,Kimi K3所涉“45纳米开源EDA”不应被误读为商业EDA工具已被替代。事实上,这恰恰印证芯片设计仍深度依赖EDA流程。在先进制程领域,Cadence与Synopsys等商业EDA厂商依然占据不可替代的关键位置。
本文来自微信公众号“硬AI”,作者:赵颖,编辑:硬AI,36氪经授权发布。