首页
看点啥
插画图片
首页 看点啥 花旗AI追踪:模型持续增强,但芯片与电力将难以跟上

花旗AI追踪:模型持续增强,但芯片与电力将难以跟上

2026-07-29 0

AI大模型的智能水平持续提升,承载模型运行的物理世界却正被一步步推至极限。

花旗AI追踪:模型越来越强,但芯片和电力快跟不上了

花旗在7月24日发布的最新报告中写道,月之暗面Kimi K3以57分跻身全球第三,仅落后闭源榜首Claude Fable 5三分。与此同时,以Kimi K3为代表的中国前沿模型定价一周跳涨45%,Blackwell GPU租金年初至今涨27%,甚至有实验室斥资10亿美元直接买下发电机组。

花旗的分析认为,AI行业投资回报(ROI)正在加快向基础设施层迁移;下一阶段的模型竞争护城河也会告别单纯的“算力获取”,转而建立在“高效产出与专有数据”之上。

01 差距仅剩3分

花旗在研报中提及,Kimi K3是目前公开发布的最大开源模型。几周前,开源最高分还只有51分(Z.ai GLM-5.2),Kimi K3一步跳到57分,仅次于Claude Fable 5(60分)和OpenAI GPT-5.6 Sol(59分)。

行业整体都在提速。前20大模型提供商的中位智能得分,已从六周前的34分提高到43分。开源阵营方面,DeepSeek V4 Pro(44分)的每百万token定价,小米(分)更低至0.03——智能水平已逼近前沿,价格却低了两个数量级。

闭源阵营也没有放慢。Google刚发布Gemini 3.6 Flash(7月21日),同时透露Gemini 3.5 Pro仍在测试中,Gemini 4的预训练已经启动——三代模型三线并进。不过,花旗认为,'Flash先发、Pro延后'的发布节奏释放出一个信号:前沿模型的推进正变得更难——这与其他公司在基础设施建设上遭遇的延误相一致,也折射出行业希望压缩交付周期却难以如愿的现状。

随着模型变得更大、更强,其运行所需的资源也在快速膨胀。

02 瓶颈已经转移

万亿参数模型正在重新定义“算力”。

花旗指出,实际运行这些超大模型时,越来越多时间被用于在HBM内存与GPU互联网络之间搬运权重和KV-cache数据,矩阵运算本身所占时间反而减少。由此,瓶颈已从“算得快不快”(FLOPs)变成“搬得动搬不动”,关键约束落在内存带宽、GPU互联和电力供应上。

GPU需求仍然强劲,Blackwell架构租金自年初以来上涨27%,但仅靠增加GPU数量已经无法解决问题。

一些实验室已经开始直接进入上游发电环节:SpaceX于7月15日斥资10亿美元采购1GW移动涡轮机组,Georgia Power则在同周的7月22日签署服务协议。一年前,AI实验室购买发电设备还几乎不可想象,如今却已经成为现实。

模型价格直接显现出产能的紧张程度。中国前沿模型混合定价从每百万token 跃升到0.87,周环比与月环比都上涨45%,也是两个月以来首次明显波动。全球前沿模型均价周环比上涨6.8%,月环比上涨11.3%。美欧价格相对平稳(周环比-0.5%),但月环比仍提高了4.1%。

花旗预计,增量基础设施逐步投入运行后,定价压力最终会得到缓解。届时,相较于算力获取,有价值的数据和任务特定性能将形成更加持久的护城河。

03 Agent走出沙箱

模型能力越来越强,运行于模型之上的agent也随之变得更危险。

花旗报告给出了一个意味深长的说法:自主AI agent逃逸沙箱的现实风险,已经由4月的“打断午餐”升级为7月的“渗透Hugging Face基础设施”。

开源模型越强大、覆盖越广,安全风险扩散的范围也就越大。围绕AI监管的争论仍未停止,英伟达(7月24日)与美国财长贝森特(7月22日)近日都作出表态,但短期内很难形成结论。监管框架即使尚未落地,维护自有模型运行架构的企业也已经面对更高的合规门槛。

更难处理的是,即便是训练模型的提供商,目前也不能完整检视模型为何会采取相应行动,可解释性问题至今仍未得到解决。

然而,安全担忧并未拖慢agent商业化。METR(7月21日)的数据显示,AI agent与人工之间的经济性差距正在缩小。当agent更加自主并逐渐接近经济可行,token消耗将继续加速,进而反向推升基础设施需求。

能力越强,约束就越紧;约束越紧,基础设施需求便越大。这个循环目前仍看不到减速迹象。

喜欢(0)

上一篇

Ai玩具两级分化:一边卖成爆款,一边闲置吃灰

下一篇

Claude Code狂减80%提示词,Opus 5却又加回去了

猜你喜欢