首页
看点啥
插画图片
首页 电脑数码 对话芯展速许玮:“内存墙”下 AI缺的是GPU的“放大器”

对话芯展速许玮:“内存墙”下 AI缺的是GPU的“放大器”

2026-07-24 0

Token经济时代,衡量AI价值的标准,正从模型能力转向Token生产效率。AI因此从工具演变为新的关键生产要素,而存储也从单纯的资源供给,升级为支撑Token持续、高效生产的系统能力。

过去几年,AI行业信奉一个朴素的逻辑:算力不够,就堆更多的GPU、更贵的GPU。但对于中小企业和个人开发者来说,通常只能是望“卡”兴叹。而在算力欠缺的背后,更需要搞明白一个事实,那就是GPU有效算力利用率仅30%-60%。

2026 年 5 月 Dell World 大会上,NVidia CEO 黄仁勋对彭博表态:"当前 AI 产业最大的制约因素根本不是 GPU 算力,而是存储",并解释"GPU 大部分时间都在等待数据"。当大模型推理从“以算力为中心”走向“以效能为核心”,数据和存储才是下一阶段AI基础设施的核心命题。


"AI的竞争,本质上是算力效率的竞争。"芯展速产品副总裁许玮表示,推理成本的优化已从单纯堆叠算力,转向数据和存储“存算协同”的系统级效率提升。要做的是如何在有限的条件下,去尽最大可能挖掘每一块GPU的利用率,从而去实现算力的平权。

内存墙,AI发展的新瓶颈

算力,是AI时代绕不过去的词语。

这几年,AI产业的竞争几乎围绕"算力"展开。无论是英伟达GPU持续供不应求,还是云厂商不断扩建AI数据中心,行业普遍认为,只要拥有更多GPU,就意味着拥有更强的算力能力。然而,随着大模型推理和AI Agent进入规模化应用,一个越来越明显的现象开始出现:GPU越来越强,但真正能够释放出来的算力却没有同步提升。

许玮透露,即便是英伟达最新一代GPU,在实际推理场景中的有效算力利用率也普遍只有30%至70%,大量昂贵的计算资源并没有持续处于计算状态,而是在等待数据。

问题的根源,在于AI计算体系出现了越来越严重的"算存失衡"。

AI推理并不是一个单纯的计算过程,而是一个完整的数据流动过程。模型参数需要不断读取,KV Cache需要持续更新,数据需要在GPU、显存、CPU以及存储系统之间频繁交换。计算、存储、通信三个环节环环相扣,任何一个环节跟不上,都将拖慢整个系统的效率。

过去二十年间,GPU计算能力实现了跨越式增长,整体算力提升约6万倍。相比之下,显存容量却仅增长几十倍。计算能力与存储能力增长速度的巨大落差,使得数据供应速度远远赶不上GPU计算速度,一道越来越宽的"内存墙"由此形成。

许玮指出,“内存墙”让昂贵的算力芯片普遍处于“吃不饱”的等待状态,正在成为AI推理性能的核心瓶颈。现在,这一矛盾进一步被放大。算力越堆越多,能用的却越来越少。

随着模型参数不断增加、上下文窗口持续扩展,以及AI Agent需要处理更长、更复杂的任务链路,推理过程中KV Cache规模迅速膨胀,占用大量GPU显存。当显存资源不足时,系统不得不频繁在GPU、CPU内存和存储之间进行数据交换,甚至重复计算历史Token,不仅增加了推理延迟,也进一步降低了GPU利用率。

从本质上来看,“内存墙”并非单纯的存储容量不足,而是计算能力增长速度远远超过数据供给能力所形成的系统性瓶颈。当算力与存储无法保持同步演进,GPU便难以持续"吃饱",整个AI基础设施的性能天花板也不再由计算芯片决定,而开始受到存储架构和数据流动效率的制约。

“因此,对于当前AI产业而言,真正需要解决的问题,已经不是如何继续堆叠更多算力,而是如何打破‘内存墙’,让已有算力得到更充分、更高效的释放。”许玮说道。

不堆算力,用存储扩展显存

事实上,无论是消费级的RTX 5090还是数据中心的B300,都同样面临"内存墙"带来的制约。GPU计算能力不断提升,但显存容量和数据供给能力的增长却相对有限,导致算力增长与系统整体效率并不同步。

当下,大量开发者和企业希望利用消费级GPU进行AI推理与微调,但面临两个核心瓶颈:一个是多卡并行效率受限:消费级GPU默认P2P通信被限制,多卡数据需经CPU中转,延迟高,数据传输路径被迫拉长。资源消耗大,大量的PCIe带宽被低效的数据搬运所浪费,系统整体性能被卡在“通信”环节。

另一个则是长上下文处理困难:传统KV Cache显存利用率通常低于40%,极大地限制了单卡兵法能力。并有严重的内存碎片化问题,超长文本(8K+ token)易触发OOM,长文档问答几乎不可用。

面对日益突出的"内存墙",行业并非没有应对方案。最直接的路径,依然是继续提升算力,去堆更贵的芯片。只是,这样的做法虽然能够提升性能,但成本却呈现非线性增长——投入不断增加,性能收益却难以保持同样幅度的提升。

“你可以极端地去堆最贵的GPU卡,也不能说他错,只不过这种所谓的标准配置是一种商业妥协。”在许玮看来,用户不应该只看GPU参数,而要看整个系统的效能。

所谓系统效能,不仅包括GPU自身的计算能力,更包括数据如何流动、显存如何利用、多卡之间如何通信,以及整个推理过程能否保持高效率。对于企业而言,真正需要关注的不是拥有多少TOPS,而是在训练和推理过程中,能够以多高效率完成Token生成。

在这样的背景下,行业开始出现另一条技术路线——用存储扩展显存,不是做更贵的专业卡,而是释放消费级GPU的潜力。芯展速也是选择的这一路径,并在WAIC 2026上展示了AI90解决方案。许玮称,“推理成本的优化已从单纯堆叠算力,转向数据和存储‘存算协同’的系统级效率提升。”

据介绍,针对P2P通信的缺失,AI90通过智能P2P互联技术解锁硬件P2P,优化GPU间的数据通路,使消费级GPU在跨卡通信时无需再经过CPU和主机内存中转,实现GPU直连,实现GPU之间的直连,提升多卡并行效率。

至于KV Cache的不足问题,AI90通过将KV Cache从HBM卸载至高性能SSD,构建"HBM+DRAM+SSD"三级存储体系,让原本受限于显存容量的大模型推理拥有更大的缓存空间,缓解长上下文场景下的显存压力。

"AI的竞争,本质上是算力效率的竞争。"许玮表示,当大家都在堆GPU的时候,我们选择从存储侧切入,是为了让每一块GPU都能真正发挥出全部算力。

算力平权,仍需整个产业链作答

不做GPU,但做GPU的“放大器”,AI90更强调的是AI部署成本的下降,中小企业、开发者甚至个人用户,也能够基于消费级GPU部署本地AI,而不必完全依赖昂贵的数据中心资源。


根据芯展速在WAIC展会上公布的数据,在AI90的解决方案下,Llama 3 70B模型推理,4卡5090集群吞吐量从120 tk/s提升至610 tk/s;64K上下文首Token延迟从27.99秒降至0.564秒,显存利用率从30%-40%提升至85%-95%,支持上下文从约8K扩展至128K+。

不过,现阶段仍然有很多工作要做,比如异构GPU架构的适配,以及更多生态伙伴共同支持。

在许玮看来,“这是一个超千亿的市场,用存储扩展显存,本质不是为了和谁竞争,更多的是希望让每一块钱的算力投资产出更多Token,让每一家中小企业和开发者都用得起大模型。”

“将存储变为‘算力的放大器’,这不仅是技术选择,更是AI基础设施走向普惠的必然路径,算力平权的‘iPhone时刻’也终会到来。”(文 | 志读科技,作者 | 杜志强,编辑 | 杨林)

喜欢(0)

上一篇

丘成桐邀王虹邓煜回国任教:清北斗了20年竟发现对手不是彼此

丘成桐邀王虹邓煜回国任教:清北斗了20年竟发现对手不是彼此

下一篇

理解:生成:行动原生统一:这款国产大模型走向系统级交付

理解:生成:行动原生统一:这款国产大模型走向系统级交付
猜你喜欢