首页
看点啥
插画图片
首页 看点啥 Kimi K3开源了,本地部署,先备好3000万

Kimi K3开源了,本地部署,先备好3000万

2026-07-29 0

家人们,往后我可能不会继续写大模型本地部署方面的文章了。

天意或许如此:收官绝唱恰好留给了我最喜欢的 Qwen3.6-27B

本地部署 Qwen3.6 比英伟达更会玩,速度提升了 2.5 倍。

就在刚刚,Kimi 如期兑现承诺,正式开源拥有 2.8T 参数的 K3 权重。

权重文件规模竟达 1.56 TB,而它在全球开放权重模型中体量最大,没有之一

先给出结论:

K3 到底有多强

开源阵营中,K3 的领先优势已经拉开断层;放到最强闭源模型中比较,其整体能力则不及 Claude Fable 5 和 GPT-5.6 Sol

Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2

开源第一梯队涵盖 JobBench、SpreadsheetBench、AutomationBench,而 Agent 能力评测中的 BrowseComp 更以 91.2 分拿下全场第一

这样的实力,已经足以让闭源模型感到压力。

。。。订阅价格方面,Kimi 如今也已与 Claude、GPT 看齐,这一点同样值得关注

从每月 49 元到 699 元,Kimi 套餐共有 99 元、199 元等不同价位

定价方面,ChatGPT 从 8 美元、20 美元,升至 100 美元(Pro 5x)和 200 美元(Pro 20x)

我甚至觉得,Kimi 就是参照闭源旗舰模型的定价,再直接乘上汇率。

缺点同样很突出:消耗速度实在太快,即便选择 199 的套餐,也很难扛得住。

模型尺寸

模型文件之所以仅为 1.56TB,是因为从 SFT 阶段起,K3 就对这个 2.8 T参数的大模型开展量化感知训练(QAT),使激活原生采用 MXFP8、权重原生采用 MXFP4

按每参数约 4.25 bit 计算,约合 0.53 字节;这是由于 MXFP4 在 4 bit 权重之外还包含块级缩放因子,估算如下:

2.8T 参数 × 0.53 字节 ≈ 1.5TB

注意,这个 1.56TB 已经是”压缩后”的状态了,别指望像 GLM-5.2 那样”换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化

前文:认真算算本地部署 GLM-5.2 需要花多少钱?

针对 743B 的 GLM-5.2 原版模型,那篇文章给出的私有化部署结论是:仅入场券就要 350 万元

那么,本地部署 2.8T 的 K3 又需要花多少钱?

占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留,参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:

1.56TB × 1.18 ≈ 1.84TB

好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现

坏消息在于,面对这样的显存需求,单机时代已经结束。

据我了解,今年内存和硬盘价格大涨,一台完整的 8×H200 SXM 服务器要从 350 万元起步。

未来内存恐怕还是金子。。。长鑫科技如今的市值和这番涨幅,看看便知

主流推理框架最易分片的区间,正是按 2 的幂次方安排卡数(16、32、64);多机推理涉及张量并行与专家并行,如此规划最省心

Kimi K3 本地部署的三档方案对比

方案一(入场券):约 730 万—800 万元,可上两台共 16 卡

16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档

进入多机场景后,高速网络无法回避,需准备 200G 起步的 RDMA 交换机、光模块和线缆:

项目预算
两台 8×H200 服务器约 700 万元
高速网络及线缆约 30 万—100 万元
合计约 730 万—800 万元

方案二(舒适档):约 1450 万—1550 万元,对应四台共 32 卡

总计 4512GB 显存,装入权重后仍剩约 3TB 空间,此时长上下文和像样的并发才有实现的可能。

方案三(官方推荐姿势):约 2900 万—3000 万元,对应八台共 64 卡

官方技术博客的原意是:更大的高带宽通信域有助于提升推理效率,K3 建议部署在 64 卡以上的超节点配置中

项目预算
八台 8×H200 服务器约 2800 万元
高速网络及线缆约 100 万—200 万元
合计约 2900 万—3000 万元

规模扩大到这里,机房也必须同步升级:单台整机功耗约为 10.2kW,八台合计达到 80kW+,高密机柜、PDU、供电改造和散热都得调整,但与整机采购相比,这些已经算小钱。

最后

前面已经提过长鑫科技,

刚才刷到一个讲述长鑫与合肥故事的视频,心里有些感触。再多说两句

当年,内存掌握在三星、海力士、美光三家手中,价格想涨就涨,供应想断就断,国内厂商甚至没有登上牌桌的资格。合肥拿出真金白银,陪长鑫坐了快十年冷板凳;从流片失败到良率逐步爬坡,一路无人看好。直到今天——进入内存涨价周期后,长鑫终于成了其他人无法绕开的名字。

如今,大模型行业正在重演同样的剧本。

被拿捏到这种地步,怎能不气?如今用 Claude,先是遭 Anthropic 封号,接着在群里痛骂对方霸道,回头却还得求渠道帮忙续上,这姿势实在拧巴。

当然气,却又无可奈何,毕竟人家的模型确实强。

长鑫的故事并没有什么玄妙道理:一个被卡脖子的行业,只有一条出路,那就是自己造出来,并且做得足够好。

GLM-5.2、Kimi K3 们正沿着这条路前进。差距依然存在,但方向已经十分明确:闭源模型每封一次号、每涨一次价、每增加一次区域限制,都等于在向国产开源模型输送用户。

内存领域我们坚持了十年,大模型不必再等那么久。

真到了那一天,要封就封吧,随便封。

本文由作者【老章很忙】原创/授权发布于平台,微信公众号为【Ai学习的老章】,未经许可禁止转载。
喜欢(0)

上一篇

别再追着AI跑了:把它融入这3个每日必经的工作场景,效率至少提升80%

下一篇

别再无脑拉高推理!Opus 5高配反而擅自重构代码乱加戏

猜你喜欢