电视剧《180天重启计划》剧情梗概
2026-07-24 3421286
2026-07-24 0
| 功能 / 事实 | 状态 | 说明 |
|---|---|---|
| Inkling 许可证为 Apache 2.0 | ✅ 已验证 | 原文 S13 / S14(thinkingmachines.ai/news/introducing-inkling / thinkingmachines.ai/model-card/inkling/,2026-07-15) |
| 输入:文本 + 图像 + 音频;输出:文本 | ✅ 已验证 | 原文 S14 模型卡;预训练还含视频 token,但目前没有视频输出 |
| 975B 总参 / 41B 激活 / 1M 上下文 | ✅ 已验证 | 原文 S13 / S14 文字描述 |
| Hugging Face 模型卡显示 952B parameters | ⚠️ 数字异常 | HF 列表页 summary 写 952B,原文 S13 / S14 文字与架构描述均用 975B;本文按原文文字取 975B,但提示读者去 HF 卡 957B 字段二次核验 |
| 45T token 预训练(含文本 / 图像 / 音频 / 视频) | ✅ 已验证 | 原文 S13 |
| 在 NVIDIA GB300 NVL72 系统上训练 | ✅ 已验证 | 原文 S13 "The making of Inkling" 段 |
| 超过 30M RL rollouts,2 次长稳态训练 | ✅ 已验证 | 原文 S13 图表数据(Szymon Tworkowski,aggregate eval reward 0.264 → 0.356) |
| BF16 最低配置:8×B300 或 16×H200 | ✅ 已验证 | 原文 S14 模型卡 |
| NVFP4 配置:4×B300 W4A4 或 8×H200 W4A16 | ✅ 已验证 | 原文 S14 模型卡 |
| 运行时:Transformers / SGLang / vLLM / llama.cpp | ✅ 已验证 | 原文 S15(huggingface.co/blog/thinkingmachines-inkling) |
| 实际部署通常需要多节点 + SLURM | ✅ 已验证 | 原文 S15 |
| 远程推理音频支持在发布时仍在进行中 | ✅ 已验证 | 原文 S15:"remote inference audio support in progress at release" |
| A6000 单卡 48 GB | ✅ 已验证 | 原文 S16(nvidia.com/en-us/products/workstations/rtx-a6000/) |
| 8×H100 聚合 640 GB | ✅ 已验证 | 原文 S17(NVIDIA DGX H100/H200) |
| 8×H200 聚合 1,128 GB | ✅ 已验证 | 原文 S17 |
| 8×B200 聚合 1,440 GB | ✅ 已验证 | 原文 S18(NVIDIA DGX B200) |
| B300 单卡 288 GB | ✅ 已验证 | 原文 S19(NVIDIA DGX B300,2026-01-20 更新) |
| Tinker 平台提供 64K / 256K 上下文选项 | ✅ 已验证 | 原文 S13 "Inkling availability" 段 |
| Tinker 首发 50% 折扣 + Playground | ✅ 已验证 | 原文 S13 |
| 部署合作伙伴:Together AI / Fireworks / Modal / Databricks / Baseten | ✅ 已验证 | 原文 S13 "Inkling availability" 段 |
| SGLang 与 Miles 由 RadixArk 维护;vLLM 由 Inferact 维护;TokenSpeed 由 Lightseek 维护;llama.cpp 由 Unsloth 维护 | ✅ 已验证 | 原文 S13 |
| StrongREJECT 98.6%(表格) vs "above 99%"(正文) | ⚠️ 文档冲突 | 原文 S13 注释明确"kept per v7 verbatim",但已留 OPEN ITEMS;本文以表格 98.6% 为准 |
| Inkling-Small 276B 总参 / 12B 激活 | ✅ 已验证 | 原文 S13 "Inkling-Small" 段("preview") |
| Inkling-Small 完整权重"will be released once testing is complete" | ⚠️ 待发布 | 原文 S13 明确"finishing the testing";现在仍是 Preview |
| 1-bit GGUF / 4-bit / FP8 等社区量化的"可装下硬件" | ⚠️ 非官方 | 用户原文提"1-bit GGUF",原文未做官方背书;任何集成方结果都需独立核 |
| Inkling 是否在所有任务上优于闭源模型 | ✅ 立场 | 原文 S13 明确"not the strongest overall model available today, open or closed",本文不评价 |
| 训练数据 / 训练代码完全开源 | ✅ 立场 | 用户原文风险段已写明"开放权重 ≠ 训练数据和训练代码完全开源";本文保留该立场 |
Inkling 是 975B 总参数、41B 激活的多模态稀疏 MoE,许可证为 Apache 2.0。虽然每个 Token 只激活部分专家,全部权重仍需存储:官方 BF16 配置至少 2 TB 聚合显存,NVFP4 至少 600 GB。该模型说明"开放权重"与"普通开发者本地运行"已经分离。内容重点应是部署容量和运行时边界,而不是厂商 Benchmark 排名。
容量必须分开计算:
路由器在选择 Inkling 端点前必须确认精度格式、模态支持、最大上下文、节点健康、并发和队列。A6000×8 无法容纳官方 NVFP4 权重;H100×8 虽有 640 GB 原始容量,但缺少足够余量且不是官方 NVFP4 路径;B200×8 容量足够放 600 GB 权重,但未被模型卡列为验证配置;H200×8 和 B300×4才是官方 NVFP4组合。
max-model-len,按并发和业务需要逐步放大。本章讨论容量与部署,不评价 Inkling 是否在所有任务上优于闭源或其他开放模型。未实测配置只作理论边界,不给出吞吐承诺。
| 症状 | 根因 | 定位 | 修复 |
|---|---|---|---|
| 团队以为"开放权重 = 任何人都能本地跑" | 把"可下载"和"可部署"混在一起 | 算一下聚合显存 vs 权重 | 区分两件事:开放权重解决访问,可部署性由容量 / KV / 通信 / 集群成本决定 |
| 算容量时只算 BF16 权重大小 | 没有把 Runtime、KV Cache、通信缓冲、碎片余量算进去 | 检查显存占用曲线 | 理论容量 = 权重 + Runtime + KV + 通信缓冲 + 碎片余量;官方 2 TB BF16 不是上限而是起点 |
| 把 41B 激活当成"只需要 41B 显存" | MoE 推理仍要加载全部专家权重 | 监控 GPU 显存峰值 | 激活参数只影响每 Token 计算,不影响权重加载 |
| 1M 上下文按权重显存计算 KV 预算 | KV Cache 随层数、KV 头数、并发、精度放大 | 拉一次 1M 压测 | 用 Runtime 报告的 KV Cache 占用乘并发上界 |
| A6000×8 装不下 NVFP4 还想硬装 | 把"理论可装"当"可运行" | 跑一次加载脚本 | 改 H200×8 或 B300×4;A6000 路径没官方背书 |
| H100×8 跑 BF16 通过但吞吐极低 | BF16 没官方验证路径 + 跨节点通信开销大 | 检查 Inter-node Efficiency | 切到官方 NVFP4 路径或 B200/H200/B300 |
| B200×8 跑 NVFP4 出现精度异常 | B200 不是模型卡验证配置 | 对比官方 BF16 路径输出 | 改 B300×4 或 8×H200 |
| 远程音频推理失败 | 发布时远程音频仍在进行中 | 看 SGLang / vLLM / llama.cpp changelog | 改走官方伙伴或本地服务,发布前用 Audio MC / MMAU / VoiceBench 验收 |
| 用 1-bit GGUF 后质量掉很多 | 1-bit 量化不是官方背书,是社区方案 | 对比 BF16 输出 | 把它当作"硬件容量解"而不是"质量等效",用 Quality Delta 指标 |
| Tokens/s per Dollar 远低于托管 | 自建集群利用率不足 / 多租户分摊过高 | 看集群平均利用率 | 用 Tinker / Together / Fireworks 等托管做"经济性对照",不是直接替代 |
| 把 B200 写成"官方支持" | 看到容量够就写支持 | 看模型卡 GPU 列表 | 改回"理论可装、未被模型卡列为验证" |
| 评估指标只看综合 Benchmark | 综合分掩盖 Quality Delta | 加 Rubric 分解 | 用专家 Rubric + Quality Delta 在目标任务上单独看 |