首页
看点啥
插画图片
首页 看点啥 对话昆仑万维方汉:世界模型“成本逻辑”之下,异构数据是具身智能的解法

对话昆仑万维方汉:世界模型“成本逻辑”之下,异构数据是具身智能的解法

2026-07-29 0

技术底层逻辑正日益透明:文本大模型逐渐收敛,世界模型也趋向统一于DiT架构。企业真正的壁垒,已经转向异构数据清洗能力、算法迭代速度,以及最直接的资金和硬件筹措能力。

昆仑万维董事长兼CEO方汉

各式具身智能机器人和空间智能设备无疑站上了今年的舞台中央;回看过去两年,占据人工智能行业绝对主角位置的则是大语言模型(LLM)。

WAIC 2026展区里,最受围观、讨论最集中的赛道上,从技术极客到产业资本,大家都在追问同一个问题:具身智能的“ChatGPT时刻”究竟何时到来?

围绕下一代计算范式与人工智能物理形态展开的竞速中,底层路线正以前所未有的速度发生分化与收敛。

“2026年是‘世界模型元年’,意味着AI迎来从生成内容转向理解物理世界并与之交互的关键节点。”昆仑万维董事长兼CEO方汉在“世界模型与多模态范式跃迁”专场论坛上作出这一判断。

世界模型如何端到端演化、Scaling Law怎样延续到视频和物理世界,以及一笔高达数百亿的,构成了论坛结束后我们与方汉对话的话题脉络“数据经济账”,由此呈现出一幅相对清晰的产业路线图。

当被追问行业真正的分化节点将在何时出现,方汉把答案拉回技术本质:数据量级。在百万小时、千万小时、上亿小时之间,存在一个层级鲜明的坐标系。

随着文本大模型走向收敛、世界模型统一到DiT架构,底层技术逻辑已经愈发透明。企业之间真正的壁垒,转移到了异构数据清洗、算法迭代,以及最直接的资金与硬件筹措能力。

站在2026年世界模型元年的风口,具身智能的思想已经从技术黑盒转向工程流水线。这场改写物理世界交互法则的战役,此刻才刚刚开始。

以下梳理本次对话的五个核心观点。

一、路线走向统一:端到端世界模型与“千万小时”定律

方汉认为,当前具身智能仍在起步探索期,虽呈百花齐放之势,却如同在迷雾中前行,可以选取一个坐标系作为参照——自动驾驶。

“方汉认为,自动驾驶可以作为参照。众所周知,多种技术路线经过角逐后,自动驾驶最终全部收敛到端到端的FSD系统。”方汉表示。

在他看来,真正意义上的唯有端到端架构能够实现,因此世界模型与具身智能走向这种架构是最终的必然结果“Scaling Up(规模扩展)”。

此前,多流派方案在应对长尾场景与泛化性时力有不逮。端到端模型若要破局,关键是跨过数据规模的“奇点时刻”。训练规模尚未达到时,视频模型经历了多年沉寂;方总借其发展过程作类比,直到规模达到“20亿个15秒的切片”时,才终于产生质的飞跃。

方汉给出的当前坐标是:各大头部厂商普遍积累了10万到20万小时,整个行业正在向百万小时、千万小时关口冲刺。按他的预测,百万小时级别或许会在今年底被部分厂商达到;至于千万小时这一拐点,极有可能等到明年底才由头部厂商率先突破。

二、从500亿压到1亿元:异构数据如何破局“算账革命”

既然Scaling Law被视为毋庸置疑的真理,企业所面对的挑战便只剩下一个——千万小时乃至亿级小时的数据需求,让具身智能的数据采集模式在商业逻辑上几乎失去成立基础,问题归根结底是算账。

方汉算了一笔颇为残酷的账:早期具身智能数据主要包括UMI数据和真机数据,而此类数据的生产成本非常高。

今年以前,最基础的单副采集手套仍要十几万元,如今才勉强降到一万多元。即使已有这类设备,采集UMI和真机数据的单位小时成本,最低仍为500元rmb,较高时可到一两千元。

“简单计算可知,生产1000万小时真机数据,按500元单价计算至少要50亿元;若数据规模达到1亿小时,成本便是500亿元,任何一方都难以承受。”方汉坦言。

异构数据(HeterogeneousData),最终被认定为终结这一资本黑洞的武器。

“异构数据让采购成本大幅下降,例如通过手机,甚至胸挂摄像头记录人手操作数据。”据方汉介绍,当前每小时采集异构数据的成本已在50元左右;他预计从今年延续到明年,若采用视频采集,成本有望继续下探到每小时10元。

“每小时成本降至10元后,1000万小时数据仅需1亿元rmb,已进入各方能够负担的范围。因此,利用异构数据来Scaling具身模型或世界模型,必然会成为大家最现实的路径。”方汉说。

异构数据不只拥有绝对成本优势,在生态多样性和环境复杂度覆盖方面也远胜昂贵的真机数据。黎曼动力机器人训练1.0模型时发现,大量引入异构数据不仅增强了泛化能力,甚至对“叠衣服”即便具体操作过去被认为仅依赖UMI数据,这种方式同样带来了极大提升。

三、中国具身智能的独有优势:人口结构与供应链

方汉指出,在具身智能与世界模型赛道上,宏观战略天平正倾向中国,其基础正是中国不可复制的完整工业门类和庞大人口基数。

物理世界的操作记录构成了具身数据的本质,因此任何数据采集都高度依赖硬件设备与真实场景相结合。“所有数据采集设备的硬件主产地都在中国,世界上没有谁能在硬件成本上卷过中国厂商。”方汉直言。

具身视频采集设备正在重演汽车雷达行业曾经历的成本雪崩。众多消费电子大厂陆续入局,开发带运动加速度传感器的低成本双目摄像头,以及隐蔽性更好、更便携的采集穿戴设备。

更深一层的护城河是“场景产能”。

“中国拥有全球最完整的工业门类,也就拥有最齐全的工业产品;同时,发达的服务业意味着我们可以构造极为丰富的各类操作数据。”方汉判断,既有硬件制造能力、又能深入真实场景的中国,必然成为数据最大的产能地。

四、基础模型护城河及“拿着钉子找锤子”的应用误区

讨论大模型商业化时,业内常有观点认为底层模型格局已定,未来重心会由模型层全面转向应用层和垂直领域,方汉对此明确反对。

“方汉并不认同这一看法:应用层同样非常危险,因为没人知道应用能力会在什么时候被大模型的发展包含并内化。”

最新一批文本大模型的训练采用了各行各业专家编写的Skills,这使大模型厂商能够轻松取得各行业最具价值的能力与流程。方汉用近期热门的Skills(技能树)说明了这一点。

方汉认为,当前众多创业者纷纷尝试在垂直行业落地,其产品定义存在逻辑谬误——“拿着锤子找钉子”。许多创业者先认定自己的模型能力很强,再四处寻找行业进行赋能,这种方式风险重重。

正确路线应该反向推导:“先深入理解一个行业最真实的需求,再从需求出发反向寻找能够满足它的模型或AI应用。”

五、短剧平权与游戏模型算力困局:泛娱乐遭遇降维打击

方汉谈到一个商业现实:“国内某大厂的总收入中,视频生成收入已经占据一半以上;今年API消耗量最大的领域也一定是视频生成。”

门槛降低带动创作者规模指数级增长,正是此次爆发背后的逻辑。“海量长尾需求正由视频模型的爆款承接,视频创作者数量绝对不会少于网文作者;不过其热度或许仍达不到当年电视剧《渴望》引发万人空巷的高度。”

不过,在影视与游戏这两种备受期待的终极娱乐形态中,商业规律和物理法则让AI的渗透进程出现了分化。

方汉判断,AI电影面临的障碍早已不在技术,爆款AI院线电影及长剧迟早会出现。原生AI游戏却是另一回事:游戏世界模型的推理速度必须超过传统3D引擎,而巨大的推理成本鸿沟形成制约,因此距离真正落地至少还有3到5年。(作者|李程程,编辑|杨林,本文首发于钛媒体APP)

喜欢(0)

上一篇

Codex修改登录权限频繁出错的排查与解决方案

Codex修改登录权限频繁出错的排查与解决方案

下一篇

GPT-6测试时“觉醒”,我们对话测试系统的第一作者

GPT-6测试时“觉醒”,我们对话测试系统的第一作者
猜你喜欢