首页
看点啥
插画图片
首页 电脑数码 财经观察:从动脑到动手,中国机器人走进真实场景

财经观察:从动脑到动手,中国机器人走进真实场景

2026-07-24 0

来源:环球时报

财经观察:从“动脑”到“动手”,中国机器人走进真实场景

【环球时报报道 记者 杨沙沙】刚刚结束的2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC),向全世界展示了一个机器人穿行其中的未来世界:展馆内,机器人不仅会“思考”,更开始“动手干活”,从复刻中式茶道、制作沙拉,到鉴别鞋品真伪、组装电池模组,具身智能已渗透进制造、餐饮等真实场景;展馆外,仿生机器人交警站在上海街头指挥交通,动作流畅、神态逼真,成为一道兼具科技感与温度的亮眼风景。从工业产线到城市街巷,人工智能(AI)正以前所未有的深度和精度融入物理世界的运行肌理。多家头部企业向《环球时报》记者确认,中国在机器人本体制造与大模型能力上均已跻身国际第一梯队,且在应用落地层面与制造业结合紧密。然而,行业专家也坦言,从“数字世界”走向“物理世界”,仍需要跨越最难的门槛——机器人“大脑”虽已足够聪明,却尚未真正理解物理世界的规则。

从“大脑”到“身体”,AI学会“上手”干活

WAIC开幕第二天,香港生产力促进局首席数码总监、内地业务首席执行官黎少斌抵达上海后,一头扎进上海世博展览馆现场,迫不及待想去看看展会上有哪些“把AI和机器人变成商业价值的案例”。香港生产力促进局在世博展馆也有展台,展示了由生产力局研发的工业人工智能应用平台“HKPC天工开物”、工业人形机器人智能制造平台等。

站在香港“桥头堡”的角度,一边连接内地的应用能力,一边对接海外市场机遇,黎少斌告诉《环球时报》记者,生产力局正在对接两边庞大的需求。“以前中企出海是看得见的产品——汽车、设备。现在,这些产品都变成了智能体,车是智能车、设备有AI大脑”。

距香港生产力促进局展台几步远,就是位于展馆一楼大厅C位的“模登时代·伙伴之城”沉浸式展区。在这里,黎少斌特别关注的“把AI和机器人变成商业价值的案例”有着丰富的场景呈现。

“国风穿搭”的智元轮式双臂机器人,用机械臂完成‌投茶、注水、浸泡、分茶‌等精细操作,完整复刻中式茶道工序;一旁的智元双足人形机器人,则与工作人员展开乒乓球对打,通过视觉感知乒乓球轨迹,精准预判落点和来球姿势,挥拍、击球;希夕智能机器人化身“AI大厨”,左右手配合,抓取食材、摆盘、调味出餐,展示了具身智能落地餐饮产业的场景;千觉机器人与‌得物‌联合展示了‌AI鉴别机器人‌,机器人把鞋垫取出来,通过高清摄像头采集各个鉴别点,如鞋跟、鞋舌等,像老师傅一样鉴定,通过采集触觉数据辨别出鞋的真假。

最令人震撼的,是现场复现的一条苏度科技适配宁德时代的“电池模组产线”。《环球时报》记者看到,4台机器人在流水线一字排开。设备启动后,负责“上料”的第一台机器人转身拿取身后的电池盒,然后放置到产线上;在第一台机器人启动的同时,第二台负责“电芯装配”的机器人已经在取身后的电芯,等电池盒就位后,这台机器人刚好转身,缓缓地将两个《新华字典》大小的电芯,精准装入面前的电池盒;第三台机器人右手持扫码设备,左手轻轻擦拭电芯上的灰尘,完成扫码后,电池盒接着传递到下一个工位;第四台机器人负责收尾工作,用夹爪将装配好的电池盒从产线取下。

记者计时发现,上述流程大约用时3分钟以内,而装配10组20个电芯需要大约15分钟。据苏度科技软件工程负责人介绍,机器人目前的速度跟人工比仍有差距,未来希望能接近甚至超过人工效率,“机器人大脑推理速度决定整个操作的流畅度”。该工作人员表示,从“数字世界”走向“物理世界”,产业界现在面临的最大瓶颈是“具身大脑”——让机器人真正拥有智能,“下一步要做的,是用一个聪明的大脑把硬件的全部潜能发挥出来”。

“大脑”够聪明,为何“身体”还不够灵?

在商汤科技展台旁的“烧卖购”,记者看到了同一大脑训练场景下,两台机器人呈现的两种不同工作状态:一台戴着鸭舌帽的“店员”面对记者下单,从接单、取饮料到递送,全程仅用15秒,动作丝滑流畅,一气呵成,俨然一副“老员工”的架势;而另一台机器人,则显得比较慢,每一个动作都在思索,下单取物耗时更长。

在现场观察机器人运营的商汤善惠首席技术官(CTO)刘恒一接受《环球时报》记者采访时表示,上述两台机器人都采用商汤科技多模态基座模型——商汤日日新SenseNova-U1 Pro。“快的那台(机器人)相当于‘正式员工’,已经提前训练过一段时间,模型迭代得比较好;慢的那台刚开始学习,相当于‘实习生’。”刘恒一表示,用不了两个月,“实习生”就会赶上“正式员工”,因为机器人学习迭代的速度会越来越快。

‌ 刘恒一告诉记者,商汤机器人学习的,是在真实运营中产生的真机数据,不是实验室数采场景的数据。而数据正是决定机器人大脑是否聪明的关键因素。

与前几届相比,中国电信集团首席科学家毕奇从本届WAIC上感受到,今年的最大变化是大模型正在朝更广阔的应用落地发展,AI智能终端正在打通从数字世界到物理空间的通道。

为什么国产大模型已经达到相当聪明的程度,机器人“大脑”却发育不足?毕奇告诉《环球时报》记者,对于机器人而言,完成具体工作所需的操作已远非庞大语言语料库所能涵盖。机器人的执行过程不仅需要预测任务层面的语言描述,更需精准规划每一个细颗粒度的物理连续动作。这种对物理世界进行三维空间预测的能力,已超出语言大模型的范畴,进入了“世界大模型”的领域。

目前,以美国斯坦福大学教授李飞飞团队研发的“大型世界模型”为代表,全球对世界大模型的研究尚处于萌芽初期。毕奇认为,这类模型旨在赋予AI物理空间智能,其核心挑战不光是积累数据量。从动作大模型的训练、描述与表征方式,到模型架构本身,目前均处于前沿探索阶段,有大量基础问题亟待攻克。

苏度科技软件工程负责人从产业落地角度给出解释:大语言模型擅长做规划,当你给出“去拿杯水”这样的指令时,它能清晰地分解出任务步骤、给出行动方案。但规划不等于执行。到了机器人真正动手的层面,挑战就完全不同了——它需要理解物理世界的规则、感知三维空间的结构、实时响应环境的反馈。一个最典型的例子是:大语言模型可以告诉机器人“把杯子抓起来”,但它无法回答“要用多大的力”。这个看似简单的问题,恰恰是大模型从“数字世界”走向“物理世界”时有难度但必须迈过去的门槛。

从产品输出到生态输出,中国企业的下一程

面对上述困境,行业内正在探索不同的出路。腾讯首席科学家张正友向《环球时报》记者介绍了具身智能大模型训练的“数据金字塔”框架。

金字塔共分四层:最底层是海量的互联网视频数据,优势在于规模庞大,但缺陷也很明显——机器人需要的是第一人称视角的操作画面,而普通视频中往往看不到“手”在做什么;第二层是机器人在真实作业中采集的第一人称数据;第三层是人类穿戴专用设备(如手套)采集的物理数据,包含用力大小、触觉反馈等精细信息;最顶层则是遥操作数据——针对特定机器人本体进行远程操控采集,效率最低(8小时采集可能只有一半可用),但优势在于数据质量最高、可直接用于训练。

张正友表示,腾讯的策略是将四层数据全部打通。目前,仅凭互联网数据加上第一人称视角操作数据,已经能够支撑大量任务的训练。此外,腾讯自研了亚毫米级精度的数据采集设备,集成力觉与触觉感知能力,采集效率远超遥操作——半小时获取的数据量就已相当可观。同时,团队还开发了适配算法,能够将采集到的数据迁移至不同机械臂上直接进行训练,大幅提升了数据的通用性。

京东在本次WAIC展会上直接打出“AI进入物理世界”的口号。京东相关负责人接受《环球时报》记者采访时表示,京东的优势在于拥有零售、物流、健康、工业等海量真实业务场景,这是AI训练最稀缺的“真实世界经验”。京东推出了行业首个覆盖“采、存、标、训、评、仿、测”全链路具身智能数据基础设施,计划两年内采集超过1000万小时真实场景视频数据。在WAIC期间,京东已开源行业最大人类视角数据集EgoLive,将真实生活与作业现场的第一视角经验,转化为具身模型可以学习的“数据燃料”。

尽管具身智能尚未实现在复杂场景中完全自如工作,但多家接受《环球时报》记者采访的企业均表示,中国在大模型算法与机器人硬件两个维度均已跻身全球前列,且在应用落地层面与制造业结合紧密,走在了产业化的前列。

这些进展对黎少斌而言意义重大——他敏锐地感受到,全球市场对中国科技产品的需求已呼之欲出。以中东为例,黎少斌向《环球时报》记者透露,当地对中国AI产品和解决方案的需求相当旺盛,“他们不仅愿意投入真金白银引进技术和企业,也乐于开放各类应用场景,机遇非常多。”他指出,中东国家正处于从能源依赖型经济向高科技多元化经济转型的关键期,自主研发能力尚需时日积累,因此对引进外部先进技术抱有极大热情,中国科技企业正是这些国家最为欢迎的合作伙伴之一。

在黎少斌看来,中国企业未来出海的关键,已不再是单纯“卖产品”,而是“建生态”。除了输出大模型等核心技术,还应同步配套开发工具、培训课程等支撑体系,帮助当地开发者基于中国技术平台进行二次创新。唯有如此,才能逐步培育出一批围绕中国大模型和工具链成长起来的本地开发者与公司,形成真正可持续的技术生态——这应是中国科技企业出海的长远方向。

喜欢(0)

上一篇

马克龙亲自致电王虹:干得好

马克龙亲自致电王虹:干得好

下一篇

美媒:中国品牌占欧洲插混车市场34%:创下历史新高

美媒:中国品牌占欧洲插混车市场34%:创下历史新高
猜你喜欢