走出Demo,撞上数据墙:京东、智元、优必选、逆矩阵直击具身智能落地的真门槛
更新时间:2026-09-11 19:09:20 浏览次数:

  

  但落地的门槛比想象中更硬:不是模型不够强,而是数据、算力、存储和组织流程还没接住。现场嘉宾形成的共识是:数据是物理AI最稀缺的燃料。

  优必选副总裁、具身智能与人形机器人研究院院长焦继超直言,数据仍是“卡脖子的点”;京东探索研究院图像与多模态实验室主任黄浩洋也将“规模化、高质量、带动作标注的真实实操数据匮乏”视作限制机器人走进真实世界的核心变量。

  更尖锐的分歧出现在语言模型上限方面。逆矩阵创始人陈博远以GPT-6操控夹爪拿杯子耗时近一小时为例,认为语言无法描述物理直觉,Token逐一生成的推理模式下,100毫秒的延迟在聊天窗口里几乎无感,但放在真机上“就是三个控制周期出去了”,物理AI必须有自己的基座模型;鹿明机器人创始人兼CEO喻超则持保留意见,认为配上合适表征系统,语言模型上限远未触顶。

  “AI正在从数字世界走向物理世界。而一旦走向物理世界,对基础设施提出的挑战会变得更大。”京东集团副总裁、京东云基础云业务负责人龚义成在演讲中提出,物理AI对算力、存力供给提出更高量级的要求。

  其中,算力是训练和推理的底座,存力则要承接物理世界海量、多模态且快速膨胀的数据资产。“同时,面向物理AI世界的数据又极其稀缺。怎么把真实物理世界还原出来、重建出来、数字化,帮助模型和AI加速学习、快速落地,是另一个重要课题。”龚义成说。

  黄浩洋将具身数据分为仿真数据、人类操作数据和真机数据等不同层次:仿真数据适合规模化预训练,人类操作数据能够连接人的动作与机器动作,真机数据则用于后训练和精细化操作。不同数据并非互相替代,而是共同构成“数据金字塔”。

  喻超结合企业实践认为,具身智能在真实场景落地时,对数据能力的要求极高——回流数据如何进入模型迭代,如何与前期数据做多元配比等,都是绕不开的难题。如果全靠人工调整,节奏太慢,必须借助类似代码化的自动化系统来进行增补和处理数据。

  为此,鹿明机器人正在构建自己的数据闭环系统,作为任务闭环能力的载体。他以柔性质检为例介绍:最初团队自己采数据、做训练,但放到真实产线,第一次大概率跑不起来。之后要经过多轮迭代,根据实际运营情况调整回流数据,再针对特定案例补充数据。如此反复,设备运转时长、作业准确率等指标才能逐步提升。

  “限制机器人走进真实世界的变量有很多,最核心的还是智能化。”智元联合创始人、联席总裁姚卯青在圆桌对话中分享道。

  姚卯青指出,提升智能化需要在三个方面突破:长程记忆与动态决策能力、精细化灵巧操作能力、自主纠错与重规划能力。只有这三项能力突破,机器人才能更好地在充满噪声和不确定性的复杂真实世界中完成任务闭环。

  陈博远则从底层逻辑给出不同视角:尽管真实物理世界充满噪声和连续变化,但物理规律不会因场景切换而失效。

  “2023年、2024年有各种垂类大语言模型,如今一个通用语言模型就能把各种垂类场景‘one for all’地解决。”陈博远说,语言模型能在学习理解语言知识的基础上实现推理预测,对于真实物理世界而言,人类能在习得物理规律基础上获取类似于“我能轻松拿起一个杯子”的物理直觉和本能,或许也能有一个理解人类物理直觉、本能的通用世界基座模型来实现真实物理世界的“one for all”。

  对于这一通用世界基座模型的探索也是今年刚成立的逆矩阵着力的方向。陈博远认为,人类的物理本能并非只是来自感知,而是来自与真实世界的持续交互、试错和验证,因此构建物理AI基模的关键是从真实物理世界数据中提炼出“哪些动作导致哪些状态转化”的因果规律,在比像素和语言更高维的隐空间里压缩、抽象出可泛化的物理知识,同时让模型在真实场景中不断交互,通过强化学习形成完整闭环,试错密度越高,对物理世界的理解就越深。

  “下一步,我们会在基模层拉高它的智能上限,有更强的智能模型才能把它放心地用在更深入、深刻的场景,获得高质量真实数据。另一方面,真实数据如何形成闭环更关键。这是一个从人到真机,再到虚拟平台的过程,但真实场景数据迭代失效速度极快,因此需要探索构建一个端边云协同平台,完成数据闭环。”陈博远表示。

  陈博远还分享了他关注到的近两三个月行业的突破:GPT-6 Astra。这个被OpenAI称为当今世界智能水平最高、对齐表现最好的模型,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域实现进一步突破。它能像人一样“看”屏幕像素,模拟移动鼠标、敲击键盘,自主操作浏览器、办公软件和桌面应用,此类计算机操控、真机操控能力引发热议。

  “大模型可以直接操控真机了,这确实让人震撼。”陈博远说,自己最近也曾尝试用GPT-6操作夹爪去拿一个杯子,花了四十分钟到一个小时才慢慢拿起来。

  这个案例却让他对语言模型的上限进行了反思:语言能涵盖的只是你能用语言指令描述的内容,“我能想象怎么解鞋带,但用语言描述其实是解不出来的”。更关键的是时延。Token逐一生成的推理模式下,100毫秒的延迟在聊天窗口里几乎无感,但放在真机上“就是三个控制周期出去了”。真实物理世界时刻在变,动作还没执行完,新的挑战已经来了。因此,“物理AI必须有自己的基座模型,学习人类操作的范式、隐式的直觉和本能”。陈博远总结道。

  喻超对“语言模型上限”的问题持保留意见。“GPT-6的能力可能不单纯是纯语言模型的上限。”喻超说,“给它配上合适的表征系统,不管是信号还是执行方面的,它的上限会高很多,具身模型的范式、甚至具身数据的范式也都可能被颠覆。”

  对于近期的行业突破,姚卯青则提到主流大模型今年发生的质变。“模型能产生更好效果,关键在于更大的数据量。只要细节做对,确实可以延续像语言一样的scaling law,而这些细节来自大量的数据标注工作。”他表示,同模型领域类似,相比于模型架构参数,数据体系质量、闭环能力或许也是具身领域更关键的长期壁垒。

  中国驻日本大使馆:根据签证费对等安排,自9月14日起对日本公民赴华签证规费进行调整,一次签证收费16750日元

  名古屋亚运会主火炬还没点燃,1274人的中国代表团先撞上四道坎——史上首个不建亚运村的亚运会,四千多人挤邮轮、两千多人住集装箱;

  韩国前第一夫人金建希请求无罪判决:丈夫尹锡悦成为总统后,我失去一切财富和声誉,婚前经营企业时,我的经济状况要好得多

  种植户给香蕉地喷3天农药,毒[*]隔壁5万斤牛蛙,法院:蕉农在双方共同取水口兑药,蛙农未检测水质也存在过错,自担3成,获赔33.9万元

  ROG枪神10X专业电竞台式机测评:AMD锐龙9 9950X3D2+RTX5080加持4K 全息光显旗舰,游戏创作火力全开!

推荐图文

鄂ICP备2024040700号-2
砺行体育文化传媒-南京晟盟文化传媒-版权所有
数据源自网络仅供参考