“ChatGPT时刻”尚未到来,具身大脑已提前打响“百模大战 ”
更新时间:2026-09-01 16:41:38 浏览次数:

  据

  2023年,百模大战爆发时,ChatGPT已经完成了一次近乎全民规模的产品教育,大语言模型赛道构成了相对清晰的技术底座。后来者可以争论模型多大、开源还是闭源,但起码清楚自己正在追赶什么。具身智能恰好相反,行业还没有等来一个所有人都能感受到的“ChatGPT时刻”,也没有就模型路线达成一致。

  过去几年,具身大脑的主流答案是VLA,把

  过去两年,机器人行业证明了前半句话——经过充分训练后,机器人已经能够抓取、整理、折叠、搬运,甚至完成几个动作组成的任务。

  ‌宇树科技创始人王兴兴提到,机器人在固定场景、经过充分采集训练后,成功率可以做到接近100%,但环境或物体稍有变化,成功率就会严重下降。“最后几个厘米或者最后几个毫米的成功率或者偏差没办法很好地跟真实世界匹配……最终误差没办法很好修正,导致成功率暴跌得很严重。”

  墨奇智能联合创始人兼CTO黄青虬算了一笔账,硬件、软件和算法三个模块,假设每一个模块的失败率是1%,单个动作的成功率就是0.99的3次方,如果机器人要完成一个长程任务,可能是10个动作的集合,那成功率可能就是0.99的30次方。

  如此一来,成功率就从99%衰减到73.97%,这意味着在工厂等真实连续作业场景中,如果不解决长程任务的稳定性,机器人每执行三四次任务就有可能失败一次。

  它承接的是行业对下一阶段能力的期待,希望机器人不只模仿过去见过的动作,还能预测动作发生后,环境和自身状态将如何变化,以此提高对新任务和长程任务的处理能力。

  但当大家谈及世界模型,所谈论的未必是同一个“世界”。有人强调预测未来画面,有人把、动作和机器人反馈放进同一个模型,也有公司尝试引入更多物理规律。

  伽利略研发总监刘伯韬认为,现阶段真机实测数据、端侧算力以及模型能力,尚不足以支撑开放环境下的真正通用化能力,很多场景下所谈及的泛化能力仍存在现实瓶颈。

  星源智创始人刘东则认为,在物流分拣等边界明确的场景中,让机器人适应不同物体的小范围泛化已经能够实现,而任意环境、任意任务则仍然缺少足够数据。

  VLA已经足够成熟,却没有强大到足以终结技术路线,反而把泛化、长程任务等问题暴露出来,而新的方案还远没有形成强势的共识。

  同时,模型本身的门槛也尚未高到把大量玩家挡在牌桌之外。摩尔线程创始人、董事长兼首席执行官张建中提到,目前大量VLA仍集中在70亿参数左右,训练可能只需要几十张甚至几张GPU。他认为,具身智能的世界模型真正走向“ChatGPT时刻”,算力需求一定会在千卡乃至万卡级。

  大语言模型崛起之前,人类已经花了很多年在互联网上自然生产文本、和,模型出现以后,只需要把这些已经存在的数据组织起来。

  数采员可能只完成一条标准轨迹,真正的保洁人员却会观察污渍,调整方向、力度和次数,没有擦干净就再来一次。两段数据都叫擦桌子,机器人能学到的内容却相差很大。如果1万小时数据中有9000小时高度重复,时长增加也未必带来新的信息。

  不同公司的选择也迅速分化,有人坚持真实数据,有人押注仿真,也有公司把互联网、人类操作、合成数据、真机遥操和部署回流混合起来。

  光象科技将训练过程分成了几个阶段,互联网和没有动作标注的人类第一视角数据,主要用于建立模型对物理世界的基础认识;带有动作标注的第一视角数据,帮助模型学习动作发生后物体状态如何变化;真机遥操数据负责适配机器人的真实构型和操作规范;仿真数据则可以在相同状态下批量生成不同动作及其后果,让模型学习哪些动作可行、哪些会导致失败。

  王鹤将银河通用的数据体系分为互联网数据、人类数据、合成数据、真机遥操数据和真机回流数据五层。据其披露,公司已积累50万小时高精度人类操作数据和50万小时不依赖手持机械装置的人手数据。

  百万小时开始成为部分企业争夺的规模门槛,但如何将这些数据转换为机器人能力,仍取决于标注、筛选和训练方法。

  真实数据与仿真数据各有代价,真实数据直接来自物理世界,但采集慢、成本高;仿真数据可以大规模试错,却要承担虚实迁移偏差。

  奥比中光创始人、董事长兼CEO黄源浩提到,机器人操作数据正在从扩展到第一视角、触觉和力觉,但不同信号之间的时间同步仍不成熟,

  自动驾驶曾经提供过一个很诱人的范本:车先卖出去,人继续驾驶,传感器自然把大量真实驾驶数据带回来,部署越多,数据越多;数据越多,模型越好。

  机器人很难照搬。在机器人学会自主工作以前,没有这么多人会主动购买和使用它,冷启动数据只能由企业自己采集。

  黄青虬认为,目前数据规模仍小,今天很多算法实验得到的结论,随着数据增长可能被推翻,VLA之后还会出现新的模型架构,真正能够留下来的,是数据和模型训练基础设施,以及经历过一轮轮范式变化的人才。

  在上一轮大语言模型的竞争中,大量模型在发布后迅速消失,竞争从参数规模转向推理成本、产品入口、生态与收入。

  星动纪元联合创始人席悦提到,过去不少机器人项目停留在概念验证阶段,客户不会优先考虑价格;今年越来越多客户开始认真计算投资回报率,以及机器人能否批量、持续、稳定运行。

  光象科技首席科学家吕尧认为,行业需要基准来比较模型能力,但最终验证仍要回到真实机器人和工业产线,看具体工位的任务成功率以及能否为客户创造价值。

  光象科技创始人兼CEO张涛也提到,现有榜单还不足以全面代表模型能力,排名靠前只能说明模型进入第一梯队,很难直接证明其真实部署水平。

  张涛坦言,客户一定会关注成本,如果一家企业声称不关心成本,其目的很可能并非真正推动落地。更重要的是让产品成本与场景价值匹配,对于已经存在更便宜、更成熟方案的任务,没有必要投入一台价格更高的具身机器人。他认为,具身智能更适合传统自动化难以处理,同时具备真实需求和规模化潜力的场景。

  这些指标最后都会变成一笔账单:一项新任务需要训练几天,一台机器人每天处理多少件产品,换一个场地要投入多少工程师,单位劳动成本能否低于人。

  极佳视界联合创始人、首席科学家朱政测算,团队使用几十万小时数据训练几十亿参数的世界模型和具身基础模型,成本已达到约1亿元。如果未来数据扩大到几千万乃至上亿小时,参数增加十倍、百倍,而数据利用效率没有同步提高,意味着训练模型的成本将提高到上千亿元。

  王兴兴把机器人进入陌生环境后,仅凭语言指令完成约80%的任务视作接近“ChatGPT时刻”,给出的时间是快则两三年,慢则五到十年。

  黄青虬给出两个尺度:如果看商业部署,三年内有1000台机器人在真实产业中工作可以算作标志;如果要求机器人在陌生环境和任务中都达到较高成功率,至少还要五年。

  高继扬认为,具身智能未必会拥有一个公众同时感知的GPT时刻。大语言模型上线后,每个人都能立即打开电脑试用;机器人的第一批有效部署却会藏在工厂、仓库和零售后场。技术拐点可能已经发生,公众却要等到机器人渗入足够多的生产环节后,才后知后觉地发现它们无处不在。

  在技术路线没有收敛时,足够多的模型、数据方案和本体实验,可以更快排除错误答案。但它最后不会由参数、名字或一次展台演示决定胜负。

  相较于大语言模型的“百模大战”,具身智能的筛选可能更早发生。毕竟,大语言模型可以先训练,再寻找用户和应用,但机器人公司在模型还没有收敛时,就已经被推入产业现场,算法、数据、硬件同时开始接受检验。

  不过,套用汽车工业的经验,20世纪初,蒸汽车、电动车和汽油车曾经同时跑在街道上,没有人能够确定哪一种代表未来.如今再回头看,那些消失的技术,共同组成了一个新产业寻找主流形态的过程。

推荐图文

鄂ICP备2024040700号-2
砺行体育文化传媒-南京晟盟文化传媒-版权所有
数据源自网络仅供参考