数据仍是最大瓶颈,腾讯以“平台+模型”切入具身智能

原创cby****2026-08-06 17:55

图片 1.png

  /传播易/在具身智能赛道,腾讯动作频频。

  早在去年,腾讯发布了具身智能开放平台Tairos“钛螺丝”,Tairos要做的是为机器人本体应用开发商补齐关键的软件能力。

  如今一年过去了,腾讯再次带来具身智能新的进展。

  近日,在WAIC现场,腾讯首次系统性地打通“感知—身体—行动”的闭环,推动具身智能从“离身智能”迈向“具身原生智能”、从实验室迈向真实生产力应用。

  过去一年,具身智能行业以前所未有的速度向前发展,机器人上演着“十八般武艺”,但是具身智能行业仍处于行业早期。

  腾讯首席科学家、腾讯Robotics X实验室、福田实验室主任张正友指出,今天最聪明的人工智能本质上仍是“缸中之脑”——它善于逻辑推理、文本生成和知识问答,却缺乏与物理世界直接互动的闭环:未必真正理解物体的位置、空间关系与可操作性,也难以在持续变化的环境中边行动、边接收反馈、边及时调整。

图片 2.png

  (腾讯首席科学家、腾讯Robotics X实验室、福田实验室主任张正友)

  张正友在接受财经网科技等多家媒体采访时认为,机器人最难的问题是操作物体跟人物理接触,这其中的触觉感知和力感知是非常重要的,所以这也是机器人落地的场景大部分在工业场景。

  在本届WAIC现场,也可以看到机器人从去年的表演为主的演示转向工业场景的落地,都在尝试用场景来驱动前沿的探索和研究。

  在具身智能行业发展初期,对于整个产业链上的企业来说,都是摸着石头过河。对于腾讯产品为王的公司来说,机会在哪?

  具身智能数据依然稀缺

  在具身智能行业中,数据是核心生产资料。而且与大语言模型相比,机器人的训练数据必须在真实的物理世界中产生。

  普通单目、双目摄像头录制视频缺少三维空间、距离信息,采集可用数据较少,此外,数据清洗工作量巨大,需要大量人工筛选、重构场景结构。不同设备输出数据格式不统一,模型训练前需要额外算法解析环境结构,增加数据厂商额外成本。

  灵初智能联合创始人陈源培表示,具身智能其实跟大语言模型或者自动驾驶一样,一定要通过研究「到底要什么数据、怎么获得足够多的数据」得出结论。目前来看,互联网上的数据太 dirty,成本其实远远大于现采数据。具身一定要像用人类日常生活中产生的数据。所以灵初智能才做灵灵巧手,原因是灵巧手跟人的手布局最接近,误差概率最小,人采的数据哪怕过了两年,也是唯一一个通往终局的路线。

  艾欧智能联合创始人丁哲章同样也表达数据的稀缺性。2023 年前后,具身行业对数据的焦虑还很笼统,当时连拿纸巾这类简单动作都缺数据,「不管是什么样的数据都要采」。两三年后,简单抓取的数据逐渐得到补充,缺口开始向更深处迁移:按摩、加油等专用任务,灵巧手的长程精细操作,以及需要全身协调参与的物理交互。

  艾欧智能面对数据的稀缺性,随着具身智能场景的落地,缺什么也逐渐显现。艾欧智能对应三种不同的数据需求,提供了三套完整的工具链,以及在这三套工具链之上衍生出来的数据。

  第一套面向预训练数据。在当前进一步提升具身模型训练规模的趋势下,行业需要海量、高泛化、丰富度好的数据。艾欧智能有一套真实世界数据采集系统,以"以人为中心(human centric)"的方式来承接数据量提升的需求。

  第二套面向后训练数据。当你有了机器人、希望教会它完成具体任务时,就需要足够准确、与本体匹配度足够高、质量足够好的数据。在这条线上,艾欧智能机器人遥操作系统切入整个行业。其遥操作系统(TeleXperience)在 2024 年 10 月首次发布,通过 VR、动作捕捉、外骨骼手套、力反馈单元等方式,把人的操作精准地映射到机器人上,采集高质量的任务数据。

  第三套面向运营部署数据。当机器人真正进入场景运行之后,会持续产生数据。艾欧智能提供平台入口和相应的管理能力,让成规模的机器人——比如上千台、上万台——在 7×24 小时运营过程中把数据回流回来,形成数据闭环。

  即使如此,具身智能数据采集的可用数据仍然有限。丁哲章坦言,单席位工作 8 小时,真机数据的可用时长可能不到 4 小时;在操作熟练、流程标准的情况下,人的数据可以达到 6 小时以上。效率差距推动人的第一人称数据迅速升温,也吸引了一批做过自动驾驶和大模型数据服务的公司进入具身赛道。

  陈源培甚至提到,“10 万小时人类数据,有时候可能不如 1000 小时有效。”具身智能行业的数据也从过去的采集数据变成了什么值得采集?怎么采集有价值的数据?数据如何清洗和有效转化?

  腾讯如何破局?

  在当下,具身智能处于行业发展初期,还有很多问题需要解决。张正友的观点是用场景来驱动前沿的研究和探索,只有具体场景,只要能够提炼出一些难题,解决这些问题难的问题,后面其他问题就可以迎刃而解。

  从一开始腾讯就已经放弃切入本体,打造具身智能开放平台Tairos。张正友坦言,去年问腾讯为什么不做机器人硬件?中国在硬件行业,包括机器人本体上的能力是大家有目共睹,非常领先、迭代非常快的,而且稳定性都非常好。腾讯在AI领域、云的领域、连接方面,人和人的连接方面,其实服务大众的生活,这些是腾讯的强项。“在这样背景之下,我们做Tairos,做类似于具身大脑,帮助机器人本体,因为有一些机器人本体厂家,其实不是人人都能去做具身智能的,成本各个方面都是很高。同时也帮助应用开发商,让他们能够更好的更快的把最好的,他们任务符合他们场景里面最好的本体,加上我们Tairos平台加入到他们非常了解的场景里面,是通过这个方式帮助整个行业发展起来的。”

  目前具身智能数据的稀缺性仍然是关键问题,过去一年腾讯也一直和具身智能产业合作伙伴探索如何解决具身智能数据稀缺的问题。

  腾讯云存储解决方案专家架构师杨冠军谈到具身智能数据的变化。他提到,具身智能规模发展起来以后,数据量会非常大,将来会走向海量,跟自动驾驶会很像。自动驾驶刚开始很多企业自建 IDC,数据放本地,觉得是核心资产、上云不安全。但随着车辆采集的数据越来越多,本地存储带来的挑战很难解决,大家都在想把数据上云做存储和运维。具身智能也一样,随着机器人铺开、数采厂铺开,数据量越来越大,将来肯定跟自动驾驶类似。自动驾驶采集的是车辆通过数采车到处跑,采集视频、传感数据;具身智能虽不到处跑,但在固定的数采厂采集视频、包括机器人关节数据,这些非常相似。云上数据可能打包成大文件、海量小文件存在这里,跟传统不一样。

  而具身智能客户的需求也在变化,他透露,行业第一个变化是要比较海量的存储,还要比较合适价格的存储。存储量增长以后,对价格比较敏感。以前存 100 T 的数据,费用还不是核心开销,现在存几个 P、十个 P 的数据,开销就比较大了。第二个变化是数据分发。采集完的数据,训练或标注是核心数据,它可能要分发出去给其他地方,需要比较好的网络传输。比如现在 GPU 在北京园区不够,上海园区有比较好的算力资源,是不是可以把数据快速挪到上海园区去做训练。这些都是网络上资源要去做的比较大的变化。

  过去一年,腾讯云跟具身智能厂家有合作建设一些数据平台、数采工厂、也做了很多面向具身智能场景的联合解决方案。腾讯云存储产品总经理陈峥表示:“其实很多时候Tairos平台怎么跟具身智能的客户合作,打造联合解决方案,比如艾欧智能的数据可以推给其他具身智能客户。整个平台除了实验室,跟一些具身智能客户包括异构数据都有,整体上看,客户具体想要什么样的数据,会根据一些整体的需求去提供。如果客户基于数据处理的需要,把需求推送到像GPU侧,也会通过近计算端帮助客户热数据进行加速,这样防止整个GPU空转这样可以更好达到一个提效。

  丁哲章提到,艾欧智能在数据采集过程中,需要一个稳定、好用、并且能够深入配合的中间技术栈,来确保前面提到的"远程遥操作"这件事能够稳定地跑下去。“最开始我们一直做的是本地操作,也就是人就站在机器人旁边。如果只做本地这件事,其实不需要经过网络,甚至不需要太多算力,用一个端侧方案就能很好地解决。但当时我们发现,如果想把这件事推广到"人和机器人分离在两地"的远程场景,就首先需要一套完整的中间传输技术栈,来确保控制流、图像流都能稳定安全地传输,并且在弱网条件下有基础保障。其次,数据的处理和传递需要算力基础,需要调动云端资源来辅助传输与计算的加速。在这些方面,当时腾讯云提供的技术栈和背后的支持,帮助我们把这件事完成了。而且双方在研发上的交流和反馈非常密切,正是在这种协作下,我们先把 2025 年"从中国到美国的远程操作"变成了现实。”丁哲章说道。

  据悉,过去一年,腾讯已经与具身智能产业多个企业深度合作,目前腾讯Robotics X 实验室已与宇树、智元、越疆、松延动力、乐聚、华沿等机器人企业以及博世、蓝思、景德镇、敦煌等场景合作伙伴,探索具身智能在不同机器人、不同产业场景中的落地。

  腾讯要打破“缸中之脑”

  在本次WAIC期间,腾讯推出了具身智能系列新模型和智能体新成果,首次系统性地打通“感知—身体—行动”的闭环。

  基于此,在本届WAIC期间,腾讯发布了三款具身基座模型,包括Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0 和Hy-Embodied-VLA-0.5.这三个模型都基于混元大模型打造,其中VLM 模型像“右脑”,负责理解图像、空间和场景;RxBrain 模型像具身“大脑”,统一认知、规划和对未来状态的想象;VLA 模型连接“小脑”和身体,把高层目标转化成连续的、可纠错的动作。

图片 3.png

  同时发布具身智能体Apexio和智能体框架TairosAgent,它们通过智能体的调度能力,可以把前面的“左右脑”、“大脑”、“小脑”和身体整合成完整的系统,让机器人形成一个持续感知、持续决策、持续行动的整体。

  在张正友看来,今天最聪明的人工智能,本质上还是“缸中之脑”。过去几年,大模型的进展令人惊叹,但是,一旦进入真实世界,问题就来了:它未必真正理解物体的位置、空间关系和可操作性;也很难在一个持续变化的环境里,一边行动、一边接收反馈,再及时地做出调整。

  “这就像是一个被养在缸里的大脑——拥有丰富的知识,却没有身体,也缺少和世界直接互动的闭环。我们把这种状态叫做‘离身智能’。”

  据悉,新一代具身 VLM(视觉语言)基座模型Hy-Embodied-VLM-1.0.它重点解决了三个层层递进的问题:“看物知用”(理解深度、方位、功能部件与可操作点)、“看景知变”(判断下一步动作及其带来的变化)、“看远知返”(长时程任务中记忆历史、跟踪进度、失败后可分析原因并重新规划)。在覆盖 37 个任务的评测中,三类能力均显著优于同等规模模型;更关键的是,它仅以 A3B 规模、约十分之一的计算量,就接近了上一代 A32B 旗舰模型的效果,更轻量、更适合机器人端直接部署。

  具身原生的世界认知模型Hy-Embodied-RxBrain-1.0.它把“会推理”与“会想象”统一起来:面对一个任务,一边用语言给出步骤与约束,一边生成每一步完成后应达到的目标图像,让下游动作模型不仅“听到做什么”,更能“看到做成什么样”。

  视觉-语言-动作(VLA)模型Hy-Embodied-VLA-0.5.其核心竞争力不是训练一个更大的模型,而是构建“数据—模型—训练—部署”协同发力的完整学习栈,通过亚毫米级高精度 UMI 采集系统积累超一万小时人类示教数据。

  上述模型已经开始进入真实工业场景,并在导购导览、养老服务等多个任务中完成落地验证。例如,HyVLA-0.5已经进入了一家日化品工厂,开展生产实测,面对高混合、小批量、SKU 频繁迭代的产线,其作业成功率高于 95%、节拍快于 6 秒/件,新增 SKU 留给数据采集与模型后训练的时间不到 3 天。

图片 4.png

  此外,腾讯发布了持续在线具身智能体Apexio和具身原生智能体框架TairosAgent。此次发布的五项新成果,正体现了腾讯沿着“从离身走向具身、从分裂的模块走向整体的闭环”探索具身原生智能的基本思路。

  可以看到,腾讯要做的是让具身智能拥有物理世界的互动。在具身智能行业浪潮中,腾讯以身入局,并未着急从本体、数据采集等领域切入,而是将重心放在模型、场景落地等方面。


免责申明:网站文章均由网站用户自行通过本网站系统平台投稿编辑整理发布,仅供学习与参考,不代表本网站赞同其观点和对其真实性负责。如有侵犯您的版权,请联系我们,我们将及时删除。
《挑战奥美》作家:李刚 买卖广告我推荐传播易
在线客服咨询

电话咨询

微信咨询

热门推荐
热门精品,等你来挑
查看更多