在产业机器人领域相互抢单的三家日本巨头,这一次联手争夺的既不是产品,也不是零部件,而是"数据"。日本川崎重工业、日本发那科、日本安川电机共同为制造现场的具身智能打基础,首年计划从现场采集5000小时数据,并获得最高20亿日元(约1亿元)的国家资助。这场协作释放的信号是:产业机器人的竞争轴心,正从机器本体的性能,转向数据的规模与质量。 |
要点
• 日本川崎重工业、日本发那科、日本安川电机联手,为制造现场的具身智能构建数据集,项目已入选日本经济产业省与NEDO推动的生成式AI开发支持计划"GENIAC"。
• 三家将开发把视觉、触觉、语言、动作一体处理的"VTLA模型"基础,首年从现场采集5000小时的影像、触觉与动作数据。
• 项目周期为2026年8月至2027年7月,由NEDO提供最高20亿日元(约1亿元)资助。日本大阪大学、触觉传感器初创企业FingerVision、AI基础企业ABEJA也参与其中。
• 三家共通化的是"数据的规格与采集方式";各自的现场数据、控制技术与硬件仍留在各公司手里。协作与竞争的边界,才是真正的看点。
世界份额靠前的对手,为"数据"而联手
2026年7月,日本川崎重工业、日本发那科、日本安川电机宣布联手,为制造现场开发具身智能的基础模型。该项目入选了由日本经济产业省与NEDO(新能源产业技术综合开发机构)推动的生成式AI开发支持计划"GENIAC",实施周期为2026年8月至2027年7月,由NEDO提供最高20亿日元(约1亿元)资助。
具身智能,是指在现实世界中进行物理动作的AI。它不是在屏幕里生成文字或图像,而是驱动机器人的手臂和手去抓取、装配、搬运,完成实际作业。
三家都位居全球产业机器人厂商前列,平时争夺的是同一批客户。这一组合之所以"异例",在于它们联手的对象既不是成品,也不是要素技术,而是数据。
分工是清晰的。三家负责数据规格与采集平台的共通化;日本大阪大学担任项目主体,受大学委托的ABEJA负责基础技术的提升;触觉传感技术则由初创企业FingerVision提供。竞争对手、大学与初创企业,为同一套数据聚到一起——这就是它的形态。
为何是现在:决定胜负的变量,已从本体性能转向数据
长期以来,产业机器人的竞争由硬件决定:定位精度、可搬重量、速度、耐久性。日本厂商之所以在全球占优,靠的正是这种机械层面的深厚功力。
但具身智能考验的是另一种能力。人只要说一句"把那个拿过来",机器人就要判断状况、动手完成,哪怕面对的是从未见过的零件。这种通用动作,单靠精密硬件无法实现,必须依赖用海量作业数据训练出来的AI。
这里同样适用大语言模型的经验法则:训练数据的规模与多样性,在很大程度上决定模型的性能。
问题在于,这些数据此前在各厂商之间是割裂的。记录格式、测什么、怎么测,各家各不相同,一家采集的数据难以直接用于另一家的模型训练。一旦把格式统一,不同企业、不同工序采集的数据就能相互利用,可用于训练的范围随之扩大,开发速度也随之提升。共通化,正是让这种相互利用成为可能的地基。
正因如此,竞争对手才走到了一起。多样的现场数据,单靠一家采集不齐。把不同行业、不同工序的数据用共同的格式汇集起来,比各自封闭囤积能更快养出更大的数据集。联手之所以变得合理,是因为竞争的对象已经转向了数据。
VTLA要把"教"变成"学"
开发的核心是"VTLA(Vision-Tactile-Language-Action)模型",即把视觉(Vision)、触觉(Tactile)、语言(Language)、动作(Action)一体处理的AI模型。它的目标是:理解人的口头指令,用摄像头看清对象,再凭指尖的手感边调整力度边动作——这一整套流程,由一个模型完成。
其中的特别之处在于纳入了"触觉"。传统产业机器人主要靠视觉和位置信息动作,但在夹取柔软零件、插入略有偏移的孔洞这类精细的手部操作中,感知打滑与按压力度的触觉不可或缺。FingerVision的技术,正是来填补这块短板。
VTLA想改变的,是向机器人示教作业的方式本身。当下现场普遍依赖"示教"(teaching):把动作一个个手动教给机器人的设置作业,每换一次对象,人就要重新输入坐标和步骤。这道工序,一直是多品种小批量现场和劳动力短缺工厂推进自动化的一堵墙。若VTLA走向实用,机器人习得作业的方式将发生转变:不再由人细教,而是AI从积累的数据中学习行为,对初次遇到的作业也能在一定程度上应对。自动化的前提,可能从"教"转向"学"。
真正的争点:标准由谁掌握
三家联手的本质,落在"哪些共享、在哪里仍要竞争"这条边界上。
共通化的,是数据的规格与采集方式——如何记录、如何存储的规则。留在各家手里的,是在自家工厂实际采集的现场数据、机器人的控制技术与硬件,以及最终的产品与服务。底层规则共享,较量在其之上展开。
在这一格局里,真正被争夺的是"话语权"的归属。用共同格式采集来的数据归谁所有、谁能拿去训练?标准的内容由谁来定?掌握了这一点的一方,就在具身智能的基础层占据了更有利的位置。制定标准,同时也是一场对"细则决定权"的争夺。
把视野放到外部,这一动向与全球范围的数据争夺是连成一片的。美国NVIDIA正通过掌握研发机器人所用的算力平台与仿真环境,扩大自己在具身智能上的立足点。这三家日本厂商另外也在与日本富士通、美国NVIDIA就社会落地展开事业探讨,在算力等环节会借助海外技术。但在"面向现场的数据标准"这一点上,它们试图自己掌握一套日本本土的数据基础。借用一部分平台,却不把数据的主导权交出去——今次的VTLA,正应如此解读。
行业波及:系统集成商与零部件厂商的位置生变
一旦通用数据集与基础模型成形,影响会外溢到机器人厂商之外。
变动最大的是系统集成商(SIer)。把机器人装到现场、用示教让它动起来,一直是集成商的主要收入来源。当"学习"越来越多地取代动作的获取方式,一个个手动示教的工作就会减少。取而代之的,是重心转向以数据为轴的支持——如何采集契合现场的数据,如何把模型调校到贴合某座工厂的具体工序。从设备的安装者,转为数据应用的支持者:角色或将被改写。
对零部件与传感器厂商而言,机会随之出现。VTLA看重触觉,可能抬高对力觉传感器、触觉传感器以及支撑它们的机械要素的需求。具身智能的精度,不仅取决于AI,也取决于准确感知现实的传感器质量——这正与日本零部件厂商的强项重叠。不过,价值的落点也可能从"卖单件传感器",转向"它所采集的数据如何被接入平台"。
而这套数据标准是否会延伸到亚洲制造业供应链,也是外部值得持续观察的一点。
下一个焦点:数据的使用权由谁来定
最需要关注的,是"话语权"的归属。共通化后的数据归谁所有、各家能用到什么范围?标准内容的决定权,在三家之间如何划分?这一点若始终含糊,共通化的口号可以喊下去,却未必能长成真正的标准。项目今后公布的运营规则,将是第一份判断依据。
数据的规模也要打个问号。首年5000小时是否够训练一个通用模型,从外部很难评估。对照大语言模型所学习的、数量级更大的文本,5000小时更像是一个起点。现场作业数据每小时的信息含量很高,单纯按时长比较并不成立;但从第二年起能追加多少,将决定模型的真实实力。
还有一问:日本国内标准能否走向世界。以硬件称雄全球的日本厂商,能否在"数据"这个新战场上握住主导权?这一为期一年的项目,正是最初的试金石。 |



