联合开源!因时机器人携手上海交大、复旦发布HandEdit数据集与评测基准
创始人
2026-09-04 17:27:54
0

近日,由因时机器人、上海交通大学和复旦大学等联合完成的HandEdit 数据集与评测基准正式开源。

该项目研究第一视角人类到机器人灵巧手图像编辑:在尽量保留原始场景、物体、视角和交互内容的前提下,将画面中的人手或手臂替换为指定的机器人构型。围绕这一任务,HandEdit 提供了配对数据、统一评测协议和开源工具,供相关方法训练与比较使用。

这并不是普通的“换手”视觉特效。编辑结果既要完整移除原人手,又要保持物体状态、接触关系和背景不变;新生成的机器人还需符合目标 URDF 所规定的结构、材质与关节形态。

数据来源与构成

目前,机器人灵巧操作数据通常通过遥操作、动作捕捉或真实机器人执行采集。这类数据与具体机器人本体紧密相关,采集和扩展成本相对较高。

人类第一视角操作视频则记录了抓取、开合、旋拧、剪切和双手协作等过程,包含较丰富的物体与场景信息。但人手与机器人灵巧手在外观、关节结构、尺度和运动方式上存在差异,因此这些视频不能直接对应到指定机器人构型。

HandEdit 围绕上述差异整理并构建了以下数据资源:

2 亿余个图像编辑样本;

30 万余段视频片段;

汇集 EgoDex、ARCTIC、OakInk2、HOI4D、HO-Cap 五个第一视角操作数据集;

覆盖 26 种 URDF 构型,其中包括 13 种独立灵巧手和 13 种手臂一体构型;

覆盖 600 余个场景、1100 余种物体和 400 余类任务。

13 种独立灵巧手覆盖多个品牌及结构类型,其中包括因时机器人自主研发的RH56DFX系列、RH5DG2系列灵巧手;Hand-Arm 构型中还组合了 JAKA、KUKA、Panda、RM65/75、UR5、xArm 等机械臂平台。

△13 种 Hand-only 与 13 种 Hand-Arm 目标构型

项目将不同来源、场景和机器人本体的数据整理到同一套处理与评测框架中,以便在一致条件下训练和比较相关方法。

△HandEdit 中的场景、物体与操作类别示例

数据示例

下面展示的是 HandEdit 数据处理链路中的同步片段。左右画面使用相同 sequence 与相同帧区间:左侧保留原始人类第一视角操作,右侧展示对应的机器人伪 GT。

需要说明的是,以下机器人画面属于仿真渲染与图像合成结果,用于数据构建和模型评测,并非真实机器人执行录像。

Hand-only|独立灵巧手

在 Hand-only 轨道中,系统需要在保持物体、背景和动作语义不变的前提下,将人手替换为目标灵巧手。

△因时RH56DFX系列灵巧手操作意式咖啡机

Hand-Arm|灵巧手与机械臂

Hand-Arm 轨道将可见手臂区域替换为手臂一体构型,需要额外处理腕部位姿、机械臂逆运动学、固定基座、相机关系和前景遮挡。

△因时灵巧手对胶囊咖啡机执行抓取操作

数据是如何生成的

为生成与目标机器人构型相对应的参考图像,HandEdit建立了一条结合视觉处理、几何重定向和仿真渲染的数据处理流程。

△从人类第一视角画面到 Hand-only、Hand-Arm 伪 GT 的主要处理环节

1.分割:默认使用 SAM3 定位人手或手臂区域,覆盖手指、手掌、手腕及可见前臂;

2.背景修复:移除原前景后,默认使用 ProPainter 恢复被遮挡区域,兼顾连续帧之间的外观一致性;

3.动作重定向:将 MANO 或三维手部姿态映射到目标 URDF 的关节空间,并结合不同本体的运动链、连杆长度和关节限制进行细化;

4.机械臂求解:Hand-Arm 数据先完成手部重定向,再设置相机相对虚拟基座,通过逆运动学求解机械臂关节;

5.同视角渲染与合成:在匹配的第一视角相机下渲染机器人前景,并合成回修复后的场景;

6.质量筛查:剔除前景残留、背景破损、姿态不合理、严重穿模或合成错误的样本。

除合成图像外,数据还保留机器人关节状态等结构化信息,用于检查构型和对应关系。

如何评测编辑结果

评测不仅考察图像的视觉质量,也需要检查人手是否被完整移除、目标机器人结构与身份是否一致,以及物体交互内容是否得到保留。

为此,HandEdit 设置了 Hand-only 与 Hand-Arm 两条评测轨道。在论文公开的测试设置中,每条轨道包含1000张图像,并分别对应13种目标构型。评价分为三个层面:

通用相似度:在整图、编辑区域和背景区域计算 PSNR、SSIM、LPIPS 与 FID;

视觉语言模型判断:分别评价语义一致性(SC)和感知质量(PQ);

具身任务指标:检查人手移除、结构一致性、机器人身份一致性和交互保持。

基准统一测试了 11 种具有代表性的开源与商用图像编辑方法,包括 GPT-Image、Nano Banana、FLUX、Seedream、Qwen-Image-Edit、HunyuanImage、FireRed-Image-Edit 和 OmniGen2 等系列。测试使用固定提示模板,并尽量遵循各模型原有的条件输入方式和默认推理设置。

△Hand-only 与 Hand-Arm 轨道的多维评测结果

论文报告的结果也呈现出三个值得关注的现象:

综合表现不能只看一项分数:GPT-Image-2 在通用相似度和具身任务指标上表现较为均衡;

VLM 高分不等于交互正确:GPT-Image-1.5 的 VLM 评价较高,但结构与交互指标并非最优;

画面自然不等于任务完成:FireRed-Image-Edit-1.1 的感知质量较高,但目标本体与交互保持仍可能失败。

这也是 HandEdit 同时保留通用、VLM 和具身任务三类指标的原因:对于机器人图像编辑,手指结构、机器人身份和物体接触关系都需要单独检查。

使用范围与边界

HandEdit 的参考结果由重定向、仿真渲染和图像合成流程生成,属于可控、可复现的伪 GT,并非完美或唯一的标准答案。为避免评测退化为单纯的像素对比,HandEdit 同时引入视觉语言模型判断和具身任务指标,使编辑结果在机器人本体正确性、交互一致性或视觉自然度更好时,可以获得高于伪 GT 的评价。

由因时机器人联合上海交通大学、复旦大学等开发的 HandEdit 数据集与评测基准已正式开源,面向全球研究者与开发者开放。

相关内容

热门资讯

LABUBU空降东方明珠 泡泡... 9月4日晚,泡泡玛特城市乐园嘉年华巡展上海站在东方明珠塔城市广场举行开幕式,此次巡展将持续至11月1...
中国经济面面观丨“暑期档”热度... 今年暑期,文旅消费热力十足,游客出游热情高涨。7至8月暑运期间,全国铁路累计发送旅客9.54亿人次,...
“江山如画 鲁苏有约” 鲁苏同... 9月4日,“江山如画 鲁苏有约” 鲁苏同业(徐州)交流对接会顺利举行!近百家徐州本地旅行社齐聚现场,...
列国鉴|大埃及博物馆:埃及“第...   新华社开罗9月4日电(记者徐皓夫 姚兵)2025年11月,历时20余载建设的大埃及博物馆正式向公...
拉塞特战略收购欣农互联,同步发... 9月3日,拉塞特正式宣布完成对欣农互联的战略收购,并与金蝶签署深度战略合作协议。同日,拉塞特·欣农互...
走!去东方明珠看Labubu,... 在电视塔城市广场上,一艘巨型冒险船破浪 “登陆”,ZIMOMO船长伫立船头在电视塔城市广场上,一艘巨...
古巴出台新规:企业招聘、旅行社... 面对美国封锁带来的严重经济困境,古巴进一步放宽对外国投资、对外贸易和旅游业的限制,扩大外资、合资企业...
联合开源!因时机器人携手上海交... 近日,由因时机器人、上海交通大学和复旦大学等联合完成的HandEdit 数据集与评测基准正式开源。 ...
【列国鉴】大埃及博物馆:埃及“...   大埃及博物馆:埃及“第四座金字塔”    徐皓夫 姚兵  2025年11月,历时20余载建设的大...
清华大学这堂AI课获百万网友点... 一堂来自清华大学的AI课,最近在网络上获得了百万网友点赞。 最近,清华大学课程《社会网络分析》实录视...