TwelveLabs 发布 Pegasus 1.6,把第一视角视频变成机器人训练数据
视频理解公司 TwelveLabs 推出 Pegasus 1.6,可自动解析第一视角视频,完成动作切分、密集描述与质检,把人类操作 footage 直接转成机器人训练数据,单小时人工标注曾需上百小时。
10月6日,视频理解公司 TwelveLabs 发布 Pegasus 1.6。这是一款视觉语言模型,专门处理“第一视角”(egocentric)视频——也就是工人佩戴运动相机或智能眼镜拍摄、以操作者眼睛为镜头的画面,并把它自动整理成机器人可以学习的结构化训练数据。

过去,教机器人叠衣服或拧螺丝,先要有人看上数小时真人录像,再把每一步动作写下来。公开数据集 Ego-Exo4D 标注 1286 小时视频就耗了超过 20 万小时人工;折算下来,处理 1 小时原始视频往往要 70 到 155 小时手工劳动。Pegasus 1.6 把这条链路自动化:它对视频做动作切分与打标,对“手—工具—物体”的空间交互做密集描述,并检查素材质量、检索与合规。
模型支持最长约两小时、容量 26 万 token 的上下文,足以吞下一段完整工作录像。TwelveLabs 表示,一家美国机器人训练数据公司已在用 Pegasus 评估工厂第一视角视频的质量、筛掉劣质片段并补写描述,每天精炼多达数十万小时素材。需要提醒的是,批量分析目前仍由 1.5 版本承接,1.6 主要面向交互式与高质量场景。

具身智能(物理 AI)公司与人形机器人厂商最缺的就是“懂人类怎么干活”的数据。Pegasus 1.6 的价值在于,把海量真实操作录像变成可训练的知识,让机器人从人类纠正打滑、换手等细微经验里学习,而不必从零构造合成环境。对多模态视频理解与机器人数据管线而言,这是把视频变成“第一等输入”的关键一步。
读者评论 (1)
想参与讨论?请 登录 后发表评论。
这70小时人工标注的痛点谁懂,这才是具身智能真正的卡点,太实用了