← 返回 2026-08-11

Ego-OSCAR:低成本开源头戴式双目惯性自我中心数据采集系统 Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore, Pratyush Kumar Patnaik, Shubhanshu Khatana, Abhishek Anand 📅 2026-08-08 👍 7 2026-08-16 18:30
具身智能 开源硬件 数据采集 机器人学习 自我中心视觉

用约200美元的开源头戴设备,规模化采集带同步IMU的双目自我中心视频

前置知识

自我中心视觉(Egocentric Vision)

指以佩戴者第一人称视角记录的视觉数据,相机随人体头部运动,天然覆盖手-物交互、环境布局与任务流程。Ego4D(3670小时)、EPIC-KITCHENS-100等大规模数据集确立了该领域的数据规模,人类第一人称视频因贡献者网络可无限扩展,被视为具身AI的廉价数据底料。

本文的全部设计目标就是自我中心数据的采集硬件,理解其视角特性(头部快速运动、手部常在视野内、室内0.5-4m工作距离)是理解传感器选型和评估指标的前提。

全局快门与卷帘快门

全局快门传感器的所有像素在同一时刻曝光,一帧只对应一个时间点;卷帘快门逐行曝光,头部快速运动时各行产生毫秒级时间错位(果冻效应)。本文采用Omnivision全局快门传感器,消除视觉-惯性估计中被逐行时间偏移污染的风险。

论文反复强调 hardware-synchronized global-shutter,这是它与Ego4D所用消费级卷帘相机的核心差异,直接决定VIO和立体深度在头动场景下是否可靠。

视觉惯性里程计(VIO)

融合相机图像与IMU(三轴加速度计+三轴陀螺仪)估计设备位姿的技术,代表工作如VINS-Fusion。IMU提供高频(本文120Hz)运动先验,相机提供低漂移观测;两者时间同步精度和IMU噪声等级(用Allan方差刻画)直接决定能否收敛以及漂移速度。

Ego-OSCAR的立体+IMU传感器组合正是为VIO设计,评估中的12/20收敛率、700微秒残余滞后、Allan方差噪声密度等指标都需要VIO背景才能正确解读。

VLA模型与具身数据瓶颈

视觉-语言-动作模型将图像与自然语言指令映射为机器人动作,需要海量多模态交互数据。主流采集范式各有取舍:遥操作保真但每段都要实体机器人和操作员;仿真可无限扩展但受物理引擎保真度和sim-to-real鸿沟限制;自主机器人农场受安全约束使数据偏向保守行为。

论文动机直接来自VLA与世界模型的数据需求,理解这个成本-质量权衡图景才能明白自我中心人类视频为什么是值得投资的中间路线。

立体视觉与双目深度

两台相机以已知基线 $B$ 拍摄同一场景,匹配像素视差 $d$ 后按三角测量恢复深度:$Z = fB/d$,其中 $f$ 为焦距。前提是精确的内外参标定与极线矫正。本文42mm基线配合126°视场角,在室内典型的0.5-4m范围内提供可靠深度。

真实传感器级双目视差是本文与UMI式单目边镜方案的本质区别,逐会话标定(重投影误差<0.03px)是数据集可用性的核心保障。

硬件时间同步与SoE信号

相机和IMU运行在独立时钟域,偏移和漂移可观。SoE(Start-of-Exposure)是相机每次曝光开始时输出的触发脉冲。本文将SoE接入ESP32中断服务例程(ISR)打时间戳,实现跨时钟域对齐;这正是全局快门+SoE引脚组合的技术意义。

视觉-惯性亚毫秒级同步(残余700微秒)是本文在200美元成本内逼近研究级设备(如Project Aria)保真度的关键技术,不懂数据同步就读不懂方法章的核心创新。

研究动机

VLA模型和世界模型的数据需求快速增长,领域瓶颈已从模型架构转移到数据:需要多样、大规模、多模态的真实世界交互数据。现有三种机器人数据采集范式都有硬伤:遥操作产出精确的具身匹配演示,但每个片段都需要一台实体机器人、一名操作员和大量时间,大规模部署成本高得令人望而却步;仿真几乎无限可扩展,但受物理引擎保真度和sim-to-real鸿沟限制;自主机器人农场用试错学习摊薄人力,但硬件安全约束限制了片段多样性,数据偏向保守行为。自我中心人类视频是诱人的中间路线——贡献者网络可以带来海量覆盖真实环境的日常活动视频——但其采集设备本身长期被忽视:Ego4D的3670小时数据依赖单目、卷帘快门、无硬件同步IMU的消费级相机,无法恢复度量尺度的相机位姿;另一极端的Project Aria保真度高但平台封闭,无法在大型贡献者网络中自由复制和分发。而现代VLA管线越来越依赖世界坐标系下的相机位姿条件化,单目视觉无法满足这一需求。

本文的目标是本文目标是设计、构建并大规模部署一个完全开源、物料成本约200美元的头戴式立体-惯性采集设备:硬件同步的全局快门双目相机(1280×720@30FPS,126°FOV,42mm基线)+ 120Hz六轴IMU + 板载RK3588硬件编码的单板机 + 负责时间同步、状态反馈和看门狗的ESP32-S3微控制器。配套发布完整开源软件栈(硬件加速录制管线、IMU采样守护进程、时间同步工具、看门狗固件),并用Ego-OSCAR-550h数据集验证系统在部署规模上的可靠性:约550小时/相机(约1100相机小时)的双目视频,来自25位贡献者、13台共享设备、40+室内环境的1462个会话,且以标注形式发布——209,315个开放词表自由文本动作段覆盖几乎全部时间线,外加全语料逐帧手部检测和逐会话标定文件。

与已有工作不同的是,现有工作要么研究数据的价值,要么彻底绕开硬件:EgoHumanoid证明了自我中心人类数据可将人形机器人loco-manipulation策略提升51%,但它假定数据已经存在;MobileEgo Anywhere用智能手机移除硬件门槛(200小时/584会话),但代价是没有硬件级立体同步、无法控制快门和曝光时序。本文切入的是两者之间被忽视的空白——采集设备本身:在可及性-保真度前沿上占据一个明确位置,接受约200美元物料成本,换取硬件同步的全局快门双目和逐会话标定刚体。这一思路与ALOHA、Mobile ALOHA、UMI的开源硬件运动一脉相承:规模化一种能力的最好方式是把底料商品化,Ego-OSCAR想扮演的正是头戴式观察型自我中心采集中UMI之于手持操作数据采集的角色。

核心方法

核心直觉是:与其在头戴设备上跑耗电的SLAM,不如把硬件严格优化为数据摄取,位姿估计留给离线批处理。系统围绕四大支柱工程化:可负担性(纯商用现货COTS、无定制PCB或专有芯片)、可复现性(开源原理图+3D打印外壳)、传感器保真度(硬件同步双目+高频IMU)、部署鲁棒性(实时故障检测最大化数据产率)。硬件四件套:相机为Dexcin USB立体模组,两颗Omnivision全局快门传感器经单一ASIC硬件同步,单USB 2.0端点输出1280×720@30FPS边并排MJPEG帧,单传感器FOV 126°、基线42mm;录制主机为Radxa Rock 5C(RK3588,2GB内存),提供硬件MJPEG解码与H.264编码,这是软编码无法维持30FPS立体不丢帧的关键;惯性传感器为TDK ICM-20948六轴IMU,经I2C以120Hz采样,留有换装BMI088等高等级器件的余地;Xiao ESP32-S3微控制器经UART连接,承担时钟桥接、RGB LED状态反馈与看门狗三重角色。整机约280g,通过普通运动遮阳帽佩戴。

核心创新是低成本约束下的硬件级时间同步架构。相机与IMU时钟独立且实测偏移和漂移可观:ESP32把相机的SoE曝光起始信号接入中断服务例程(ISR),每次曝光触发ISR记录单调时间戳,同时读取IMU,把合并流(SoE时间戳+IMU样本)经UART转发给SBC实时记录。由于相机管线偶尔在启动时丢帧或复制帧,ISR与帧号无法保证一一对应,于是在镜头旁安装一颗蓝LED,编程为恰好在第60次ISR事件时闪烁——在视频中检测到这次闪烁即可把第60个中断钉到真实帧索引,其余序列确定性对齐。校正后视觉-惯性残余滞后仅700微秒(经Kalibr的Cam-IMU偏移测试验证)。另一个本质区别在于立体几何:42mm基线的真实传感器级双目视差(而非UMI式边镜隐式立体),可直接走标准双目标定与矫正管线;标定按会话而非按设备型号进行——手工组装整机的光学对齐各异且随使用漂移,每会话用8×6棋盘格拟合针孔模型并随数据发布calibration.json,下游用户永远不依赖出厂标称内参。

方法步骤详情

流程分四步。(1) 佩戴采集:约280g设备固定于运动遮阳帽,10000mAh充电宝USB-PD供电5-6小时、可热插拔;修改版ffmpeg调用Rockchip MPP硬件解码MJPEG+编码H.264,输出约12-14GB/小时(原始MJPEG为70-80GB/小时,压缩约5倍且无可感知损失);录制切成5分钟切片限定断电损失;RGB LED指示状态,SBC的1Hz UART心跳丢失超2秒即报错,防止死机后空录。(2) 时间同步:相机SoE曝光信号接入ESP32中断例程打时间戳,同时读IMU,合并流经UART记录;蓝LED恰在第60次中断时闪烁,视频中检出该闪烁即锚定帧索引,离线对齐后残余漂移700微秒。(3) 会话标定:8×6棋盘格(30mm方格)拟合针孔模型+5系数畸变($k_1,k_2,p_1,p_2,k_3$),重投影误差<0.03px,calibration.json随会话发布。(4) 质控上传:批次验证可解码性、切片数/时长、IMU与标定文件,按手部可见性筛选;256GB SD卡约18小时容量,守护进程断点续传上传NAS/S3/GCS。

技术新颖性

技术新颖性不在单点传感器,而在系统级组合与开源完整性。其一,据作者所知这是首个面向具身AI数据采集的开源头戴设备,填补了Ego4D式消费相机(单目/卷帘/无同步IMU)与Project Aria封闭平台之间的空白。其二,200美元成本内实现了研究级系统才有的亚毫秒视觉-惯性对齐:全局快门消除逐行时间偏移、SoE-ISR时钟桥接+蓝LED锚定解决跨时钟域丢帧问题,残余滞后700微秒。其三,看门狗协议源于真实田野教训——1Hz心跳丢失2秒即报错,把沉默的空会话变成可见的失败会话,三项主要故障模式(>35°C下超90分钟热关机、SD卡I/O错误、相机-SBC连接器线缆应力)均在部署中被实时检测。其四,数据集以标注而非原始流发布:209,315个开放词表动作段覆盖约100%时间线(约380段/小时)、全语料逐帧手部检测、逐会话标定,使Ego-OSCAR-550h成为对比表中唯一可被第三方扩展而非仅消费的语料。与EgoCap(定制双目鱼眼但不可复现)和MobileEgo(无硬件同步)相比,定位边界清晰:不做逐单元逼近Aria的保真度,而是做最便宜的可辩护采集底料。

Open-source egocentric capture system.
Fig. 1: Open-source egocentric capture system.
System Overview: Hardware architecture.
Fig. 2: System Overview: Hardware architecture.

实验结果

评估分三层。Tier 1传感器保真度:13台设备矫正后平均极线误差0.4px,单相机重投影误差<0.03px;Allan方差(12小时)测得加速度计噪声密度$3.64\times10^{-2}$、陀螺仪偏置不稳定性$9.68\times10^{-4}\,\mathrm{rad/s}$,属消费级;视觉-惯性残余滞后700微秒。Tier 2数据效用:SGBM与RAFT-Stereo全FOV恢复稠密视差,42mm基线+126°FOV在室内0.5-4m可靠;VINS-Fusion在20段1-3分钟序列上12/20收敛(RealSense主动双目15/20),发散归因动态场景+头动+IMU偏置——作者声明这是收敛率而非轨迹精度,无真值故不报ATE/RPE;全语料逐帧手部检测率94%,是覆盖率统计而非精度。Tier 3部署规模:6个月、25位贡献者、13台设备、40+环境、1462会话,可用率96%,单相机约550小时(约1100相机小时);IMU存在于1271/1462(86.9%)会话;标注约380段/小时、开放词表、约100%时间线覆盖(209,315段),约三分之一时间在烹饪/洗碗之外。

Bill of Materials.
Table 1: Bill of Materials.
Comparison with existing egocentric datasets.
Table 2: Comparison with existing egocentric datasets.
Data utility results.
Fig. 3: Data utility results.
Task diversity in the Ego-OSCAR-550h dataset.
Fig. 4: Task diversity in the Ego-OSCAR-550h dataset.
查看结构化数据
任务指标本文基线提升
视觉惯性里程计 收敛序列数(20段1-3分钟保留序列) 12/20 Intel RealSense(主动双目):15/20 无提升(作者承认RealSense凭主动立体深度占不公平优势)
视频存储压缩 存储体积(GB/小时) 12-14 GB/h(MPP硬件MJPEG解码+H.264编码) 原始MJPEG流:70-80 GB/h 约5倍压缩,无可感知质量损失
视觉-惯性时间同步 残余滞后 700微秒(Kalibr Cam-IMU偏移测试验证) 未同步时相机与IMU时钟存在显著偏移与漂移 实现亚毫秒级对齐
立体标定精度 矫正后平均极线误差 / 单相机重投影误差 0.4px(13台设备)/ <0.03px 无外部基线(自证达到亚像素级) 逐会话标定消除手工组装差异
手部覆盖 逐帧手部检测率(覆盖率,非精度) 94%(全语料,非抽样) 无(用于论证126°FOV让手-物交互保持入画) 为下游手部姿态与操作研究提供前置条件
部署可靠性 端到端可用会话率 96%(1462个会话,6个月,13台设备) 无直接对照(故障模式:热关机、SD I/O错误、线缆应力均被看门狗捕获) 验证分布式部署的工程可行性
动作标注密度 标注段/录制小时 约380段/小时,开放词表,约100%时间线覆盖,共209,315段 Ego4D/Ego-Exo4D/Nymeria为叙述式且不保证全覆盖;EPIC-KITCHENS-100为90K段封闭词表(97动词/300名词) 唯一承诺全时间线覆盖的开放词表标注

局限与改进

作者坦承五点局限:(1) 未证明在Ego-OSCAR数据上训练的策略优于现有语料训练的策略——评估验证的是传感器包而非其对机器人学习的价值,端到端策略增益是最重要的后续工作;(2) 无位姿真值,只报告VIO收敛率12/20,不报告ATE/RPE,读者不应由此推断度量位姿质量;(3) 语料高度集中:25位贡献者、印度、13台共享设备,以家庭活动为主而非开放域;(4) 消费级IMU是主要位姿误差源,同一I2C总线可换高等级器件但尚未基准测试;(5) 设备仅负责采集,坏会话无法实时拒收。我的补充观察:(a) 40%的VIO发散率偏高,制约依赖世界系位姿的下游任务;(b) 720p@30FPS分辨率低于Aria等研究级设备,细小物体交互细节可能不足;(c) 手部检测94%只是覆盖率,检测框几何精度未经验证;(d) 无眼动追踪与音频通道;(e) 13台设备25人共享,遮阳帽前向重心下垂等佩戴差异可能引入系统性视角偏移;(f) IMU缺失的13.1%会话在立体VIO场景下不可用。

独立分析的弱点

独立分析的主要弱点及改进方向:(1) 缺乏端到端策略验证是最大短板——550小时数据的学习价值完全未被证实,改进方向是参照EgoHumanoid的对齐管线,用Ego-OSCAR数据与少量机器人数据共训VLA策略,并与Ego4D/EPIC-KITCHENS预训练基线对比。(2) VIO在动态场景+快速头动下40%发散——改进方向:换装BMI088/ISM330高等级IMU(作者估计增加80-200美元)、加入在线IMU偏置估计、或引入学习型VIO;由于逐会话calibration.json随数据发布,社区也可自行验证更鲁棒的估计器。(3) 佩戴人体工学缺陷——帽带压力点、前向重心导致数小时后缓慢下垂、外壳无防潮——改进方向:电池后置配重、头带拓扑优化、IP54级防护。(4) 热限制:>35°C环境超90分钟即热关机——改进方向:散热结构优化或动态降帧率/编码模式。(5) 质控全靠事后批次筛选——改进方向:在RK3588上跑轻量实时质检(模糊、曝光异常、遮挡检测),把坏会话拦截在采集时。(6) 5倍压缩虽无可感知损失,但未量化对下游深度估计/检测任务的指标影响。

未来方向

作者明确提出的后续方向:(1) 端到端策略增益验证——用Ego-OSCAR数据训练的策略与现有语料对比,作者称之为最重要的后续工作;(2) 开展带仪器的标定采集campaign获取位姿真值,从而报告ATE/RPE而非仅收敛率;(3) 高等级IMU(BMI088/ISM330)在同一I2C总线上的基准测试。基于本文成果可自然延伸的方向:(4) 与UMI式手持仪器接口结合,在自我中心视频上恢复末端执行器轨迹,把观察型数据升级为动作标注数据,直接服务VLA预训练;(5) 把贡献者网络扩展到跨国家跨文化场景,弥补印度家庭活动为主的分布偏差;(6) 加入眼动追踪与音频通道,支持注意力感知和视听任务;(7) 利用RK3588的NPU在设备端跑实时SLAM或质检模型,实现采集时质量闭环;(8) 用209,315个开放词表动作段训练视频-语言对齐模型,或将其作为手-物交互预训练语料;(9) 复刻ALOHA路径,组织多实验室复建该设备,形成跨机构的自我中心数据联盟。

复现评估

开源程度在同类工作中属于最高档:CAD源文件与装配指南、含供应商料号的完整BoM(约200美元/19100卢比)、接线图、ESP32-S3固件(SoE中断处理、IMU采样、UART组帧、LED锚、看门狗)、采集栈(录制守护进程、硬件加速ffmpeg调用、5分钟切片器、上传守护进程)、标定与时间同步工具、以及550小时/相机的数据集本体(含动作段与手部检测两层标注、逐会话calibration.json),全部宽松许可,无定制PCB或专有芯片,任何第三方都能买到、造出、改造。复现难度评估:电子装配与3D打印属中等动手门槛,会话标定流程已工具化(棋盘格+自动化拟合),设备端算力需求低(RK3588自足);真正的成本是时间——作者团队动员25人耗时6个月才采得550小时。对个人研究者,直接下载数据集零门槛;自建设备需注意印度以外的供应链适配(部分器件料号可能区域受限),以及每台设备需逐会话标定的流程纪律。