← 返回 2026-08-26

从感知到行动:作为第一人称智能平台的智能眼镜 From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

Jiangning Zhang, Haojun Chen, Yong Liu 📅 2026-08-25 👍 10 2026-08-30 18:30
L0-L5能力框架 具身智能 可穿戴智能体 智能眼镜 第一人称智能 综述 自我中心视觉

首篇智能眼镜系统综述:以感知-状态-行动闭环为纲,提出L0-L5能力分级与九维部署评估框架

前置知识

自我中心视觉(Egocentric Vision)

研究从穿戴者头部/眼部视角连续拍摄的视频流的理解问题,涵盖动作识别、手-物交互、注视分析、物体追踪与情景记忆等任务。与第三人称视频相比,它具有剧烈的视角变化、频繁的手部遮挡、运动模糊和长时程依赖,代表数据集包括 Ego4D、EPIC-KITCHENS-100、HoloAssist 和 Project Aria。

论文将第一人称感知列为七项基础能力之首,其讨论的感知、记忆、空间状态与数据接口全部建立在该领域的任务、数据集与基准之上,不理解这一观测体制就无法理解全文的问题设定。

多模态大模型(MLLM)

能同时处理文本、图像、音频等多种输入的大型神经网络(如视觉语言模型),支持视觉问答、翻译、字幕与指令跟随。在智能眼镜上调用时受到算力、能耗、热与延迟的硬约束,通常采用端-云协同、级联模型或选择性升级(selective escalation)架构来平衡能力与开销。

L2 语境辅助与 L4 智能体行动的能力来源都依赖 MLLM;论文反复强调模型能力不等于系统能力,理解这一点才能理解其评估主张。

SLAM 与视觉惯性里程计(VIO)

SLAM(同时定位与建图)在未知环境中同时估计设备位姿并构建环境地图;VIO 融合相机与 IMU 测量做轻量位姿估计。代表系统包括 VINS-Mono、ORB-SLAM3(支持多地图与重定位)和 DROID-SLAM(可学习优化),它们构成持久空间状态(L3 空间记忆)的几何底座。

论文第 3.3 节持久空间状态与第 4.8 节空间智能场景的技术根基,决定了眼镜能否把瞬时观测组织成跨会话的持久世界状态。

具身智能与 VLA 模型

Vision-Language-Action(VLA)模型将视觉与语言输入直接映射为机器人动作。人类第一人称视频可作为模仿学习和机器人数据合成的来源(如 EgoMimic、EgoZero、EgoVLA),但人与机器人在形态学、视角、力觉与自由度上存在鸿沟,视觉相似不等于动作可执行。

L5 跨具身耦合等级与第 4.9 节具身智能场景的核心;论文强调 L5 系统级主张必须在目标机器人上通过下游任务成功与安全性验证,而不能仅凭人类视频对齐质量。

智能体工具调用与权限治理

LLM 智能体可将语言回答转化为对外部工具与服务的调用(搜索、下单、控制 IoT、机器人指令)。可靠执行需要最小权限、显式确认、撤销/回滚、幂等执行与审计日志等治理机制;WebArena、SeeAct、Mobile-Agent 是代表性的规划与工具使用评估环境。

L4 受治理行动等级的判定标准(权限门、最小权限、可撤销、可恢复、审计)直接来自该方向,是从回答走向执行时责任边界变化的技术基础。

可穿戴 HCI 与旁观者隐私

研究可穿戴设备与佩戴者及周围非佩戴者的交互问题:录制状态可读性、情境化知情同意、社交可接受性、以及佩戴者-旁观者隐私张力。代表性工作如 Mind the Gap、VisGuardian,表明可见录制指示灯本身并不能解决多方隐私预期冲突。

论文把隐私、安全与社会治理作为横切七项能力的部署约束,是理解其为何拒绝做通用产品排名、坚持主张条件化评估的关键背景。

研究动机

智能眼镜研究正处于快速增长但严重碎片化的状态,文献分散在五个互不连通的板块:AR 研究有成熟的配准、显示与视线交互基础,却常假设比轻量日常眼镜更富裕的光学、算力与佩戴条件;自我中心视觉在动作、手-物、注视理解上进展迅速,却以离线数据集和局部指标为主;通用多模态模型能力强大,但相关基准往往抽象掉了相机位置、传感器掉线、网络波动、输出带宽、热节流和模型/服务漂移;HCI 与隐私研究暴露了交互崩溃、无障碍需求与佩戴者-旁观者张力;具身智能则越来越多地利用第一人称人类演示做模仿学习、VLA 训练与机器人数据合成。产品侧同样分化:从 Google Glass Enterprise Edition 2、Ray-Ban Stories,到 Ray-Ban Meta Gen 2、Xiaomi AI Glasses、Meta Ray-Ban Display、Aria Gen 2,硬件路线各异。作者指出三个后果特别严重的错配:第一,传感器清单或产品功能列表并不能决定硬件实际能支持哪些智能主张;第二,组件级精度无法确立端到端效用,因为证据会过时、反馈可能迟到、错误会传播进记忆或动作;第三,持久化与动作权限质变了责任边界——错误回答可以重试,而虚假记忆、未授权购买、不安全指令或失败的机器人交接会在发起观测之后很久仍影响佩戴者与其他利益相关者。

本文的目标是本文的目标是建立第一个系统性的智能眼镜统一研究框架,把碎片化的文献重组为可比、可部署、可复现评估的研究对象。具体而言,它要回答四个耦合问题:1) 基于眼镜的系统在给定硬件下能观察和传递什么;2) 哪些可组合的机制支撑第一人称智能;3) 这些机制在哪些真实活动中创造价值与风险;4) 多少证据才足以支撑一项能力或部署主张。为此,论文规划了四层产出:通过第一人称数据流与受限任务效用目标对智能眼镜进行形式化定义,并把异构设备归并为八条可验证的硬件能力轴;综合出七项相互依赖的基础能力并提出 L0-L5 跨能力分级框架(覆盖记录中继、反应式感知、情境辅助、持久状态、受治理行动与具身耦合);把文献重组为九大应用场景,并将每个场景连接到能力回路、数据集、系统、产品入口、利益相关者、失败后果与证据缺口;最后给出九维部署设计框架、主张条件化评估协议、设计清单和从受控测量到纵向现场验证与审计的证据阶梯。

与已有工作不同的是,本文的独特切入角度是把智能眼镜的能力重新定义为『有条件的主张』而非设备或模型的内在属性。作者提出核心论题:智能眼镜能力是一个以硬件、时间视界、状态持久性、动作权限、运行环境、参与者结构、系统版本以及支持证据为条件的主张,并用十一元组 $C = \langle T, H, I, Y, \tau, S, A, P, \Omega, V, R \rangle$ 形式化(任务范围、硬件运行时档案、输入/反馈通道、证据有效窗口、状态持久性、动作权限、参与者结构、运行条件、版本、风险等级),证据 $E$ 只有在该元组限定的条件下才支持主张($E \models C$)。据作者所知,这是首个把智能眼镜形式化为主张条件化闭环系统,并将路线感知的硬件档案、能力等级、应用特定的责任结构与部署证据统一进一个框架的综述。其他独特处理还包括:把营销品类转换为承载证据的实验基底;用 L5 与 L0-L4 的正交性澄清跨具身扩展不是佩戴者朝向轴线的简单延长;明确 N/A 表示证据缺失而非零能力,并拒绝跨品类推导统一产品排名。

核心方法

直觉上,作者认为正确的问题不是『一个模型能否识别、回答、记住或行动』,而是『一个完整系统能否在能量、热、隐私与社交约束下,维持可靠、时间有效、可纠正、可治理的感知-状态-交互-行动闭环』。技术路线上,综述组织为一个闭环分析环:第 2 节从硬件基底出发,用第一人称数据流形式化智能眼镜——在时刻 $t$ 接收观测流 $o_t^g = \langle I^{ego}_{t-k:t}, A_{t-k:t}, U_{t-k:t}, P_{t-k:t}, G_{t-k:t}, D_t \rangle$(第一人称视觉、语音与环境音频、IMU/GPS/VIO 运动定位线索、注视/手/物体/姿态等空间交互线索、显式交互与设备状态),系统则通过 $(y_t, s_{t+1}, \alpha_t) = F_\theta(o^g_{t-\tau:t}, s_t, q_t; B)$ 把观测、内部状态与用户意图映射为反馈 $y_t$、更新后的状态 $s_{t+1}$ 和可选动作 $\alpha_t$,目标是在延迟 $\ell_t$、能耗 $e_t$、热负荷 $h_t$、隐私风险 $r^{priv}_t$、社交干扰 $c^{soc}_t$ 约束下最大化任务效用 $\max_\theta E[U(y_t, \alpha_t, s_{t+1})]$。第 3 节抽象七项基础能力与 L0-L5 分级,第 4 节重组九大应用场景,第 5 节给出九维部署设计与标准化评估,第 6 节总结挑战与路线图。整个环是双向的:评估证据与失败分析会反馈到硬件选择、运行时放置、状态策略、交互设计和未来能力主张的范围。

核心创新是『主张条件化的能力分级』体系,它与已有方法的本质区别在于拒绝给设备打单一成熟度分数。具体包含三个相互咬合的机制:其一,L0-L5 每一级都同时定义可验证的能力边界、最低支持条件和核心评估目标(Table 3)——L0 记录与中继、L1 对当前观测的反应式语义感知、L2 融合当前与短期多模态上下文的辅助、L3 跨事件跨会话的可追溯可纠正持久状态、L4 带显式授权、受监控执行、撤销与恢复的外部行动、L5 把第一人称人类经验转化为可迁移具身数据(L5 data/partial L5)或在目标具身系统上验证效用(L5 system),且 L5 与 L0-L4 正交而非延长。其二,公开证据两星量表(无公开证据/基础支持/强或研究可用支持)把 Table 2 的产品矩阵变成证据承载矩阵,任何等级都必须附带任务范围、证据限定符与支持材料。其三,迭代式证据阶梯:官方文档→实验室测量→固定基准→设备流回放与故障注入→端到端任务研究→纵向部署→隐私/安全审计,任何一级失败都要反馈回对应设计维度并重新以新版本运行档案评估。这与传统按传感器数量或显示规格排序的产品对比有本质区别。

方法步骤详情

第一步,演化梳理与硬件归并(Sec 2):按三个阶段追溯——2013-2020 早期探索(Google Glass EE2 的免手工工业文档、Vuzix M100/M400、Spectacles 一代、2020 年 Aria Gen 1 研究平台),2021-2024 数据与模型基础设施期(Ego4D 长时自我中心表征、EPIC-KITCHENS-100 细粒度程序性活动、HOI4D 几何交互、HoloAssist 交互式程序辅助),2025-2026 产品路线分化期(四条路线:相机/音频优先、相机+显示 AI-AR、轻量无相机 HUD、开发者/研究平台)。随后用四个诊断问题(是否贡献观测流 $o_t^g$、是否决定反馈 $y_t$ 的模态与可纠正性、是否塑造 $F_\theta$ 的本地/边缘/云计算路径、是否影响延迟能耗隐私与可复现性)把硬件堆栈归并为八条能力轴:第一人称视觉捕获、音频感知与输出、空间与运动状态感知、近眼视觉反馈、免手交互控制、计算与连接架构、数据与可复现接口、部署包络与信任信号。第二步,能力抽象与分级(Sec 3):按依赖结构组织七项基础能力(第一人称感知→多模态上下文→持久空间状态→可审计长期个人记忆→情境智能体行动,具身数据接口为外向分支,部署约束横切),再逐级定义 L0-L5 的边界、条件与评估目标。第三步,场景证据图谱(Sec 4):九大场景(日常情境辅助、无障碍辅助、工业流程支持、医疗照护、教育与技能训练、出行与交通安全、社交协作、空间智能、具身智能),每个场景连接能力回路、数据集基准、研究系统、产品入口、利益相关者、失败后果与缺失证据。第四步,部署与评估蓝图(Sec 5):九个耦合设计维度、Table 6 标准化评估协议(固定设备/固件/模型/API 版本、区域、订阅状态等变量,报告 p50/p95/p99 延迟与每成功任务能耗等分布)、Table 7 设计清单和证据阶梯。

技术新颖性

技术新颖性体现在四个第一。第一,这是首个系统研究智能眼镜的综述:此前的 AR、自我中心视觉、多模态、HCI 与具身智能各自为政,没有任何工作把眼镜形式化为主张条件化的闭环系统并统一硬件路线、能力等级、场景责任与部署证据。第二,L0-L5 框架把『等级』从产品评分改造为任务与证据条件化的主张,引入了 N/A=证据缺失而非零能力的语义、证据限定符(如 L3 potential、L5 data、partial L5)以及同一设备在不同任务上可占据不同等级的规则,并且让 L5 作为跨具身的正交扩展独立于佩戴者朝向的 L0-L4 轴——这纠正了把具身数据能力误读为更强辅助能力的常见错误。第三,应用中心的证据图谱明确区分可迁移的组件证据与直接的智能眼镜证据,并论证『相同的模型功能在不同场景需要不同阈值』:一个可重试的问答与一笔不可逆的支付、一条临床记录、一次危险预警的验证门槛完全不同。第四,评估方法学层面强制固定版本化运行档案(设备、固件、模型/API、区域、网络、订阅状态、采样占空比、电池与热状态),要求报告分布而非均值(p50/p95/p99 捕获到反馈/动作延迟)、失败归因分解(观测/推理/授权/执行/反馈/恢复)与置信区间,从机制上抑制把基准分数过度泛化为部署成熟度的常见谬误。

Organization and analytical loop of this survey
Figure 1: Organization and analytical loop of this survey
Hardware stack and capability-axis consolidation
Figure 3: Hardware stack and capability-axis consolidation
Foundational capabilities and L0-L5 cross-capability level framework
Figure 4: Foundational capabilities and L0-L5 cross-capability level framework

实验结果

由于本文是综述,其核心发现体现为框架应用后的结构性结论。第一,产品矩阵(Table 2)显示四条硬件路线以不同方式分配受限设计预算,能力进步既不随传感器数量单调、也不与显示复杂度成正比:相机/音频优先路线(Xiaomi AI Glasses 2025-06、Ray-Ban Meta Gen 2 2025-09、Oakley Meta Vanguard 2025-10、Rokid AI Glasses Style 2026-01、Solos AirGo V2 2026-01)全部定级为成熟的 L2;无相机 HUD 路线(Even Realities G1 2024-06、Vuzix Z100 2024-11、Halliday G2 2026-07)均为 L1,牺牲第一人称视觉感知换取低功耗低调提示;相机+显示消费级(Meta Ray-Ban Display 2025-09 与 RayNeo X3 Pro 2025-12 为 potential L3,Quark AI Glasses S1 2025-11 为 L2)增强了确认与纠正回路但公开证据尚不支持成熟 L4;AR 开发平台(XREAL AURA 2025-05、Snap SPECS 2026-06)为 potential L4;研究传感平台(Pupil Labs Neon 2023-02 为 partial L5,Project Aria Gen 1/Gen 2 为 L5 data)支撑数据集构建与具身研究而非消费者辅助。第二,目前没有任何设备拥有支撑成熟 L4 穿戴侧行动回路的公开证据,L3 所需的状态溯源、用户纠正、删除与跨会话稳定性证据也普遍缺失。第三,证据缺口明确:没有任何被引资源能把持续佩戴、记忆编辑、工具回滚与产品版本漂移纳入同一协议;OCR-Wearable 证明步行速度、相机位置与类型会实质改变识别表现,静态基准无法捕捉。第四,九大场景分析表明同一组件证据需要场景化阈值:日常问答可重试,而支付、订票、临床文档、危险预警的失败不可逆。第五,归纳出八大挑战(硬件预算与持续闭环、纵向数据与标注瓶颈、接地/记忆/不确定性、个性化与人群多样性、干预时机与可纠正性、生态互操作与动作可靠性、隐私安全治理、评估与版本漂移)与六条路线图方向。

Hardware capability axes and their corresponding research implications
Table 1: Hardware capability axes and their corresponding research implications
Hardware capability profiles and estimated levels of representative smart-glasses products
Table 2: Hardware capability profiles and estimated levels of representative smart-glasses products
L0-L5 cross-capability level framework
Table 3: L0-L5 cross-capability level framework
Capability requirements and expanded representative evidence across six recurring smart-glasses application scenes
Table 4: Capability requirements and expanded representative evidence across six recurring smart-glasses application scenes
Fine-grained capability requirements and expanded representative resources for spatial intelligence, social interaction and collaboration, and embodied intelligence
Table 5: Fine-grained capability requirements and expanded representative resources for spatial intelligence, social interaction and collaboration, and embodied intelligence
Standardized evaluation protocol for smart glasses
Table 6: Standardized evaluation protocol for smart glasses
Design checklist for deployable smart glasses
Table 7: Design checklist for deployable smart glasses
Temporal evolution and taxonomy of representative work on smart glasses and related wearable interfaces for embodied intelligence
Figure 5: Temporal evolution and taxonomy of representative work on smart glasses and related wearable interfaces for embodied intelligence
查看结构化数据
任务指标本文基线提升
代表性智能眼镜产品与平台能力定级(Table 2 产品矩阵) L0-L5 等级 + 八轴两星公开证据量表(⋆ 无公开证据 / ⋆⋆ 基础支持 / ⋆⋆⋆ 强或研究可用) 相机/音频优先消费级(Ray-Ban Meta Gen 2、Xiaomi AI Glasses 等 5 款)= L2;无相机 HUD(Even Realities G1、Vuzix Z100、Halliday G2)= L1;带显示消费级(Meta Ray-Ban Display、RayNeo X3 Pro)= potential L3,Quark AI Glasses S1 = L2;AR 开发平台(XREAL AURA、Snap SPECS)= potential L4;研究平台(Project Aria Gen 1/2)= L5 data,Pupil Labs Neon = partial L5 传统做法:按传感器数量、显示规格或品牌定位给产品排序,或将厂商营销功能表当作能力证据 首个任务与证据条件化的可验证分级体系:每级附带证据限定符与硬件定位,明确指出成熟 L4 行动闭环尚无任何公开证据支撑
端到端部署证据评估(Table 6 协议 + Table 7 清单) 证据阶梯层级覆盖:文档→实验室测量→固定基准→设备流回放/故障注入→端到端研究→纵向部署→隐私/安全审计 诊断出现有公开证据大多停留在阶梯前三层;没有资源能同时覆盖持续佩戴、记忆编辑、工具回滚与版本漂移;给出九维评估对象与分解指标(p50/p95/p99 延迟、每成功任务能耗、假回忆率、删除有效性、旁观者理解率等) 现有评估实践:单一组件基准分数(如 WearVQA、EgoSAT 等各自孤立)被过度泛化为完整产品或部署成熟度主张 把评估单位改造为条件化能力主张,强制固定版本化运行档案并要求失败归因分解,抑制跨条件错误迁移
研究版图统一组织 框架覆盖规模:能力轴/基础能力/场景/设计维度/挑战/路线图数量 8 条硬件能力轴、7 项基础能力、L0-L5 共 6 级框架、9 大应用场景、9 维部署设计、8 大开放挑战、6 条路线图方向,并把数百篇文献与上百个数据集/系统/产品映射进统一结构 既有现状:AR、自我中心视觉、多模态模型、HCI、具身智能五个板块各自综述,设备任务基准互不可比 首次形成从硬件基底到能力、应用、设计、证据的闭环分析框架,使智能眼镜成为可比、可部署、可复现评估的研究对象

局限与改进

作者明确承认的局限包括:本文刻意不产出通用产品排名,Table 2 的比较应主要在同品类内进行,跨品类对照只用于澄清能力边界;两星证据量表基于公开文档,等级被明确定义为任务与证据条件化的主张而非设备成熟度评分;第 4.10 节列出的潜在场景(旅游与文化遗产、博物馆、位置感知零售、体育表现、创意捕捉、公共安全、科考、农业、物流、智能家居、个人认证等)因证据过于零碎只做简要处理。我自己的观察是:其一,星级评定的粒度较粗且依赖公开材料,厂商营销与第三方实测难以区分时存在高估风险,且固件与服务更新可能使矩阵快速过期(表中产品日期集中在 2024-2026,硬件月度迭代);其二,作为综述,它对引用基准(WearVQA、EgoSAT、EGOSTREAM、EgoPoint-Bench、IPIBench 等)只做定性组织,缺少跨任务的定量元分析或聚合比较;其三,L0-L5 的边界条件虽然给出了最低支持条件,但判定过程仍偏定性,没有可操作的自动评分工具或评分者间一致性检验;其四,评估协议与设计清单目前以文档表格形式存在,配套的开源评估工具链(数据回放、故障注入、审计脚本)尚未发布,项目页目前是 awesome 列表形态;其五,隐私与安全治理部分以机制清单为主,缺少可测量的量化阈值与基准任务定义。

独立分析的弱点

独立分析的弱点如下。第一,证据量表的主观性与时效性:两星评定依赖公开文档,产品固件、模型 API 与订阅服务频繁更新会使 Table 2 迅速失真,例如 Meta Ray-Ban Display 的 potential L3 依赖尚在演化的 Neural Band 交互证据;改进方向是把矩阵做成社区共建、版本化、带时间戳的在线资产,并引入证据来源分级(厂商声明/第三方实验室/公开基准/纵向部署)乘以置信区间的二维量化。第二,缺乏定量综合:七项基础能力的文献覆盖是叙述性的,无法回答『自我中心 VQA 在真实佩戴条件下与桌面条件差多少』这类量化问题;改进方向是对可比较的基准做条件分层的元分析,报告效应量而非罗列。第三,框架的可操作性成本高:完整的十一元主张 $C = \langle T, H, I, Y, \tau, S, A, P, \Omega, V, R \rangle$ 加九维评估对小团队负担沉重,可能实践中被简化为口号;改进方向是提供最小可行证据模板和自动生成版本化证据档案的工具。第四,L3/L4 之间缺少参考实现:论文指出没有设备达到成熟 L3/L4,但未给出一个可公开复现的参考系统来校准边界;改进方向是联合研究平台(如 Aria Gen 2)与开放原型(如 OpenGlass)发布跨越记忆写入、纠正、删除与工具回滚的开源基准系统。第五,治理机制缺度量:删除有效性、旁观者理解率、情境同意遵守率等只有指标名而无任务定义与目标值;改进方向为这些指标设计具体的探针任务与红队测试集。

未来方向

作者提出的六条路线图方向构成清晰的未来研究地图:1) 可复现的设备与系统档案——把一次性功能演示改造成版本化、可检查的系统工件,记录传感器布置与采样、校准、固件与模型版本、算力分配、卸载策略与恢复机制,并附带长时资源轨迹与失败案例库,开放回放接口让新模型在相同传感器流与动作历史上评测;2) 隐私感知的纵向数据引擎——把采集、策展、标注、同意、纠正与删除当作连续生命周期而非一次性发布,支持机器可读同意状态、可验证删除、联邦或端上学习与可审计数据血缘;3) 可审计记忆与持续世界模型——用溯源图把每条存储状态连接到支撑观测、置信度、时间戳、访问策略与后续修订,联合优化写入、巩固、矛盾消解、过期与遗忘;4) 自适应交互与包容性主动性——统一交互控制器综合任务阶段、风险、佩戴者注意力、环境噪声与偏好,选择从静默状态维护到紧急打断的分级行为,并保证个性化可检查可关闭;5) 可互操作的显示、空间与动作生态——为指称、位置、身份、时间有效性与权限建立共享模式,支持能力协商与提议-确认-执行-验证-回滚的事务化执行,让近眼显示同时成为确认与溯源界面;6) 机器人验证的人类经验迁移——在目标机器人上以任务成功、样本效率、跨具身失败率与不安全执行率验证迁移收益。基于本文成果还可延伸:把证据阶梯制度化为社区认证或分级基准排行榜;开发 L0-L5 自检工具包;以及建设文中明确指出尚不存在的统一基准——整合跨日建图、指示指称接地、世界锁定反馈、用户纠正与设备/机器人执行的持久空间服务基准。

复现评估

复现评估需要区分两个层面。作为综述,本身无需训练或推理算力,『复现』意味着采用其形式化体系、表格与协议来组织自己的研究或评测,这一点门槛很低:项目主页 https://github.com/zhangzjn/awesome-smart-glasses 持续追踪最新工作与产品,Table 1-7 均可直接用作设计检查表与评估模板。数据与基准层面,论文引用的资源绝大多数公开可得——数据集如 Ego4D、Ego-Exo4D、EPIC-KITCHENS-100、HoloAssist、Aria Digital Twin、EgoLife、EgoMonth,基准如 WearVQA、SuperGlasses、SAW-Bench、GLIMPSE、EgoSAT、EGOSTREAM、EgoPoint-Bench、EgoProx、IPIBench、Ego-Pro-Bench、Streaming Interventions,研究平台如 Project Aria Gen 1/2、Pupil Labs Neon 提供原始传感器访问与校准数据。但严格按 Table 6 协议执行全套评估的难度为中等偏高:需要真实设备(消费级眼镜或数千美元级研究平台)、实验室功耗热测量设备、受控故障注入环境、端到端用户研究、以周月计的纵向佩戴研究以及隐私安全审计,这远超单个论文项目的常规预算;此外部分结论(如 Table 2 星级)依赖公开文档,随固件与服务更新需要自行验证。总体而言:采纳框架易,完整执行其评估协议难,这正是作者将其设计为迭代证据阶梯而非一次性认证的原因。