← 返回 2026-08-13

基于概念提示的任意场景视线目标估计 Gaze Target Estimation Anywhere with Concepts

Xu Cao, Houze Yang, Vipin Gunda, Zhongyi Zhou, Tianyu Xu, Adarsh Kowdle, Inki Kim, James M. Rehg 📅 2026-08-11 👍 5 2026-08-18 18:30
可提示视觉模型 数据引擎 端到端检测 行为理解 视线目标估计 视觉-语言对齐

提出PGE任务与端到端模型GazeAnywhere,用文本/坐标提示直接预测指定人物的注视目标

前置知识

视线目标估计 (Gaze Target Estimation)

从第三人称场景图像中预测画面里某个人正在看的像素位置,输出通常是概率热图,并附带“注视目标是否在画面内”的二值判断。它与估计眼球朝向的视线方向回归不同,关心“看哪里”而非“眼睛朝哪个方向”,需要综合头部姿态、场景布局与人物交互来推断,通常在 GazeFollow、VideoAttentionTarget 等数据集上用热图 AUC 和像素 L2 距离评测。

这是本文要重新定义的对象:论文把该任务改造成提示驱动的 PGE,所有实验指标(AUC、L2、AP)都来自这一任务的评测协议。

开放词汇检测器 (OVD)

以 CLIP 类视觉-语言对齐为基础的目标检测器(如 GroundingDINO、OWLv2、LLMDet),推理时可按任意文本查询检测训练类别之外的物体并输出边界框。它把文本和图像映射到共享嵌入空间,用图文相似度给候选框打分,从而支持开放类别的“指人”。

现有视线模型靠 OVD 把文字提示转成头部框,是本文批判的两级流水线的核心部件;论文所有基线都由“OVD + 视线模型”拼成,其级联误差(如 OWLv2 在儿童头部检测上仅约 70% 准确率)正是 GazeAnywhere 要消除的瓶颈。

可提示/概念驱动范式 (SAM 与 Promptable)

由 Segment Anything 系列确立的交互范式:模型不接收预定义类别,而是接收文本、点、框等提示,在前向推理中“指哪打哪”地分割或定位用户指定的对象。提示充当条件信号,让单一模型支持开放、灵活的任务指定方式,而不是靠几何框等显式定位线索。

GazeAnywhere 的定位是“视线领域的 SAM”:PGE 任务定义、文本/坐标双提示设计都直接源自这一思想,理解它才能看懂论文的范式迁移逻辑。

DINOv3 与 dino.txt

DINOv3 是 Meta 的自监督 ViT 基础模型,无需人工标签即可学到强泛化的视觉特征;dino.txt 在其上加入图文对齐训练,使视觉特征可与文本嵌入对齐(类似 CLIP 但基于自监督骨干)。本文将两者全程冻结,只训练其上的轻量模块。

它们是 GazeAnywhere 的双编码器;论文的编码器消融(Table 5、Table 7)显示冻结的 DINOv3 显著优于 CLIP/SigLIP2/MetaCLIP2,且解冻反而掉点,这是整个方法成立的关键前提。

DETR 式 Transformer 检测与 GIoU 损失

DETR 用 Transformer 编解码器加可学习 query 直接做集合预测,输出目标框,省去锚框和 NMS;其回归损失为 L1 与广义 IoU(GIoU)的加权和。GIoU 在预测框与真值框不相交时仍能提供梯度,弥补了普通 IoU 损失的缺陷。

GazeAnywhere 的检测器与头框损失照搬这一体系:损失权重 $\lambda_{l1}=5$、$\lambda_{iou}=2$ 直接沿用 DETR/OWLvIT 的设定,head token 的用法也类似一个专用检测 query。

热图 BCE 监督与 Focal Loss

把注视位置监督成以真值点为中心、标准差为 $\sigma$ 的二维高斯图,让预测热图与它在每个像素上做二值交叉熵(BCE),是视线/关键点热图任务的标准做法。Focal Loss 通过 $(1-p_t)^\gamma$ 调制因子压低易分样本的贡献,专治正负样本极不均衡的二分类问题。

GazeAnywhere 三个损失中有两个来自这里:$\sigma=3$ 的高斯 BCE 监督视线热图,Focal Loss 监督 in/out 判断;损失消融(Table 4)是理解辅助任务如何反哺主任务的钥匙。

研究动机

传统视线目标估计系统普遍采用多级联流水线:先用人检测器与跟踪器找到画面中的人,再用开放词汇检测器(OVD)裁出精确头部框,最后把头部框连同场景图喂给视线模型(如 ViTGaze、Sharingan、Gaze-LLE)。头部框、人体姿态甚至深度图既是训练监督也是推理时的必需输入,这种串行依赖非常脆弱:一旦上游检测在拥挤场景、弱光或儿童脸部等困难情形下出错,误差会级联放大到整个系统。论文给出了量化证据——在 GazeFollow-Concept 上,Sharingan 使用真值头部框时 L2 误差为 0.109,换成 GroundingDINO-B 的检测框后恶化到 0.352(约 3.2 倍);ViTGaze 也从 0.098 恶化到 0.232。更严峻的是,在论文自建的 IRB 批准 OOD 临床数据集 Child-SC 上,SOTA 开放词汇检测器 OWLv2 对儿童头部/脸部的检测准确率只有约 70%。此外,现有端到端模型虽能预测所有人的视线,却无法用自然语言指定“分析哪个人”,缺乏其他视觉任务(检测、分割)早已享受的语言提示便利性。

本文的目标是论文要实现“任意场景、任意人”的视线分析:给定一张图像 $I$ 和一个提示 $P$(自然语言文本如 “the boy in the red shirt”,或视觉提示如头部中心坐标 [0.52, 0.48]),模型端到端直接输出该指定人物的视线热图 $\hat{H}\in\mathbb{R}^{H_{out}\times W_{out}}$,同时预测注视目标是否在画面内。具体目标分四层:(1) 形式化定义 Promptable Gaze Target Estimation(PGE)新任务,把主体指定与视线预测统一进一个端到端问题;(2) 构建带概念标注的大规模数据——通过可扩展数据引擎把 GazeFollow、VAT、ChildPlay 改造成约 12 万对“概念短语-视线”训练样本(Gaze-Co)及三个概念化测试基准;(3) 提出首个 PGE 模型 GazeAnywhere,一次前向同时完成主体定位、画面内外判断与视线热图估计;(4) 在公共基准与 OOD 自闭症儿童临床数据上验证泛化能力,并落地为 AR 眼镜上的 GazeAnywhere Agent 应用。

与已有工作不同的是,本文的独特切入角度是把 OVD 与 SAM 系列已验证的“概念提示”范式首次迁移到视线理解领域:不再把“找到人”和“看哪里”拆成两个串行模型,而是让一个可训练的 Transformer 检测器在冻结的 DINOv3 视觉特征与 dino.txt 文本特征之上联合推理,语义级描述直接参与视线计算,从架构上消除级联瓶颈。第二个切入点在数据侧:不为 PGE 重新采集数据,而是设计 MLLM(Gemini 2.5 Pro)+ 人工在环的数据引擎,把三个异构 gaze 数据集统一改造成概念标注格式,错误率控制在 1% 以内,低成本获得 12 万样本。第三是训练信号设计的巧思:头部框预测从“推理时的硬依赖”降格为“训练时的辅助对齐目标”,配合解耦的 presence token 处理画面内外判断,让辅助任务真正反哺主任务而非引入新的误差来源。

核心方法

直觉上,GazeAnywhere 想做视线领域的 SAM:用户用一句话或一个坐标点“点名”某人,模型就输出这个人看向哪里。技术路线是冻结编码器 + 可训练检测器的组合:图像 $I\in\mathbb{R}^{3\times H\times W}$ 经冻结 ViT(DINOv3)编码为一个 $[CLS]$ token 加 $N_V$ 个 patch token;文本经冻结的 dino.txt 文本编码器取 $[EOS]$ token 特征;两个可训练线性投影 $W_V$、$W_T$ 把两路特征统一映射到低维空间 $D$。随后引入两个专用可学习 token:head token $t_h=t'_{eos}$(由文本 [EOS] 投影特征构成)负责头部定位,presence token $t_p=c'+E_{presence}$(由视觉 [CLS] 投影加可学习嵌入构成)负责画面内外判断。把所有 token 拼成序列 $F=[t_h, t', s', t_p]\in\mathbb{R}^{(N_T+N_V+2)\times D}$ 送入 3 层、维度 $D=256$ 的 Transformer 检测器(沿用 DINOv3 的 block),最后接三个解码头:精炼后的 patch token 重排成 2D 网格,经两层转置卷积输出 $64\times64$ 视线热图;head token 过 3 层 FFN 回归 $[x,y,w,h]$;presence token 过 2 层 FFN 输出 in/out logit。整个模型端到端训练,总损失 $\mathcal{L}_{total}=\mathcal{L}_{gaze}+\mathcal{L}_{presence}+\mathcal{L}_{head}$。

核心创新是“概念条件化的一次前向推理”:主体识别与视线估计在同一个 Transformer 内完成,文本语义作为条件直接调制视觉特征,而不是像基线那样先由 OVD 产出一个框再裁剪输入。这与两级方案有两点本质区别:其一,信息不再有损压缩——级联方案里文本只用于产生一个 4 维框,其余场景证据被丢弃,而本文中文本与全图特征共同参与解码,拥挤场景中不会“找错人”(Figure 9 显示基线的 OVD 会框错人或把一群人框进同一个大框);其二,头部框从推理依赖变成训练期的跨模态对齐目标,消融证明它同时提升视线与 in/out 精度。另一个巧妙设计是解耦的 presence token:作者指出 in/out 判断依赖全图全局上下文,与天然局部的目标定位目标相互冲突,硬塞进同一个 query 会互相干扰,因此用独立的全局 token 分工处理——Table 4 的消融证实 presence 损失只服务 in/out 预测,而 head 损失同时改善两个任务,验证了这一分工的必要性。

方法步骤详情

数据引擎分三步:(1) 对齐与过滤——统一三个源数据集的坐标模式(头部框 $(x_{min},y_{min},x_{max},y_{max})$、归一化注视点 $(g_x/W, g_y/H)$),只保留头部框宽 ≥30px、高 ≥40px、面积 ≥2500px²、框与图像面积比 ∈[0.008, 0.3] 且 Tenengrad 清晰度达标的样本;(2) 概念生成——用生产级 VLM(Gemini 2.5 Pro)按固定模板批量为目标人物生成小写概念短语,含四字段:外观(句尾限定 man/woman/boy/girl/child/infant 等感知类别)、位置、动作、姿态,另估计画面人数;(3) 校验——MLLM 逐字段核对概念与头部框的一致性、完整性与隐私性并标记 pass/fail,人工抽查通过样本的批次成功率,错误率 >1% 则调整提示重新生成;受 IRB 限制的 Child-SC 完全由授权人员手工标注。模型侧流程:输入 512×512 图像与文本/坐标提示 → 冻结双编码器提特征 → $W_V,W_T$ 投影到统一维度 → 组装含 head token 与 presence token 的序列 $F$(文本加 1D、视觉加 2D 正弦位置编码)→ 3 层检测器融合 → 三头并行解码:64×64 视线热图(像素 BCE,目标为 $\sigma=3$ 的高斯)、头框($\mathcal{L}_{head}=\lambda_{l1}\|b-\hat{b}\|_1+\lambda_{iou}\mathcal{L}_{iou}$,$\lambda_{l1}=5$、$\lambda_{iou}=2$,沿用 DETR 设定)、in/out 概率(Focal Loss)。训练 25 epoch(Adam,余弦学习率从 1e-3 退火,batch 128)再加 5 epoch 学习率 1e-5 微调,在 4 张 H100 上完成,可训练参数仅约 3.6M。

技术新颖性

与已有工作的本质差异有三点。第一,相对多分支线索融合方法(显式输入头框、姿态、深度、表情等中间表示),本文在推理时不依赖任何中间模型输出,是首个真正“文本可提示”的视线模型;相对 GazeDETR 等 DETR 式端到端视线检测器,后者虽能检测场景中所有人-视线对,却缺乏身份关联能力,仍需后处理把视线对回具体的人,级联误差依然存在。第二,相对当前最强的 Gaze-LLE——它把头部框作为位置提示注入冻结 DINOv2 特征——本文证明语义概念可以完全替代几何提示,且只需约 3.6M 可训练参数,而最强两级基线(Gaze-LLE + RexSeek)要带动 3B 参数的检测器。第三,数据层面的 Gaze-Co 是首个概念级标注的大规模视线基准,用统一模式整合了 GazeFollow/VAT/ChildPlay 三个数据集的训练与评测,并以“MLLM 先审 + 人工抽查”的在环流程把标注成本压到可控范围;这种“改造存量数据集”而非重新采集的数据引擎思路,对其他标注稀缺的人本任务也有方法论参考价值。

An overview of the GazeAnywhere end-to-end framework for PGE.
Figure 2: An overview of the GazeAnywhere end-to-end framework for PGE.
Overview of the GazeAnywhere data engine.
Figure 3: Overview of the GazeAnywhere data engine.
Training-set statistics of the Gaze-Co dataset.
Figure 7: Training-set statistics of the Gaze-Co dataset.

实验结果

主实验(Table 1)把三个 SOTA 视线模型(ViTGaze、Sharingan、Gaze-LLE)与四个 OVD(GroundingDINO-B、LLMDet-L、OWLv2-L、RexSeek)两两组合成 12 条两级基线。GazeAnywhere-DINOv3-L(870M 参数,96ms/张)在 GazeFollow-Concept 上取得 AUC 0.958、Avg L2 0.099、Min L2 0.050、AP 0.879,全面超过最强基线 Gaze-LLE+RexSeek(AUC 0.954、Avg L2 0.108、Min L2 0.054、AP 0.861,且后者参数 3B、时延 1183ms);VAT-Concept 上 L2 0.098 优于基线最好值 0.119。最关键的是 OOD 泛化:在 Child-SC 上 L2 0.090、AP 0.902,而所有两级基线 L2 在 0.136–0.349 之间、AP ≤0.856(如 Sharingan+GroundingDINO-B 的 L2 高达 0.349),直接验证了消除级联误差的价值;效率上 CLIP-L 版本仅 35ms,比最快的基线(ViTGaze+GroundingDINO-B,116ms)还快 3 倍以上。与通用 VLM 对比(Table 2):Gemini 2.5 Flash 与 Qwen3-VL-8B 的 L2 分别为 0.292/0.286、AP 0.661/0.651,被本文(0.123/0.879)大幅超越,说明该任务必须专用模型。提示策略消融(Table 3):文本提示与视觉提示基本打平(GazeFollow AUC 均 0.958),四类属性中外观与姿态贡献最大(单用外观 Avg L2 0.113、单用姿态 0.121,单用动作 0.129)。损失消融(Table 4):去掉 head 损失使 VAT L2 从 0.123 恶化到 0.135–0.136,而去掉 presence 损失只掉 AP,证明 head 损失反哺主任务、presence 损失只服务 in/out。编码器消融(Table 5):DINOv3-L(870M)胜过 CLIP-L、SigLIP2-L 乃至 1.9B 的 MetaCLIP2-H。冻结消融(Table 7):全冻结仅 3.6M 可训练参数时最好(AUC 0.958),解冻任一编码器都掉点(两者全解冻降至 0.931)。维度与层数消融(Table 8、9):$D=128$ 后性能饱和(部署取 256),检测器 3 层后趋稳。Agent 实验(Table 6):在 DigiLens ARGO 眼镜采集的 10 段真实视频上,每分钟注视转移计数 MAE 从裸 Gemini 2.5 Flash 的 9.247 降到 2.337,眼神接触 MAE 从 14.763 降到 4.756。

PGE results on four datasets.
Table 1: PGE results on four datasets.
Compare GazeAnywhere with SOTA VLMs.
Table 2: Compare GazeAnywhere with SOTA VLMs.
Comparison of different prompt strategies.
Table 3: Comparison of different prompt strategies.
Ablation experiment on loss selection.
Table 4: Ablation experiment on loss selection.
Comparison of different encoders for GazeAnywhere.
Table 5: Comparison of different encoders for GazeAnywhere.
Comparison of GazeAnywhere Agent and no agent framework.
Table 6: Comparison of GazeAnywhere Agent and no agent framework.
Comparison of the encoder frozen strategies.
Table 7: Comparison of the encoder frozen strategies.
Ablation experiment on the selection of the Detector Transformer dimension.
Table 8: Ablation experiment on the selection of the Detector Transformer dimension.
Ablation experiment on the selection of the transformer layer number in the Detector.
Table 9: Ablation experiment on the selection of the transformer layer number in the Detector.
Visualization of GazeAnywhere's gaze target estimation results from several datasets.
Figure 4: Visualization of GazeAnywhere's gaze target estimation results from several datasets.
Workflow of MLLM-powered GazeAnywhere Agent.
Figure 5: Workflow of MLLM-powered GazeAnywhere Agent.
Step-by-step explanation of how GazeAnywhere Agent works.
Figure 6: Step-by-step explanation of how GazeAnywhere Agent works.
DigiLens ARGO AR glasses used for video and audio capture and on-device feedback in the GazeAnywhere Agent.
Figure 8: DigiLens ARGO AR glasses used for video and audio capture and on-device feedback in the GazeAnywhere Agent.
Qualitative comparison of gaze-target localization conditioned on appearance prompts.
Figure 9: Qualitative comparison of gaze-target localization conditioned on appearance prompts.
查看结构化数据
任务指标本文基线提升
GazeFollow-Concept(文本提示 PGE) 热图 AUC ↑ 0.958(GazeAnywhere-DINOv3-L) 0.954(Gaze-LLE + RexSeek,最强两级基线) +0.004,同时参数量 870M vs 3B、时延 96ms vs 1183ms
GazeFollow-Concept Avg L2 ↓ 0.099 0.108(Gaze-LLE + RexSeek) 误差降低约 8.3%
VAT-Concept pixel L2 ↓ 0.098 0.119(Gaze-LLE + RexSeek) 误差降低约 17.6%
Child-SC(OOD 临床数据,40 名儿童) pixel L2 ↓ 0.090 0.136(两级基线最好,ViTGaze + RexSeek) 误差降低约 34%,最差基线高达 0.349
Child-SC(OOD 临床数据) in/out AP ↑ 0.902 0.856(两级基线最好) +4.6 个百分点
推理效率(batch=1,单张 L40S) 每样本时延 ↓ 35ms(CLIP-L 版)/ 96ms(DINOv3-L 版) 最快基线 ViTGaze + GroundingDINO-B 116ms;最慢 Gaze-LLE + RexSeek 1183ms 较最快基线快约 1.2–3.3 倍,较最慢快约 12 倍
与通用 VLM 零样本对比(GazeFollow-Concept) L2 ↓ / AP ↑ 0.123 / 0.879 Gemini 2.5 Flash 0.292 / 0.661;Qwen3-VL-8B 0.286 / 0.651 L2 误差降低约 57%,AP 提高约 22 个百分点
AR Agent 注视转移计数(10 段真实视频) Gaze Shift MAE/min ↓ 2.337(Gemini 2.5 Flash + Agent) 9.247(裸 Gemini 2.5 Flash) 误差降低约 74.7%;眼神接触 MAE 从 14.763 降至 4.756

局限与改进

作者承认的局限:概念提示被限定在外观/位置/姿态/动作四类短语的模板内,复杂指代(如“看门的那个人”)必须靠上层 Agent 把高级查询改写成低级短语才能处理;外观类别采用“感知呈现”(apparent presentation)而非验证后的身份属性,作者明确提示这可能引入感知偏差;训练集 69.6% 来自以成人为主的 GazeFollow,儿童数据占比低。我自己的补充观察:(1) 输出热图仅 64×64,配合 $\sigma=3$ 高斯标签,亚目标级定位精度受限,加回归精修头或更高分辨率解码应能继续提升;(2) 模型本质是单帧的,注视转移、眼神接触等时序指标完全依赖 Agent 外挂的启发式后处理,没有原生时序建模;(3) Child-SC 仅 40 名儿童、326 段视频且不公开,OOD 结论建立在单一私有临床数据集上;(4) 概念由 Gemini 2.5 Pro 生成而人工只抽查其通过样本,VLM 的系统性偏见可能进入训练标注;(5) in/out 只是二值判断,注视出画时的方向信息被完全丢弃,对孤独症筛查中关注的共同注意分析还不够;(6) 性能上界受冻结 DINOv3 特征约束,文本侧 dino.txt 的上下文长度固定,难以编码过长或抽象的描述。

独立分析的弱点

独立分析的弱点与改进方向:(1) 指代歧义无消解机制——“the person in the back”这类提示可能匹配多人,模型只会输出单一热图且无置信度提示,改进方向是输出 top-k 候选并允许用户二次澄清,或增加指代消解打分头;(2) 热图表示的精度天花板——64×64 分辨率下 Min L2 0.050 已接近输出量化极限,可在峰值邻域加亚像素回归或把 logits 上采样回原图分辨率;(3) 时序能力缺失——注视转移与共同注意等临床核心指标本质是时序事件,应把检测器扩展为流式时序 Transformer,让 gaze shift 成为原生输出而非 Agent 事后统计;(4) 公平性风险——从外观推断 man/woman/boy/girl 的感知标签可能在训练中被强化甚至误判,建议改用中性视觉描述聚类并发布偏差审计报告;(5) 概念模板刚性——四字段结构靠规则拼接,限制了组合式、关系式提示(如“穿红衣女孩的妈妈”),可引入轻量语言解析器或在图文对上做概念预训练;(6) 单人条件化——每次前向只分析一个人,多人场景需要多次推理,可扩展为集合预测式的一次输出所有人-视线对并保留提示接口。

未来方向

作者提出的方向:面向孤独症谱系(ASD)早期筛查——共同注意能力在 ASD 儿童中出现显著晚于典型发育儿童,概念提示让儿科医生甚至家长只需说“穿蓝衣服的孩子”即可长期、无创地在家追踪注视行为,免除手工画框的标注负担;并计划把“用概念指定分析对象”的思路推广到更广泛的行为分析任务。基于本文成果可延伸的研究:视频原生 PGE(时序 token 与事件级注视转移检测);3D 视线目标与出画方向回归;把 GazeAnywhere 作为工具接入更多 Agent 工作流(课堂注意力分析、人机交互评估、零售场景注意力研究);与 AR 眼镜结合的实时闭环干预(如检测到儿童长时间不与人眼神接触时实时提醒家长);利用模型与专家标注的分歧作为临床风险信号;以及在更大规模图文数据上做概念-视线联合预训练,减少对手工模板和商业 MLLM API 的依赖。

复现评估

复现条件较好。代码已在 github.com/IrohXu/GazeAnywhere 开源;Gaze-Co 训练集(119,525 条)完全由三个公开数据集(GazeFollow 69.6%、VAT 19.6%、ChildPlay 10.8%)改造而来,附录逐字公开了数据引擎的概念生成与校验 prompt、MLLM 基线 prompt 和 Agent prompt(Figures 10–15),三个概念化测试集(GazeFollow-Concept 2,436 条、VAT-Concept 5,301 条、ChildPlay-Concept 1,238 条)的人工校验协议也描述得很清楚。算力门槛:训练用 4×H100(25+5 epoch,batch 128,512×512 输入),但由于编码器冻结、可训练参数仅约 3.6M,实际训练开销主要在冻结编码器的前向/反向传播,中等规模实验室可以承受;推理只需单张 L40S。需要注意的坑:概念生成依赖 Gemini 2.5 Pro API(有成本且输出可能随模型版本漂移);唯一的 OOD 数据集 Child-SC 因 IRB 保护不公开,临床泛化结论无法独立复现,只能自建类似数据验证;论文未报告随机种子与方差信息。总体难度评估:中等,公共基准部分可较完整地复现。