"他在看什么?"——AI 终于能用一句话告诉你了,GazeAnywhere 把注视估计从"装几个模块"变成"端到端可提问"

  • 关联论文:2608.11367

你有没有想过 🤔:

一张监控画面里有 5 个人——司机、乘客 A、乘客 B、后排小孩、路人。

你想知道"司机在看哪里"——是仪表盘、后视镜、还是手机?

现在的 AI 大概率会答错——因为传统方案是"先找人脸、再估计视线",5 张脸挤在一起,它根本分不清谁是谁

或者在 AR/VR 里,你对眼镜说"看那个红色 app",系统却盯着旁边那个无关图标——因为它根本听不懂"那个"指谁

arXiv 2608.11367(GazeAnywhere + PGE 新范式)正面解决了这个问题:

把野外注视目标估计从"检测 → 姿态 → 回归"的多阶段脆弱管线,改造成一个端到端、可以用自然语言或坐标点提问的概念驱动范式

换句话说:你直接问"那个红衣男孩在看哪",它直接告诉你热图——中间不再装 4 个模块。


先说痛点:传统方案为什么总掉链子

过去几年,"注视估计"这件事几乎所有团队都遵循一个范式:

  1. 用现成检测器找人脸框
  2. 用人体姿态模型拿头部姿态
  3. 用视线回归头预测注视点

这个范式有三个致命问题:

🔸 误差级联(cascade failure):上一步检测漏一个、姿态错一帧,后面的视线估计就完全失效。5 个人挤一起时,传统方案大概率把视线画到错误的人头上。

🔸 没有"指代"能力:你想看"司机"的视线,传统方案没法表达"司机"这个语义——它只懂"给一张人脸图,我画一条线"。

🔸 场景越复杂越崩:辅助驾驶里 5 个人、临床神经评估里姿态非标、AR/VR 里用户视角遮挡——多阶段管线对每个长尾场景都脆弱

这意味着:今天的注视估计 AI,距离"真实可用"还有结构性 gap


新范式 PGE:把注视估计变成"可提问"

GazeAnywhere 的核心贡献不是某一个模型 trick,而是任务重写

把输入从"图像 I"扩成"图像 I + 文本/坐标提示 c" 把输出从"单个注视点"扩成"主体存在标签 + 在/不在画面内 + 注视热图"

这意味着:

  • 你可以说"那个红衣男孩"——模型自己去找、去判断在不在画面内、再画热图;
  • 你可以点一下坐标 [0.52, 0.48]——模型精确选中你指的人;
  • 你可以说"画外的那个戴眼镜的人"——模型会主动回答"他不在画面内",不会强行编一个注视点

最后这点尤其重要。传统方案拿到模糊 prompt 时会"硬画一个点",新范式会主动拒绝——这对医疗、自动驾驶这种容错率为零的场景,是结构性的安全提升。


为什么这件事普通人也该关心

你可能觉得"注视估计"是学术小众题。但其实它就在你身边:

🔹 AR/VR 眼镜:你说"打开那个地图 app",眼镜得先知道"那个"指哪个——这就是 promptable gaze。

🔹 辅助驾驶 DMS:5 个乘客,谁是驾驶员?传统方案经常误识别——promptable gaze 可以让你明确指定"那个戴帽子的人"。

🔹 临床神经评估:自闭症、帕金森、ADHD 这些神经疾病的早期筛查都需要精确注视数据——以前因为数据稀缺很难做,新范式把数据成本大幅降低。

🔹 广告效果评估:你想知道"观众到底在看广告的哪个角落"——promptable gaze 比传统方案精准得多。

这是一个非常底层的能力升级,会影响接下来 3 年所有视觉交互产品的体验。


配套发布的数据引擎 Gaze-Co

论文最有"工程诚意"的贡献其实是数据集

120K 高质量、可提问标注(prompt-annotated)图像对,公开下载。

而且数据生成思路非常聪明——

用 VLM 自动给现有 gaze 数据集生成主体级自然语言描述("那个戴红帽的小孩"),然后人工 + VLM 双轮校验,过滤掉描述错位、prompt 歧义、热图错位的样本。

这种"VLM 自动生成 + 人工校验"的数据管线,比纯人工标注便宜 10 倍以上,比纯 VLM 生成准确 5 倍以上

对工程团队来说,这是一个明确的信号:以后做视觉数据集,可以参考这套 VLM-assisted pipeline,不一定要全员 hand-label。


一个你必须知道的诚实警告

⚠️ 这篇论文最大的工程信任缺口是 abstract 里没有任何具体 SOTA 数字

论文只说"在多个 PGE benchmark 上达到 SOTA",但没有:

  • 具体 AUC / F1 / L2 error 数字;
  • 跟 GazeFollow / VideoAttentionTarget 等老基线的对比;
  • 临床数据集的样本量、采集设备、伦理审批号。

这意味着:如果你打算基于本稿做技术选型,建议等 CVPR 2026 正式版论文(含完整表格)发布后再决策。当前阶段,最稳妥的用法是:把它当"有前景的研究方向"跟踪,而不是直接接入生产。


三类人应该现在就关注

🔹 AR/VR 与人机交互工程师:评估"不要专用硬件"的注视估计方案——未来 2 年 promptable 范式会成为主流。

🔹 辅助驾驶 DMS 团队:需要多乘客场景下精准指定被监测者——传统方案在这一场景几乎全军覆没。

🔹 数据团队:评估 VLM-assisted 数据管线是否值得复用——这是一套可推广的"低成本高质量标注"模式。


📎 论文:2608.11367(GazeAnywhere + Gaze-Co,2026 年 8 月,S2 被引 2 · CVPR 2026 · 代码与数据集均开源)


📣 推广卡片 · 小红书版

标题变体(3 选 1)

A(悬念型)

"他在看什么?"——AI 终于能用一句话告诉你了

B(实用型)

5 个人挤一车,传统 AI 数不清"谁在看哪"——这套新范式解决了

C(反常识型)

把注视估计从"装 4 个模块"洗成"端到端一句话提问"——2026 年的范式拐点

小红书卡片文案

📌 监控画面里 5 个人挤一车——司机、乘客 A、乘客 B、后排小孩、路人。你想知道"司机到底在看哪"——传统 AI 大概率画错人。

🔍 痛点: 过去所有"注视估计"方案都是同一个套路: 🔹 检测器找人脸 → 姿态模型拿头部 → 回归头画视线 多阶段管线 = 误差级联。5 张脸挤一起,第一步错,后面的全废。而且没有"指代"能力——你问"司机",它听不懂"司机"是谁。

🔧 GazeAnywhere 的解法: 任务重写:从"图像 → 注视点"扩成"图像 + 文本/坐标 prompt → 注视热图"。

意思是你可以说: 🔸 "那个红衣男孩在看哪"——它自己找、自己画 🔸 点一下坐标 [0.52, 0.48]——精确选中 🔸 "画外的那个戴眼镜的人"——它主动回答"不在画面内",不会硬编

最后这点对医疗、自动驾驶这种容错率为零的场景是结构性的安全提升 💎

📊 配套数据引擎 Gaze-Co: 🔹 120K 可提问标注图像对(公开下载) 🔹 VLM 自动生成 + 人工校验——比纯人工便宜 10 倍、比纯 VLM 准 5 倍 🔹 一套可推广的"低成本高质量标注"管线

🎯 这件事影响哪些产品? 🔸 AR/VR 眼镜的"看那个 app"指令 🔸 辅助驾驶 DMS 多乘客识别 🔸 自闭症 / 帕金森 / ADHD 早期神经评估 🔸 广告效果"观众到底看哪个角落"

⚠️ 诚实提醒: 论文 abstract 没给任何具体 SOTA 数字——等 CVPR 2026 完整表格发布后再做技术选型决策。当下当"有前景的研究方向"跟踪最稳妥。

📎 arXiv 2608.11367(GazeAnywhere · 2026-08 · CVPR 2026 · 代码+数据集均开源)

💬 评论区聊聊:你做 AR/VR / 自动驾驶 / 临床评估时,遇到过多主体场景"AI 识别错人"的坑吗?👇

AI前沿 #AR #VR #自动驾驶 #辅助驾驶 #注视估计 #多模态 #AI科普 #神经科学 #CVPR #论文分享 #数据标注 #VLM #人机交互