请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。前者需要 AI 助手根据当前场景服务用户,后者则需要调用跨越数天的记忆,总结用户生活规律。
然而,当前的第一人称视频助手大多停留在两种范式:被动响应式(Reactive)——用户单次提问,模型单次作答;半主动式(Semi-proactive)——用户预先给定指令,模型监测预定义事件并触发回复。二者都无法基于用户的历史、习惯与当前活动,自主判断「此刻是否真的需要打扰用户」。「第一人称视频助手在何时、以何种方式主动开口?」的问题依然有待被解决。
针对这一研究空白,来自大连理工大学、Alaya Lab 与东京大学的团队联合提出 Vinci2,将主动服务(Proactive Assistance)形式化为一个基于持续视频流的「决策 + 生成」联合任务:智能体在每个时刻不仅要感知正在发生什么,还要基于长时程累积的上下文,决定当前是否介入、如何介入。Vinci2 包含两大核心组件:首个主动服务评测基准 EgoServe,以及免训练的记忆增强智能体 EgoMemo。

目前,该工作已被计算机视觉顶级会议 ECCV 2026 接收,其代码和数据集标注均已开源。

现有视频理解基准难以评测「主动性」:离线视频问答基准只考察对预分割片段的理解,流式视频理解基准不涉及长期记忆和介入决策,已有的主动对话基准则依赖于用户预先给定的显式指令。EgoServe 是首个同时具备第一视角、多天时间跨度、主动服务评测与流式推理协议的基准,构建于 EgoLife(多人多天连续日常记录)、HoloAssist(任务型交互)与 CaptainCook4D(含错误执行的烹饪记录)的基础上,覆盖超过 128 小时视频、超 3400 个服务实例。
EgoServe 的核心设计在于按照服务所需的时间记忆跨度以及服务本身的应用场景,将主动服务组织为 4 个层级、10 个子类别:
数据集的标注过程采用半自动流水线:以各数据集已有的人工标注为基础,用类别定制化提示驱动 LLM(如 Gemini)生成候选服务实例;针对长期服务引入「流式线索捕获」策略,让模型根据密集人工注释跨天累积事件线索,确保长期服务源于真实的多天行为模式。全部标注经人工校验。评测同时考察时序精度(介入是否落在真值触发窗口内、类别是否匹配,报告各类别 F1)与回复质量(LLM 评分)。

研究团队构造了免训练智能体 EgoMemo,持续处理第一人称视频,以流式方式对输入视频帧构建多模态记忆并进行检索增强推理。
在流式记忆构造阶段,EgoMemo 增量维护三种互补的记忆表征:
(1)多尺度时序记忆:首先对输入的视频片段进行均匀帧采样,并通过 VLM 生成带有时间标记的细粒度描述,而后将细粒度描述逐层组织为片段级—活动级—会话级三层摘要,兼顾细粒度感知细节与长时程行为规律。
(2)演化知识图谱:利用 LLM 从片段级描述中提取实体与关系并增量合并,得到跨越视频整体的全局知识图谱,为跨时间的语义关联建立结构化索引。
(3)视觉嵌入档案:为了对文本记忆中可能缺失的视觉线索进行补充,利用 ImageBind 对关键帧编码存储,补足文本难以描述的物体外观与空间布局信息。
在检索增强的推理阶段,EgoMemo 流式接收之前生成的片段级视频描述。在主动服务模式下,模型需要评估当前场景下是否需要进行主动干预。在被动响应模式下,模型则直接对某一时刻的用户问题作出响应。在两种模式下,推理模型均会判断是否需要调用深度检索,若需要,则生成检索查询并激活三重并行检索机制。
(1)多尺度时序检索:直接将检索查询编码为密集嵌入,并查找 top-k 相似度的描述。
(2)基于图的语义检索:先从检索查询中提取关键词,而后将关键词编码并在知识图谱中查找相似度高的节点,而后提取这些节点的相邻节点及中间关系,将节点中的实体映射为片段级描述。
(3)视觉相似度检索:先利用 LLM 改写检索查询,使其包含视觉特性,而后通过 ImageBind 编码并获取相似度最高的关键帧特征,进而提取其对应的片段级描述。
(4)VLM 描述重构:将基于图和视觉提取到的片段级描述及其对应的视频帧重新注入 VLM,提示其根据检索 query 重新生成新的描述,进而将原始偏离查询的描述整合为面向查询的连贯叙述。
最后,将重构的描述以及时序检索出的原始片段级描述作为上下文重新注入推理模型,并输出介入决策或问题回复。
EgoMemo 架构不仅可以同时支持主动服务与被动问答两种模式,还可通过「由粗到细粒度」的感知策略无缝迁移到离线视频理解任务,提供全局信息的同时保持对细节证据的访问。

研究团队分别在 EgoServe 和多个在线以及离线视频理解基准上评测了 EgoMemo,取得了多个 SOTA 结果。
在 EgoServe 上的实验结果表明:
(1)EgoMemo 依靠其多尺度记忆和推理检索机制大幅超越闭源模型 Qwen3-VL-Plus 和 GPT-5-mini,其中情景服务和长期服务的提升最为显著(ML 达到了 4.9,RO 达到了 11.8)。这体现出在没有累积上下文的情况下,再强的 VLM 也无法提供有意义的主动服务。
(2)消融实验说明,描述重建与图谱检索的贡献最大,且三条检索通路互为补充,不可替代。

EgoMemo 的架构同样能很好地泛化到现有视频评测基准中:在 OVO-Bench 上,实时感知类问题的平均准确率为 75.15,大幅超越 GPT-4o(64.46);在 ESTP-Bench 显式主动任务上以 27.6 超过经过训练的 EyeWO(23.6);在离线基准 EgoSchema 上以 74.8 的准确率超越此前最佳 7.2 个点,QAEgo4D 上亦取得 68.0 的最佳成绩。


Vinci2 首次将「是否介入、何时介入、如何介入」作为显式的推理问题引入第一人称视频助手,用 EgoServe 定义了评测标准,用 EgoMemo 证明了免训练路线的可行性。当前所有方法的绝对分数仍不高,恰恰说明主动服务是一个远未解决、值得深挖的方向。基准与代码均已开源,欢迎社区在此基础上探索介入时机学习、音频上下文与多用户场景等后续方向。
本文第一作者龚思同为大连理工大学卢湖川团队博士生,前三位共同作者均为 Alaya Lab 实习生。大连理工大学卢湖川团队的主要研究方向为目标跟踪与显著性目标检测。Alaya Lab 侧重于世界模型与游戏智能体研究。东京大学佐藤洋一实验室的主要研究方向为第一人称视觉与人类行为感知理解。通讯作者黄逸飞为东京大学博士后和 Alaya Lab 研究员,研究方向为第一人称视觉与具身智能。
文章来自于"机器之心",作者 "龚思同"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【免费】ffa.chat是一个完全免费的GPT-4o镜像站点,无需魔法付费,即可无限制使用GPT-4o等多个海外模型产品。
在线使用:https://ffa.chat/