登录
原创

VisionClaw 论文精读:当智能眼镜从“看见世界”走向“替你行动”

发布于 2026-09-28 阅读 25
  • 大语言模型
  • Agent
原创

论文名称: VisionClaw: Always-On AI Agents Through Smart Glasses
研究方向: 智能眼镜、多模态大模型、AI Agent、可穿戴计算、人机交互
核心关键词: Smart Glasses、Multimodal AI、Agentic Systems、Egocentric Perception、Always-On AI、Situated Interaction
论文版本: arXiv Preprint,2026年4月
论文地址: arXiv:2604.03486
开源项目: Intent-Lab/VisionClaw

1. 前言:如果 AI 能直接理解你眼前的世界

假设你正在商场里挑选一款商品。

你拿起商品,看了一眼,然后对眼镜说:

“帮我查一下这个商品的评价和价格。如果评价不错,就加入我的 Amazon 购物车。”

理想情况下,AI 应该自动完成以下任务:

  1. 从眼镜画面中识别你手里的商品;
  2. 理解“这个商品”指向哪个现实对象;
  3. 在网页中搜索对应商品;
  4. 查询商品价格和用户评分;
  5. 判断评价是否满足你的要求;
  6. 将符合条件的商品加入购物车;
  7. 通过语音告诉你任务是否完成。

整个过程中,用户不需要拿出手机,不需要拍照上传,不需要手动输入商品名称,也不需要在多个应用之间切换。

这正是 VisionClaw 想要实现的交互方式。

过去,智能眼镜擅长“看见”,AI Agent 擅长“行动”。但两者往往彼此分离:眼镜知道用户正在看什么,却无法替用户执行复杂任务;Agent 能够操作浏览器、邮件和日历,却不知道用户此刻身处什么环境。

VisionClaw 的思路,是把这两部分连接起来,让现实世界中的物体、文档和场景直接成为 Agent 的任务上下文。

它希望实现的不只是一个“戴在脸上的聊天机器人”,而是一个能够持续感知现实环境、理解用户意图,并调用数字工具完成任务的可穿戴 AI Agent。

2. 现有 AI 系统为什么还不够

VisionClaw 所针对的技术缺口,主要来自两条相对独立的发展路线。

2.1 路线一:越来越强的通用 AI Agent

近年来,AI Agent 已经可以调用外部工具完成多步骤任务,例如:

  • 搜索网页;
  • 操作浏览器;
  • 编写和整理邮件;
  • 管理日历;
  • 创建笔记;
  • 操作手机或电脑界面;
  • 调用文件系统;
  • 控制智能家居;
  • 从个人数据中检索信息。

这类 Agent 已经不再局限于生成文字,而是可以通过工具调用改变外部系统的状态。

例如,用户可以要求 Agent:

“帮我搜索下周去东京的航班,选择上午出发的方案,并整理成表格。”

Agent 可以规划步骤、调用搜索工具、访问网页、提取结果并生成文件。

但这类系统大多运行在手机或电脑中,交互仍然以屏幕为中心。

如果任务来自现实环境,用户必须先把现实信息转化为数字输入。例如:

  • 给收据拍照并上传;
  • 把海报内容输入聊天框;
  • 手动描述眼前的商品;
  • 复制设备型号;
  • 切换到另一个应用完成后续操作。

换句话说,Agent虽然能够行动,却缺乏对用户现实处境的持续感知。

2.2 路线二:越来越强的智能眼镜和多模态助手

另一条路线是可穿戴设备和多模态视觉助手。

智能眼镜可以通过摄像头和麦克风获取用户的第一视角信息,从而支持:

  • 物体识别;
  • 文本阅读;
  • 环境描述;
  • 实时问答;
  • 导航和任务指导;
  • 无障碍辅助;
  • 语音与手势交互。

用户可以看着一个物体问:

“这是什么?”

也可以看着设备问:

“这个按钮应该怎么使用?”

但多数智能眼镜仍然停留在识别、解释和建议阶段。它们可以告诉用户下一步应该做什么,却不能真正替用户打开浏览器、写邮件、创建日历事件或购买商品。

也就是说,这类系统能够看见,却缺乏通用的任务执行能力。

2.3 VisionClaw 要弥合的断层

VisionClaw 将现有系统的能力差异概括为:

系统类型 感知现实环境 执行数字任务
多模态智能眼镜 支持 通常不支持
手机或桌面AI Agent 通常不支持 支持
VisionClaw 支持 支持

它的关键目标,是把“现实感知”和“数字行动”连接成一个连续闭环。

用户不再需要先把现实世界的信息搬到屏幕里,再让软件处理,而是可以直接针对眼前的对象发起行动。

3. VisionClaw 的三个设计目标

论文为 VisionClaw 提出了三个系统设计目标。

3.1 持续的环境感知

系统应当持续接收用户的视觉和听觉上下文,而不是每次都要求用户主动拍照、上传文件或描述环境。

这样一来,用户可以直接使用“这个”“刚才那张海报”“我手里的商品”等自然指代,而不必重复提供完整背景。

持续感知还意味着,系统可能利用几秒钟前已经看到或听到的信息。例如,用户已经将论文移出视野,随后才说:

“把刚才那篇论文的作者信息整理一下。”

如果系统保留了前面的视觉上下文,它仍然可能理解用户的指代。

3.2 实时、自然的语音交互

系统应当支持连续、低门槛的自然语言对话。

用户不需要记忆固定口令,也不需要把复杂任务一次性表达完整。任务可以在多轮对话中逐渐形成:

“这是什么产品?”
“评价怎么样?”
“有没有更便宜的?”
“那就把第二个加入购物车。”

这种交互比传统语音助手的单轮命令更接近人与人之间的协作过程。

3.3 Agent式任务执行

当用户表达了一个可以执行的意图时,系统不应只给出建议,而应调用外部服务真正完成任务。

例如:

  • 看到海报后创建日历事件;
  • 看到论文后起草合作邮件;
  • 看到收据后创建结构化笔记;
  • 看到商品后查询评价并加入购物车;
  • 听到会议内容后保存摘要;
  • 看到设备后搜索故障处理方法;
  • 通过语音控制智能灯。

VisionClaw 希望形成一个完整的“看见—理解—行动—反馈”循环。

4. 核心思想:连接感知、记忆与行动

VisionClaw 最核心的技术思路,可以概括为:

第一视角感知
    ↓
多模态意图理解
    ↓
Agent任务规划
    ↓
外部工具执行
    ↓
执行结果反馈
    ↓
继续多轮对话

这套闭环中包含三个过去经常被分开处理的能力。

感知

系统通过眼镜理解用户正在看什么、听什么以及身处什么场景。

记忆

系统可以访问历史对话、邮件、笔记、日历和其他个人数据,从而回答跨时间的问题。

行动

系统能够调用浏览器、消息平台、文件系统和智能设备,改变外部世界的状态。

三者结合之后,用户可以在现实任务出现的现场直接发起数字操作。

例如,看见一张学术会议海报时,用户可以要求:

  1. 识别会议名称、时间和地点;
  2. 查询演讲者的研究背景;
  3. 检查自己的日历;
  4. 创建会议日程;
  5. 将相关信息保存到 Notion;
  6. 把海报分享给研究小组。

这已经不是传统意义上的视觉问答,而是一条横跨现实感知、互联网检索、个人数据和数字工具的任务链。

5. 系统架构:一个负责交流,一个负责办事

VisionClaw 并没有训练一个全新的端到端模型,而是采用分层架构,将不同组件的优势组合起来。

系统可以划分为三层:

────────────────────────────
         感知输入层
  Meta Ray-Ban + 手机应用
────────────────────────────
             ↓
         音频与图像
             ↓
────────────────────────────
        多模态交互层
        Gemini Live
    感知、对话与意图判断
────────────────────────────
             ↓
      execute 工具调用
             ↓
────────────────────────────
        Agent 执行层
          OpenClaw
  浏览器、邮件、日历与文件等
────────────────────────────
             ↓
          执行结果
             ↓
    Gemini Live 生成语音反馈

5.1 感知输入层:Meta Ray-Ban 和手机应用

VisionClaw 使用 Meta Ray-Ban 智能眼镜作为主要感知设备。

眼镜提供:

  • 第一视角摄像头;
  • 内置麦克风;
  • 音频播放能力;
  • 与手机连接的数据通道。

设备通信通过 Meta Device Access Toolkit,也就是 DAT SDK 完成。

眼镜原始视频流的帧率为24 FPS,但 VisionClaw 不会将全部视频发送给模型。系统将其限制为大约每秒1帧,并将画面压缩为50%质量的 JPEG。

这是一项非常现实的工程权衡。

如果持续上传24 FPS高清视频,将显著增加:

  • 网络流量;
  • 模型调用成本;
  • 手机计算开销;
  • 眼镜功耗;
  • 服务端处理压力。

对于商品识别、文档阅读和场景理解而言,每秒一帧往往已经能够提供基本上下文。但在快速运动、精细操作或短暂事件中,这一采样率也可能丢失关键信息。

系统还支持纯音频模式。当用户只需要处理邮件、日历或语音记录时,可以关闭视频,以延长续航并降低网络压力。

5.2 多模态交互层:Gemini Live

VisionClaw 使用 Gemini Live API,并通过持久 WebSocket 连接持续发送音频和画面。

论文中采用的是:

gemini-2.5-flash-native-audio-preview

这个模型可以直接处理原始音频,不需要先将语音转换成文字,再交给语言模型。

传统流水线通常是:

语音识别
    ↓
文本语言模型
    ↓
语音合成

而原生音频模型可以直接理解语音中的语速、语气、停顿和强调信息,并直接生成语音响应。

Gemini Live 在系统中负责:

  • 接收音频和图像;
  • 理解用户所处环境;
  • 处理自然语音对话;
  • 维持当前会话上下文;
  • 理解“这个”“刚才那个”等指代表达;
  • 判断请求是否需要调用外部工具;
  • 将任务整理为可执行描述;
  • 将执行结果转换为简洁的语音反馈。

它更像 VisionClaw 的“前台大脑”。

5.3 Agent执行层:OpenClaw

真正执行外部任务的是 OpenClaw。

OpenClaw 可以运行在本地计算机或云端服务器上,并提供多种技能,包括:

  • 浏览器自动化;
  • 网页搜索;
  • 邮件收发与整理;
  • 日历和提醒管理;
  • Notion笔记;
  • 云盘文件;
  • Slack等消息平台;
  • GitHub;
  • 文件操作;
  • 命令行执行;
  • HomeKit智能家居;
  • 个人记忆检索。

当 Gemini 判断用户的请求涉及外部行动时,会调用统一的 execute 工具。

例如,用户说:

“把这个活动加入我的日历。”

Gemini需要先从画面中提取活动名称、时间和地点,再生成类似下面的任务描述:

在用户日历中创建一个活动:
名称为……
时间为……
地点为……
信息来自用户当前正在查看的海报。

OpenClaw 接收描述后,调用相应的日历工具完成操作。

任务执行结果会返回 VisionClaw 客户端,再发送给 Gemini。Gemini 最后向用户播报:

“已经帮你加入日历了。”

5.4 快模型与慢Agent的协作

从系统角色看,VisionClaw 实际上采用了“快慢双系统”:

  • Gemini Live负责快速感知、对话和任务分发;
  • OpenClaw负责相对缓慢但能力更强的工具执行。

这种架构具有明显优势:

  • 实时语音不会被复杂工具执行完全阻塞;
  • 感知模型和Agent框架可以分别升级;
  • 可以复用OpenClaw已有的工具生态;
  • 新增外部服务不需要修改眼镜端逻辑。

但问题也同样明显:

  • 任务需要经过多个组件;
  • 上下文可能在组件之间丢失;
  • 自然语言任务描述可能产生歧义;
  • 错误来源难以快速定位;
  • 用户难以判断任务停在哪一层;
  • 整体响应时间较长。

6. 一个值得关注的设计:Gemini只有一个执行工具

论文附录给出了 VisionClaw 使用的完整系统提示词。

其中一个重要设计是:Gemini 自己不被允许假装拥有邮件、日历、搜索或长期记忆能力。

它只有一个外部工具:

execute

系统提示词明确告诉 Gemini:

  • 你只是语音界面;
  • 你没有持久记忆;
  • 你不能直接访问历史对话;
  • 你不能直接读取邮件、笔记和日历;
  • 你不能自己搜索外部信息;
  • 所有这些任务都必须交给 execute。

当用户提出以下请求时,Gemini必须调用工具:

  • 搜索或查询外部信息;
  • 发送任何平台的消息;
  • 查询过去发生的事情;
  • 访问邮件、日历、提醒或笔记;
  • 保存需要长期保留的信息;
  • 创建、更新或删除内容;
  • 控制应用、服务和智能设备;
  • 进行研究、分析或内容起草。

提示词还特别强调:

只要用户提到了过去时间,例如“上周”“之前”“我有没有”“我们当时说了什么”,就必须调用 execute,不能根据当前对话伪造长期记忆。

这一规则非常重要,因为它在架构层面区分了两种上下文:

  • Gemini当前会话中的短期上下文;
  • OpenClaw或外部存储中的长期个人记忆。

这样可以减少一种常见错误:模型根据模糊对话内容,假装自己记得用户过去做过什么。

6.1 工具调用前必须先口头确认

系统提示词还要求 Gemini 在调用 execute 前,先给出简短的语音确认,例如:

  • “好的,我帮你查一下。”
  • “收到,正在搜索。”
  • “没问题,我来发送。”
  • “我去看看之前的笔记。”

这一步看似简单,却解决了无屏幕系统中的一个重要问题:用户需要知道系统已经听到了自己的请求。

如果Agent默默执行十几秒,用户可能无法判断:

  • 系统有没有听见;
  • 是否需要重新说一遍;
  • 当前是否正在工作;
  • 网络是不是已经中断。

不过,这种一次性的确认仍然不够。对于持续十几秒甚至更长的任务,系统还需要阶段性进度反馈。

7. 典型使用场景

作者将长期部署中出现的任务归纳为六类:沟通、检索、保存、回忆、购物和控制。

7.1 沟通:Communicate,14%

沟通类交互包括:

  • 听取未读邮件摘要;
  • 批量归档邮件;
  • 起草和发送邮件;
  • 管理 Outlook 收件箱;
  • 将眼前的研究海报分享到 Slack;
  • 拍摄家中损坏的设施并发送给房东;
  • 向群聊发送消息;
  • 管理通知。

一个典型场景是,用户早晨刷牙时听取邮件摘要,然后说:

“除了 Sara 的邮件,其他都归档。”

这类使用方式的价值不只是免去打字,而是允许用户在双手被占用时处理信息。

但它也带来了控制问题。如果系统错误理解了“除了谁之外”的范围,可能造成批量误操作。因此,批处理任务应该提供清晰的撤销能力。

7.2 检索:Retrieve,30%

检索类交互是占比最高的一类。

它既包括普通公共信息查询:

  • 天气;
  • 新闻;
  • 股价;
  • 电影场次;
  • 产品信息;

也包括结合现实场景的查询:

  • 看着一群排队的人询问他们在等什么;
  • 让系统识别电饭煲型号并寻找故障处理方法;
  • 看着冰柜中的酸奶询问品牌和营养信息;
  • 在会议前结合日历和网页生成参会人背景资料。

相比普通语音搜索,VisionClaw 的优势在于用户不必完整描述搜索对象。

7.3 保存:Save,16%

用户可以用 VisionClaw 保存:

  • 收据;
  • 研究海报;
  • 酒店欢迎页;
  • 饮食记录;
  • 临时研究灵感;
  • 会议内容;
  • 当前对话;
  • 口述的论文摘要。

保存过程不仅是采集图片,还可能包括:

  1. 识别内容;
  2. 提取关键字段;
  3. 生成摘要;
  4. 选择存储位置;
  5. 建立可检索记录。

例如,用户看着酒店说明页说:

“把这些酒店信息保存下来。”

系统可以提取 Wi-Fi 密码、早餐时间和设施信息,并保存为结构化笔记。

7.4 回忆:Recall,12%

回忆类交互体现了 Agent 与个人数据结合后的价值。

用户可能询问:

  • 航班确认号;
  • 上次会议结论;
  • 一周内吃过什么;
  • 上次来某个地点的时间;
  • 之前交给Agent的任务结果;
  • 数年前某一天发生的事情。

这里的“回忆”不是模型自身参数中的知识,而是对邮件、日历、笔记、历史对话和个人日志的检索。

当用户身处某个地点或正在进行某项活动时,当前情境会自然触发回忆需求。这种“情境触发的记忆检索”是可穿戴设备区别于桌面聊天框的重要特点。

7.5 购物:Shop,19%

购物类任务包括:

  • 识别眼前商品;
  • 搜索线上同款;
  • 查询评价;
  • 比较价格;
  • 查找其他尺寸;
  • 修改筛选条件;
  • 加入购物车;
  • 补购日常用品。

一个任务可能从现实物体开始:

“查一下这个耳机。”

随后逐渐演变为:

“有没有更便宜的?”
“只看支持降噪的。”
“不要三星。”
“把第二个加入购物车。”

这体现了多轮上下文与工具执行的结合。

7.6 控制:Control,9%

控制类任务包括:

  • 开关智能灯;
  • 修改灯光颜色;
  • 设置室内温度;
  • 整理文件;
  • 修改 LaTeX 文档;
  • 上传会议录像;
  • 创建 GitHub issue;
  • 调试定时任务;
  • 分析设备错误日志。

这意味着智能眼镜有可能成为数字设备和物联网服务的统一入口。

但与查询任务相比,控制任务会改变外部状态,因此更需要权限、确认、日志和撤销机制。

8. 受控实验如何设计

作者招募了12名参与者:

  • 9名男性、3名女性;
  • 平均年龄27.8岁;
  • 年龄标准差6.16;
  • 对普通AI助手的熟悉度为6.0/7;
  • 对AI Agent的熟悉度为3.92/7;
  • 对语音助手的熟悉度为3.92/7;
  • 只有1人有AI智能眼镜使用经验。

每次实验约90分钟,参与者获得30美元报酬。

8.1 三种实验条件

实验采用被试内设计,每位参与者都体验三种系统。

条件A:只有持续感知

设备为 Meta Ray-Ban 和 Gemini Live。

系统可以看见环境并回答问题,但不能执行外部任务。参与者需要自己拿出手机完成创建笔记、写邮件等操作。

条件B:只有Agent

参与者使用手机上的 OpenClaw。

系统能够执行任务,但无法看到现实环境。参与者必须通过语音转文字或文本输入主动描述上下文。

条件C:VisionClaw

系统同时拥有视觉感知和 Agent 执行能力。

参与者可以看着现实材料发出语音请求,由系统提取信息并执行任务。

这种三条件对照设计具有较强的解释力,因为它试图分别隔离:

  • 感知能力的作用;
  • Agent执行能力的作用;
  • 两者结合后的作用。

8.2 四类任务

实验设计了四个与现实物体相关的任务。

任务一:收据笔记

根据纸质收据,在 Notion 中创建笔记,包含:

  • 商店名称;
  • 购买商品;
  • 总价格。

任务二:邮件起草

根据一篇打印论文,在 Gmail 中起草合作邮件,发送对象为论文第一作者,并提出合作意向。

任务三:商品查询

根据打印的书籍封面查询 Amazon 评分。如果评分高于4.5,则加入购物车。

任务四:设备控制

根据给定指令开关智能灯,或修改灯光颜色。

8.3 如何控制学习效应

每位参与者都要在三种条件下完成相似任务,因此可能出现学习效应。

作者采取了两项措施:

  • 使用拉丁方平衡三种条件的体验顺序;
  • 为每类任务准备三个不同实例,例如不同收据、论文和书籍封面。

这样可以避免参与者在第二次或第三次实验中直接记住答案。

8.4 测量指标

研究记录了:

  • 任务完成时间;
  • 任务成功率;
  • 主观难度;
  • NASA-TLX认知负荷;
  • 感知控制;
  • 可靠性;
  • 信任;
  • 易用性;
  • 实用性;
  • 完成信心。

任务成功的判定允许出现轻微拼写错误,但如果关键信息缺失、错误,或者结果已经难以使用,则判定为失败。

9. 实验结果:更快、更轻松,但不一定更可靠

9.1 完成时间

四项任务的平均完成时间如下:

任务 VisionClaw 只有Agent 只有感知
收据记笔记 102.20秒 127.72秒 149.29秒
起草邮件 105.74秒 131.11秒 216.42秒
商品查询 93.01秒 101.48秒 88.90秒
设备控制 41.48秒 31.90秒 86.05秒

论文摘要总体报告称,VisionClaw 带来了13%至37%的任务速度提升。

但如果进一步查看统计检验,会发现结果需要谨慎解释。

收据笔记

三种条件的总体差异达到显著水平,但在进行多重比较校正后,VisionClaw 与“只有感知”之间的两两差异没有达到传统的0.05显著性标准。

这意味着从平均时间看 VisionClaw 更快,但现有样本还不足以充分证明差异稳定存在。

邮件起草

VisionClaw 显著快于“只有感知”。

这是最能体现系统优势的任务之一,因为用户既要从现实论文中提取作者和研究信息,又要进入数字系统生成邮件。

如果没有Agent,参与者即使能通过眼镜读取论文,最后仍需要手动操作手机。

商品查询

三种条件没有显著差异。

“只有感知”条件甚至在平均值上略快。这可能是因为商品查询本身较简单,参与者熟悉手机购物流程,而 Agent 自动化没有节省足够多的时间来抵消调用和等待成本。

设备控制

VisionClaw 和“只有Agent”都显著快于“只有感知”。

这表明设备控制的主要效率来源是 Agent 执行,而不是视觉感知。毕竟用户不一定需要摄像头才能说“把灯关掉”。

因此,更准确的实验结论不是“智能眼镜在所有任务中都更快”,而是:

当任务同时依赖现实材料和数字操作时,感知与执行的结合更可能体现优势;当任务主要依赖执行能力时,手机Agent也可以取得相似甚至更好的效率。

9.2 主观难度

论文报告 VisionClaw 可以将主观难度降低7%至46%。

从任务结果看,VisionClaw在四项任务中的平均难度分别为:

  • 收据笔记:2.33/7;
  • 邮件起草:2.50/7;
  • 商品查询:1.75/7;
  • 设备控制:1.58/7。

“只有感知”条件的对应评分分别为:

  • 3.67/7;
  • 4.25/7;
  • 3.75/7;
  • 3.58/7。

VisionClaw 相比“只有感知”明显降低了任务负担。

不过,VisionClaw 与“只有Agent”之间没有表现出稳定的显著难度差异。这再次说明,降低任务难度的主要因素很可能是Agent能够直接执行操作;视觉感知则进一步减少了描述上下文的负担。

9.3 成功率

三种系统的总体平均成功率为:

  • VisionClaw:85.4%;
  • 只有Agent:89.6%;
  • 只有感知:97.9%。

三者没有统计显著差异,但结果仍然值得重视:VisionClaw 并没有取得更高的可靠性。

其中最明显的问题出现在收据任务。

条件 收据任务成功率
VisionClaw 58.3%
只有Agent 100%
只有感知 100%

失败主要来自收据字体较小、文字密集、画面范围有限或拍摄角度不理想。

这揭示了 Agent 与视觉系统结合后的错误传播问题:

摄像头未拍清
    ↓
视觉识别出现错误
    ↓
错误内容被组织成任务参数
    ↓
Agent正确执行了一个错误任务

从系统内部看,Agent可能完全按照指令执行;但对用户来说,最终结果仍然是错误的。

因此,“工具调用成功”不能等同于“用户任务成功”。

9.4 认知负荷

NASA-TLX结果显示,三种条件在以下指标上存在总体差异:

  • 心理需求;
  • 时间需求;
  • 挫败感。

VisionClaw 的平均心理需求为2.83/20,低于“只有Agent”的4.50和“只有感知”的4.83。

其平均挫败感为2.58/20,而“只有感知”为5.17。

在经过多重比较校正后,VisionClaw 相比“只有感知”在挫败感上的差异达到显著水平。心理需求的总体检验显著,但部分两两比较接近而未跨过0.05门槛。

因此,论文关于认知负担下降的方向性结论是合理的,但由于样本只有12人,不宜把所有指标都解释为确定的显著优势。

9.5 控制、信任和实用性

主观评分如下:

指标 VisionClaw 只有Agent 只有感知
感知控制 5.08 5.67 4.67
可靠性 5.00 5.50 4.92
信任 4.92 5.08 4.25
易用性 5.75 5.42 4.58
实用性 5.83 5.83 4.08
完成信心 5.08 5.00 5.08

最明显的结果是实用性。

VisionClaw和“只有Agent”都获得5.83分,显著高于“只有感知”的4.08分。

这说明用户认为系统“有用”的主要原因是它能够真正执行任务,而不仅仅是看见并回答。

可靠性、信任、易用性和完成信心没有显著组间差异。

参与者还多次提到,涉及重要邮件和购物时,仍然希望通过屏幕检查结果。

这反映出一个关键现实:

无屏幕交互适合降低操作成本,却不一定适合承担最终确认。

10. 长期部署研究:系统在真实生活中如何被使用

受控实验回答的是“系统在固定任务中表现如何”,而长期部署希望回答另一个问题:

当用户真正把它带进日常生活后,会产生哪些事先没有设计好的使用方式?

作者采用了自传式设计研究方法,由4名研究团队成员在2026年2月至3月期间使用 VisionClaw。

作者选择团队成员作为参与者,主要是因为:

  • 系统需要连接私人邮件、日历、笔记和云盘;
  • 持续音视频采集涉及隐私;
  • 配置OpenClaw需要较强技术能力;
  • 一些交互模式只有在长期使用中才会出现。

10.1 部署数据

研究共记录:

  • 4名参与者;
  • 555次语音发起的交互;
  • 118个会话;
  • 55个活跃参与者日;
  • 每人使用5至19个活跃日;
  • 平均每人13.8个活跃日;
  • 总交互时间25.8小时;
  • 平均每个活跃日10.1次交互;
  • 单日最多69次交互;
  • 会话时长中位数16分钟;
  • 39%的交互使用摄像头进行视觉定位;
  • 只有2%的交互没有收到Agent响应。

需要注意,“Always-On”并不意味着系统真正连续运行了55个完整自然日。

总交互时间只有25.8小时,因此这里更准确的含义是:系统在用户主动开启的会话期间持续获取上下文,而不是全天24小时不间断记录。

10.2 工具调用情况

每条语音命令平均触发3.2次工具执行。

最常见的工具为:

  • 命令行执行:32%;
  • 浏览器自动化:31%;
  • 文件读写:12%;
  • 网页搜索和抓取:12%;
  • 记忆检索:3%。

按工具链深度划分:

  • 21%的交互不需要工具;
  • 27%调用一次工具;
  • 23%调用2至3次工具;
  • 29%调用4次及以上工具;
  • 最复杂的一次交互调用了27次工具。

此外,29%的交互使用了两种或更多数据源。

这说明用户的真实任务往往不是一个简单API调用,而是需要跨越多个服务完成。

10.3 响应延迟

系统端到端响应延迟中位数为12.2秒。

不同任务的延迟为:

  • 浏览器任务:15.5秒;
  • 非浏览器工具任务:13.4秒;
  • 不调用工具的纯语音任务:8.4秒。

从传统语音助手的标准看,这些延迟仍然偏高。

但作者观察到,用户对延迟的感受与手机不同。使用手机时,用户通常盯着屏幕上的加载状态;使用眼镜时,用户可以继续走路、做饭或整理物品。

因此,无屏幕交互没有真正消除系统延迟,却可能降低“被迫等待”的主观感受。

11. 长期使用中出现的四种交互模式

11.1 从单轮命令走向开放式多轮任务链

传统语音助手经常采用“一问一答”模式。

VisionClaw 中的任务可以不断发展。

论文给出的一个例子是:

  1. 用户询问附近《Project Hail Mary》的电影场次;
  2. 接着询问自己什么时候读过原著;
  3. 再请求推荐相似书籍;
  4. 最后把其中一本加入 Amazon 愿望清单。

这个过程连续跨越:

公开信息检索
    ↓
个人记忆检索
    ↓
内容推荐
    ↓
购物操作

另一个参与者从邮件里看到的同事姓名出发,继续查询其Google Scholar引用、博士导师、论文、项目和资助记录,最终把结果保存到个人记忆中。

用户不需要一开始就规划完整任务。目标可以在交互过程中逐渐形成。

11.2 捕获和回忆变得机会化

传统信息记录是一项明确操作:

  1. 意识到信息有价值;
  2. 拿出手机;
  3. 打开相机或笔记应用;
  4. 拍摄或输入;
  5. 整理并保存。

VisionClaw 将这个流程缩短为一句话:

“把刚才这段对话保存下来。”

由于系统持续接收上下文,用户甚至可以在信息已经发生之后再决定保存。

这种交互把“记录”从计划好的设备操作,变成了嵌入日常活动的即时反应。

回忆也是如此。

用户可能在经过某个地点时突然询问:

“我上次是什么时候来这里的?”

也可能在超市里询问:

“我之前整理的购物清单里有什么?”

需求由当前环境触发,而不是从打开某个应用开始。

11.3 无屏幕让AI更平静,也更不可靠

使用手机时,任务执行会占据用户的视觉注意力。

用户需要:

  • 看着屏幕;
  • 检查输入;
  • 等待加载;
  • 观察执行过程;
  • 确认最终结果。

使用智能眼镜时,用户可以发出命令后继续当前活动。

这让计算从注意力中心退到背景中,与“平静技术”的理念更加接近。

但无屏幕同时削弱了用户对系统状态的理解。

用户难以知道:

  • 系统是否听清了;
  • 任务是否已经开始;
  • 当前正在执行什么;
  • 为什么等待这么久;
  • 是否遇到网络故障;
  • 是否已经失败;
  • Agent最终修改了什么;
  • 是否需要用户干预。

有参与者将这种体验形容为“抽奖”:在发出命令前,很难判断这次会成功还是失败。

因此,VisionClaw 揭示了一组重要的设计矛盾:

无屏幕带来认知自由,却降低了可观察性;自动化减少了操作,却增加了不确定性。

11.4 系统价值随个人数据积累而增长

在部署初期,参与者主要使用不依赖个人信息的功能:

  • 查询天气;
  • 查看新闻;
  • 搜索商品;
  • 询问公开知识。

随着系统逐渐积累和接入:

  • 邮件;
  • 日历;
  • 笔记;
  • 历史对话;
  • 实验室资料;
  • 个人记忆;
  • 自定义技能;

用户开始提出更复杂的个性化请求,例如:

  • 根据邮件、日历和笔记生成会前简报;
  • 回忆数周前的会议决定;
  • 查询多年前某一天的活动;
  • 询问第一次见到某个人的时间;
  • 继续处理上一次Agent没有完成的任务。

作者将这种现象称为“数据网络效应”:

使用越多
    ↓
积累的数据越丰富
    ↓
可以调用的技能越多
    ↓
回答和行动越个性化
    ↓
后续使用价值越高
    ↓
用户更愿意继续使用

不过,这种正反馈也可能带来:

  • 更高的迁移成本;
  • 对单一平台的依赖;
  • 更集中的隐私风险;
  • 更复杂的数据删除问题;
  • 个人行为画像的持续累积。

12. 论文真正的创新在哪里

从算法角度看,VisionClaw 没有提出新的视觉编码器、语音模型或Agent规划算法。

它的创新主要体现在三个层面。

12.1 系统整合创新

论文将以下能力整合到一个可运行系统中:

  • 智能眼镜第一视角感知;
  • 原生音频多模态对话;
  • 通用Agent工具调用;
  • 个人记忆与数据访问;
  • 外部服务和设备控制。

许多单独组件此前已经存在,但将它们组合为现实可用的“看见并行动”闭环,本身具有系统研究价值。

12.2 交互范式创新

传统Agent交互通常从聊天框开始:

用户打开应用
    ↓
输入问题
    ↓
提供上下文
    ↓
等待Agent执行

VisionClaw 的交互从现实活动开始:

用户看到某个对象
    ↓
现场产生需求
    ↓
直接发出语音指令
    ↓
Agent理解环境并执行

现实环境从任务之外的背景,变成了Agent推理的一部分。

12.3 纵向使用研究

论文不仅展示了几个演示案例,还进行了:

  • 三条件受控实验;
  • 真实环境中的长期部署;
  • 555次交互日志分析;
  • 使用场景分类;
  • 跨场景交互模式总结。

相比只展示原型视频,这些研究使论文能够讨论系统对日常行为的影响,而不仅是技术是否可行。

13. 论文的局限性

13.1 样本规模较小

受控实验只有12名参与者,长期部署只有4名参与者。

这限制了统计检验能力,也意味着一些方向性差异可能不够稳定。

13.2 长期参与者都是研究团队成员

4名长期参与者全部来自研究团队。他们:

  • 理解系统架构;
  • 知道系统有哪些能力;
  • 更会组织适合Agent执行的指令;
  • 能自己配置外部服务;
  • 对系统错误可能更加宽容;
  • 对隐私风险的判断可能不同于普通用户。

因此,纵向研究更适合被理解为探索性设计研究,而不是大众用户研究。

13.3 参与者对AI较熟悉

受控实验参与者对AI助手的熟悉度达到6.0/7。

非技术用户、老年人、视障用户或第一次接触Agent的人,可能会出现完全不同的使用策略、信任水平和挫败阈值。

13.4 目前仍然是反应式系统

VisionClaw 虽然持续感知环境,但不会主动发起任务。

它不会自动在用户进入超市时调出购物清单,也不会在会议开始前主动生成简报。

用户必须先开口,因此系统更准确的定位是“具有持续上下文的反应式Agent”,而不是完全主动的全天候助手。

13.5 缺乏可视化状态反馈

Meta Ray-Ban没有真正的AR显示屏。

当任务执行时间较长时,用户只能依赖语音,很难快速查看:

  • 任务计划;
  • 当前进度;
  • 候选结果;
  • 操作内容;
  • 错误信息;
  • 是否需要确认。

手机同步显示可以暂时缓解这一问题,但又会重新引入屏幕依赖。

长期来看,带显示能力的AR眼镜可能更适合提供低干扰的状态反馈。

13.6 隐私研究仍然不足

论文讨论了佩戴者隐私和旁观者隐私,但没有专门研究旁观者如何看待这种设备。

传统摄像眼镜带来的担忧是“我是否正在被拍摄”。

Agent眼镜带来的担忧则是:

“它是否正在识别我、搜索我、分析我,并根据看到的信息立即行动?”

从被动记录到主动分析和执行,风险发生了质的变化。

14. 从产品角度应该如何改进

14.1 建立分级确认机制

不同风险的任务应采用不同确认方式。

低风险任务

例如查询天气、识别物体,可以直接执行。

中风险任务

例如保存笔记、创建提醒,可以执行后汇报,并允许撤销。

高风险任务

例如发送正式邮件、公开发布消息、加入购物车,应在执行前确认关键内容。

极高风险任务

例如付款、删除重要文件、控制安全设备,应要求强确认、身份验证或转移到屏幕完成。

14.2 提供阶段性进度反馈

完整的无屏幕任务反馈可以分为:

已接收
    ↓
正在理解
    ↓
正在执行
    ↓
需要确认
    ↓
已完成或失败

例如:

“我已经识别到这本书,正在查询Amazon。”
“评分是4.7,目前找到两个版本。”
“准备将平装版加入购物车,需要我继续吗?”

这种方式比开始时只说一句“我来处理”更能建立信任。

14.3 提供完整操作日志

用户应该能够随时询问:

  • “刚才系统做了什么?”
  • “为什么选择了这个商品?”
  • “发送给了谁?”
  • “修改了哪个文件?”
  • “撤销刚才的操作。”
  • “删除刚才保存的内容。”

Agent越通用,操作审计就越重要。

14.4 明确短期上下文和长期记忆的边界

系统不应把所有持续感知内容自动保存为长期记忆。

更合理的做法是区分:

  • 临时感知缓存;
  • 当前会话上下文;
  • 用户明确保存的记忆;
  • 自动生成但等待确认的记忆;
  • 到期自动删除的信息。

用户还需要知道某条记忆来自哪里、何时生成,以及如何彻底删除。

14.5 优先采用音频,按需开启视频

长期研究中只有39%的交互使用了摄像头。

这意味着大量任务——如邮件摘要、日历查询和个人记忆检索——并不需要持续视频。

更现实的方案可能是:

  • 默认维持音频交互;
  • 检测到视觉指代时再开启或提高视频采样;
  • 在敏感场景自动关闭摄像头;
  • 通过明显提示告知当前采集状态。

这有助于降低功耗、成本和旁观者隐私风险。

15. 关于“完整人生记忆”的进一步思考

论文提出了一个更长期的问题:

如果AI能够积累一个人的全部生活记忆,会发生什么?

技术上的第一个问题是存储和压缩。

系统不可能永久保存每一帧视频,因此必须判断:

  • 哪些内容重要;
  • 哪些内容与当前目标相关;
  • 哪些内容近期更可能使用;
  • 哪些内容可以只保留摘要;
  • 哪些内容应该删除。

第二个问题是多模态记忆。

OpenClaw现有记忆主要面向文本,但未来系统可能需要同时检索:

  • 视频片段;
  • 环境声音;
  • 位置;
  • 人物;
  • 物体;
  • 对话;
  • 日历和消息。

第三个问题是遗忘。

完整记录并不一定符合人的心理需求。有些内容会过时,有些内容属于他人,有些记忆可能造成持续的情绪负担。

因此,未来的个人AI记忆系统不能只研究“如何记住”,还必须研究:

  • 如何选择性保存;
  • 如何纠正错误记忆;
  • 如何设置过期时间;
  • 如何让用户查看记忆来源;
  • 如何删除由原始数据产生的摘要和向量;
  • 如何主动遗忘。

16. 总结

VisionClaw 展示了一种新的可穿戴 AI Agent 形态:

AI 不再等待用户把现实问题整理成文字并输入屏幕,而是持续处于用户的现实上下文中,将所见、个人记忆和数字工具连接成可以执行的行动闭环。

它的潜力来自三个方面。

第一,现实环境可以直接成为提示信息。用户不必反复描述自己正在看什么。

第二,无屏幕语音交互降低了记录、查询和执行任务的门槛,让Agent可以嵌入走路、做饭、购物和工作等日常活动。

第三,随着邮件、日历、笔记、历史对话和个人技能不断积累,系统能够提供越来越个性化的帮助。

但它的核心矛盾也非常明确:

  • 感知越持续,隐私风险越高;
  • 执行越自动,错误成本越大;
  • 交互越无屏幕,状态越难确认;
  • 记忆越完整,遗忘和数据治理越困难;
  • 能力越通用,用户越难建立准确的能力预期。

因此,VisionClaw 还不是一个成熟的全天候 AI 助手。

它更像是一个探索未来交互方式的研究原型:让我们提前看到,当智能眼镜、实时多模态模型、个人记忆与通用Agent结合之后,人机交互可能从“打开应用并输入命令”,转向“在现实生活中随时委托任务”。

未来真正值得研究的问题,已经不只是:

“AI能不能看见?”

而是:

“当AI能够持续看见、长期记忆并直接行动时,我们应该让它知道什么、保存什么,又允许它替我们做到什么程度?”

评论区

llllll
0粉丝

励志做一条安静的咸鱼,从此走上人生巅峰。

0

0

0

举报