隐形导师:从屏幕录制推断用户操作以推荐更好的工作流程
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者UI/UX 设计师HCI 研究员
文献标题
The Invisible Mentor: Inferring User Actions from Screen Recordings to Recommend Better Workflows
出版信息
- 主题领域: 基于人工智能的工作流优化,适用于功能丰富的工具如电子表格。
- 关键词: 视觉语言模型、任务反思、工作流优化、屏幕录制、用户行为分析、AI助手、Excel、效率、生成式人工智能、主动推荐。
背景与问题
- 问题/挑战: 像 Excel 这样的复杂工具用户往往无法发现或利用高效功能,而是依赖重复且易出错的工作流。现有解决方案需要用户提示或特定应用日志记录,这在可访问性和可用性方面存在局限。
- 重要性: 提高工作流效率可以节省时间、减少错误,并增强用户对工具的掌握能力,无论是对新手还是有经验的用户,在专业和个人场景中都具有重要意义。
- 动机与相关工作: 先前的研究探索了功能可发现性、基于动作的建议以及人工智能驱动的任务辅助。然而,这些方法通常依赖结构化日志、用户发起的提示或有限的应用上下文,无法直接从视觉证据中推断低效行为。
解决方案
- 提出的方法: InvisibleMentor 系统利用视觉语言模型(VLM)分析屏幕录制,重建用户操作,并通过大型语言模型(LLM)生成可操作的、个性化的工作流建议。
- 创新点:
- 引入“基于视觉的任务反思”,使人工智能能够从视觉行为中推断低效行为,而无需日志或提示。
- 开发了一个两阶段的管道,结合 VLM 用于操作重建和 LLM 用于生成高保真、上下文相关的建议。
- 展示了主动的任务后指导,减少用户工作量并增强高效工作流的学习。
- 通过技术基准测试和用户研究评估系统的有效性,显示出相较于基于提示的助手的显著优势。
- 流程与关键技术:
- 阶段1: VLM 处理每5秒采样的屏幕录制,提取结构化任务表示,包括用户操作和电子表格上下文。
- 阶段2: LLM 分析这些表示,识别低效行为,并生成包含理由和收益的分步建议。
- 建议以熟悉的界面在任务后显示,帮助用户反思并采用更好的工作流。
结果
- 具体发现:
- VLM 在识别14种常见电子表格操作中达到了0.91的F1分数。
- InvisibleMentor 平均减少了32.4%的交互步骤,并纠正了参与者的18个工作流错误。
- 60条生成的建议中有58条可执行且有效。
- 相较基线的优势:
- 参与者认为 InvisibleMentor 的建议在实用性、清晰度和相关性方面显著优于 Excel Copilot。
- InvisibleMentor 使用所需的努力更少,大多数参与者更倾向于选择它(p < 0.001)。
- 实验/评估:
- 技术基准测试使用25个屏幕录制会话评估了操作识别的准确性。
- 一项包含20名参与者的用户研究将 InvisibleMentor 与 Excel Copilot 进行了比较,评估了建议质量、用户努力和工作流改进。
- 对建议的清晰度、相关性和可执行性进行了评估。
- 局限性与未来工作:
- 对复杂工作流(如宏、跨表依赖)的评估有限。
- 由于 VLM 的采样策略,忽略了一些细微的格式化操作。
- 研究在受控环境中进行,实际应用的适用性需要进一步测试。
- 未来工作包括改进细粒度操作检测、实现实时建议以及扩展至其他领域。
总结
InvisibleMentor 利用视觉语言模型分析屏幕录制,提供可操作的任务后建议,以改进像 Excel 这样的工具中的工作流。它消除了用户提示或特定应用日志的需求,使得辅助更加可访问且主动。系统在识别用户操作方面表现出高准确性,并在用户研究中显示出相较于基于提示的助手的显著优势,帮助参与者发现并采用更高效的工作流。虽然目前专注于电子表格领域,但该方法在跨领域应用中展现了潜力,未来工作将致力于增强检测能力和实时支持。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 88%
访谈驱动的生成代理用于产品发现:一项验证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
“让我来帮忙”:人与网络代理协作中用户干预的实证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
数据与提示词协同演化:通过扩展测试集优化大语言模型行为
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
居于循环之中:面向提示的快速运行时反馈
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
一种用于个人层次结构时间效率的分析模型
CHI '19· 用户研究方法(访谈、调查、观察) +1
- 71%
Luminate:大型语言模型在人机协同创作中对设计空间的结构化生成与探索
CHI '24· 大语言模型(LLM)的人机协作 +1
- 71%
PDFChatAnnotator:用于PDF格式目录的人机协作多模态数据标注工具
IUI '24· 大语言模型(LLM)的人机协作 +1
- 71%
AI意识如何影响人机协作设计的探索性研究
IUI '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790294
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文