GuideMe:基于视觉语言模型的辅助老年人独立学习智能手机应用系统
老年人友好技术设计大语言模型(LLM)的人机协作AI 辅助决策与自动化系统行为改变与反思技术老年护理人员家庭照顾者(Caregiver)辅助技术专家
文献标题
GuideMe: A VLM-Based System Assisting Independent Smartphone Learning for Older Adults
出版信息
- 主题领域: 面向老年人独立学习智能手机的辅助技术
- 关键词: 视觉-语言模型(VLMs)、老年人、独立学习、智能手机可用性、认知负荷、实时高亮、对话代理、多模态上下文、无障碍性、辅助技术
背景与问题
- 问题/挑战: 老年人在学习智能手机应用时面临显著挑战,包括认知能力下降、难以清晰表达技术问题,以及在遵循指令时承受较高的视觉和认知负荷。现有的独立学习工具和面对面教学方法要么效果不佳,要么难以获取。
- 重要性: 解决这些挑战对于防止老年人在数字世界中被边缘化至关重要,同时还能增强他们的自主性、自尊心以及获取关键服务的能力。
- 动机与相关工作: 先前的研究探索了交互式教程、基于增强现实(AR)的学习以及对话代理,但这些方法通常针对特定应用、资源消耗较高,或未能解决老年人特有的认知和视觉挑战。开发一种强大、通用且用户友好的学习支持工具的需求仍未得到满足。
解决方案
- 提出的方法: GuideMe,一种基于设备的对话式指导系统,利用视觉-语言模型(VLMs)通过多模态上下文分析、澄清性问题以及实时视觉指导,帮助老年人独立学习智能手机应用。
- 创新点:
- 集成VLMs以分析多模态上下文并协助澄清用户意图。
- 使用实时高亮功能减少视觉搜索和认知负荷。
- 模拟有效的面对面教学模式,包括意图确认和逐步指导。
- 流程与关键技术:
- 使用Android的辅助服务和媒体投影API捕获实时用户界面上下文。
- 利用GPT-5分析用户查询和应用上下文,生成澄清性问题以确认意图。
- 在应用界面上通过半透明覆盖层直接高亮目标UI元素。
- 实现容错机制以应对错误恢复、网络延迟和未识别查询。
结果
- 具体发现:
- GuideMe显著减少了用户界面搜索时间(M = 1.26s),相比AI搜索引擎(M = 4.23s),接近面对面指导(M = 0.81s)。
- 错误点击次数显著低于GuideMe(M = 0.11),而AI搜索引擎为(M = 2.94)。
- 任务完成时间在GuideMe下更快(M = 56.5s),而AI搜索引擎为(M = 82.9s)。
- 相较基线的优势:
- 在可用性和认知负荷减少方面,与面对面指导表现相当。
- 在任务效率、准确性和用户体验方面优于AI搜索引擎。
- 实验/评估:
- 形成性研究(N=16)以识别老年人在智能手机学习中的挑战。
- 用户研究(N=18),比较GuideMe、AI驱动的搜索引擎和面对面指导在六个应用任务中的表现。
- 评估指标包括任务完成时间、用户界面搜索时间、错误点击次数以及主观评分(NASA-TLX、UEQ-S)。
- 局限性与未来工作:
- 仅限于Android设备;基于云的VLMs存在隐私问题。
- 在受控实验室环境中进行,参与者为中国用户;对其他人群和真实场景的普适性尚需探索。
- 未来工作包括开发设备端AI模型、动态透明机制以及长期“真实环境”部署。
总结
GuideMe是一种基于视觉-语言模型(VLMs)的系统,旨在通过模拟有效的面对面教学模式,帮助老年人独立学习智能手机应用。通过多模态上下文分析、澄清性问题和实时高亮功能,该系统降低了认知和视觉负荷,同时提高了任务效率和准确性。用户研究表明,其性能与面对面指导相当,并显著优于AI搜索引擎。尽管前景广阔,但未来工作需要解决隐私问题、扩展平台兼容性,并验证其在多样化真实场景中的有效性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791448
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
老年人友好技术设计、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、行为改变与反思技术
work
职业/产业
老年护理人员、家庭照顾者(Caregiver)、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文