ARTiST:用于增强现实任务指导的自动化文本简化

AR 导航与情境感知大语言模型(LLM)的人机协作算法透明度与可审计性大学教授与研究人员UI/UX 设计师

文献标题

ARTiST: Automated Text Simplification for Task Guidance in Augmented Reality

文献信息

  • 主题领域: 增强现实(AR)中文本简化以及任务引导
  • 关键词: 增强现实, 文本简化, 大语言模型, 用户体验, 人机交互

研究背景与问题

  • 问题/challenges: 增强现实中使用文本任务引导设备(如头戴式显示设备,HMD)会遇到以下问题:
    • 头戴设备显示区域受限(字段小),长文本容易遮挡用户视野,增加认知负荷。
    • 现有文本简化方法主要针对于低阅读能力人群,并非专门为增强现实环境设计,缺乏对物理任务和场景的考量。
    • 当前的文本提示通常忽略了加入空间位置信息和明确任务细节的可能性。
  • 重要性:
    • 增加文本任务指引的可读性和简洁性可以显著提升用户实际工作时的效率。
    • 改善用户体验、降低认知负荷对于扩展增强现实的实际应用范围至关重要,如制造业、医疗和教学。
  • 研究动机:
    • 针对增强现实的特定需求,构建一套适应约束的自动化文本简化系统。
    • 弥补传统文本简化方法在增强现实中缺乏针对性的不足。

解决方案

  • 方法/系统: 提出了一种名为 ARTiST 的文本简化系统,该系统利用 OpenAI 的 GPT-3 大型语言模型,通过如下几种创新方法优化增强现实环境中的文本任务指引:
    1. 计划技法(Plan-of-Technique): 引导语言模型按照计划依次执行内容简化、句法简化、词汇替换、空间信息补充等多步简化。
    2. 链式思考(Chain-of-Thought)方法: 提升多步推理能力,减少不同简化方法间的潜在冲突。
    3. 错误感知校准(Error-Aware Calibration): 通过校正模型可能的输出偏差,确保简化后的文本保留原始语义并严格遵循设计准则。
    4. 基于空间信息的精细化简化(Elaboration): 收集场景中的物体位置信息,将其整合进文本指引。
  • 创新之处:
    • 定制性适配增强现实需求,这包括减少显示域内文字遮挡、优化阅读体验。
    • 无需大量标注数据,通过少样本启发(Few-shot Learning)实现精准的文本生成。
    • 结合语义简化和空间信息补充,首次实现了适用于增强现实的全自动文本优化。
  • 技术与实施步骤: 系统依赖 GPT-3,通过少量示例构建训练集,同时结合 Detic 对场景中物体进行实时空间定位。利用 Flask 搭建后端服务,将文本简化结果推送给 HoloLens 2 AR 设备。

研究成果

  • 主要成果:
    1. 开发了 ARTiST 系统 — 一个基于 GPT-3 且专为增强现实设计的自动化文本简化框架。
    2. 坚持用户与专家反馈设计的技术准则,以支持准确、可交互的增强现实文本界面。
    3. 通过用户实验验证了 ARTiST 在降低用户认知负荷和减少操作错误方面的显著效果。
  • 实验总结:
    • 实验包含两个部分:任务完成效率、用户认知指标(NASA TLX)和文本记忆力的测量。
    • 16 位参与者的测试显示:与未优化文本和传统简化方法(如 T-5 模型)相比,ARTiST 显著降低了错误率,提升了记忆任务步骤的准确性。
    • 简化文本在用户主观可读性、任务指导性、信任度等层面得到了更高评分。
  • 优势对比:
    • 与传统的文本简化方法不同,ARTiST 能系统性地结合增强现实显示特点(诸如视野遮挡限制)考虑。
    • 在当前 GPT-3 模型指引下,ARTiST 兼顾信息动态添加与空间表达细节简化,体现了系统设计的灵活性。
  • 局限性与未来方向:
    • 局限性:
      • 在任务持续移动或需要复杂交互(如手术)的场景中性能待验证。
      • 系统主要测试在头戴显示器设备,尚未推广至其他增强现实设备或应用场景。
      • 存在如 API 请求延迟导致的显示更新延迟等技术问题。
    • 未来方向:
      • 针对复杂任务,拟探索文本与多媒体(图像、音频)结合简化的可能性。
      • 增强对于个性化配置能力的研究,使得系统能够更好地适应不同用户的偏好和背景知识。
      • 优化对动态任务场景(如移动场景)的支持,包括提高实时响应能力。

进一步开放性成果

  • 作者提供了公开的实现代码,可在 ARTiST代码仓库 中获取,以便学术共同体进行改进和复现。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147808/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642772
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
AR 导航与情境感知、大语言模型(LLM)的人机协作、算法透明度与可审计性
work
职业/产业
大学教授与研究人员、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文