解除遮蔽的文本输入:通过大型语言模型预测移动应用中文本输入的提示文本

荣誉提名
语音可访问性生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师辅助技术专家

文献标题

通过大语言模型(LLM)预测移动应用中的文本输入提示文本:HintDroid的设计与评估

文献信息

  • 主题领域: 人机交互、辅助技术、大语言模型应用
  • 关键词: 移动应用设计, 无障碍性, 用户界面, 大语言模型, 文本输入, 反馈机制, 视觉障碍用户

研究背景与问题

  • 问题和挑战:

    1. 移动应用中广泛存在无障碍设计问题,尤其是文本输入组件缺失提示文本(Hint-text)。
    2. 根据对4501个Android应用的分析,超过76%的文本输入组件缺失提示文本,这给视觉障碍用户使用屏幕阅读器获取输入要求带来障碍。
    3. 缺失的提示文本通常是因为开发者缺乏对无障碍性的认识或信息描述不充分。
    4. 现有研究主要关注图像组件的无障碍标签生成,而未涉及文本输入提示文本的自动生成。
  • 重要性:

    1. 世界卫生组织表示,全球至少有22亿人面临视力损伤,这部分用户需要更贴心的移动应用设计。
    2. 缺乏提示文本使得屏幕阅读器无法获取输入框的语义信息,严重影响视觉障碍用户的正常交互和体验。
    3. 生成合适的提示文本有助于提升移动应用的广泛可访问性,为视觉障碍用户提供更多功能支持。
  • 研究动机与相关工作:

    1. 大语言模型(LLMs)在自然语言处理和生成任务中表现出色,可激发其应用于无障碍文本生成任务。
    2. 当前仅有少数作品涉及软件界面的语义理解和标签生成,没有适用文本输入提示文本生成的方法。
    3. 提出HintDroid在研究领域中前所未有,以应对上述挑战。

解决方案

  • 方法或解决方案:

    1. 提出了一种名为HintDroid的系统,它结合了LLM和应用图形用户界面(GUI)信息,通过上下文学习生成文本输入的提示文本。
    2. 基于反馈机制优化生成的提示文本,通过确定生成的输入内容是否符合需求和是否触发下一页面,来提供反馈以调整生成结果。
  • 创新之处:

    1. 基于大语言模型的上下文学习方法,将用户界面信息转化为可理解的自然语言描述。
    2. 设计了一个反馈机制(包括错误信息提取)以评估并改进提示文本的生成质量。
    3. 将提示文本生成与生成输入内容结合,以验证其合理性并改进结果。
  • 实施步骤:

    1. GUI实体提取: 提取并组织应用程序、当前页面和输入组件的信息,包括组件的文本、ID、相对位置等。
    2. 提示生成: 利用上下文学习构建带示例的提示来帮助LLM理解任务。
    3. 反馈优化: 通过检测输入内容是否触发下一页面来评估提示文本质量,并基于错误信息重新优化生成结果。
    4. 自动化实验与评估: 调用LLM生成提示文本并验证效果,例如通过BLEU、ROUGE等自然语言评估指标。

研究成果

  • 具体成果:

    1. HintDroid在大规模实验中取得了领先的性能,例如BLEU@1达到83%,ROUGE为63%,CIDEr为62%。
    2. 用户研究表明,使用HintDroid后,视觉障碍用户正确填写输入内容的比率提高了152%,探索更多页面活动与状态的覆盖率分别增加了77%和66%。
    3. 提示文本生成时间平均为每页1.86秒,极大提升开发效率。
  • 与现有解决方案的相比优势:

    1. 在提示文本生成准确性和覆盖率方面显著优于现有的对比方法,包括基于规则、深度学习及现有LLM的方案。
    2. 提供了基于反馈的优化机制,使其适应多样化的应用场景。
    3. 将提示文本与生成内容相结合,确保了提示文本的实用性和用户体验改进。
  • 实验或评估结果:

    1. 大规模对比实验显示,HintDroid对比最优现有方法提升超过82%。
    2. 用户实验反馈表明使用HintDroid减少139%的填写时间。
  • 局限性与未来方向:

    1. 局限在生成准确性方面:在GUI上下文信息不足时,提示文本生成质量受到影响。
    2. 当前仅基于Android平台,未来可扩展至iOS、网页等其他平台。
    3. 计划优化模型的上下文理解能力并探索实时交互实现。
    4. 用户希望增加提示的个性化和动态调整能力,例如提供输入格式或交互式反馈支持。

总结

HintDroid通过引入大语言模型的强大自然语言理解能力,结合上下文学习和反馈机制,有效解决了移动应用中视觉障碍用户无法获取文本输入需求的信息鸿沟,为其提供了更高效的交互体验。未来方向包括改进场景适应能力、实现跨平台扩展和增加个性化设计。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147794/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642939
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
8 位作者
sell
研究子方向
语音可访问性、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文