使用大型语言模型实现与移动UI的对话交互

语音用户界面(VUI)设计大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师

文献标题

Enabling Conversational Interaction with Mobile UI using Large Language Models

文献信息

  • 主题领域: 人机交互(HCI)、移动用户界面(UI)、大语言模型(LLMs)
  • 关键词: 大语言模型, 对话式交互, 移动UI, 少样本学习, 用户界面文本表示, 自动化屏幕摘要

研究背景与问题

  • 问题或挑战:

    • 当前对话式代理生成多种移动用户界面(UI)交互任务仍需大量特定任务的数据集和训练模型,开发代价高昂且耗时。
    • 现有的智能助手(如Google Assistant)在识别屏幕内容、回答基于移动UI的问题等复杂任务上能力有限。
    • 移动UI任务涵盖广,现有研究大都只能处理单一交互场景,无法实现广泛的适应性。
  • 重要性:

    • 对话式交互有望通过自然语言增强用户与移动设备的交互体验,尤其对运动或视觉障碍用户显得尤为重要。
    • 若能以一种轻量化方式统一实现多任务的对话式交互能力,将极大降低开发语言交互代理的门槛。
  • 研究动机与相关工作:

    • 预训练的大语言模型(如GPT-3、PaLM)显示了少样本学习(few-shot learning)的潜力,可在无需专门训练的情况下,适配多种语言任务。
    • 当前的挑战在于如何适配大语言模型用于图形用户界面(GUIs),并实现基于移动屏幕的对话任务。

解决方案

  • 方法或解决方案:

    • 利用大语言模型(LLMs),通过一套基于少样本学习的提示技术(prompting techniques),让模型适配移动UI任务。
    • 提出了一种将移动UI的层次结构数据转换为HTML的算法,以提供模型可理解的文本输入。
    • 基于用户和智能代理的交互情景,划分了四种主要任务场景:
      1. 屏幕问题生成(Screen Question-Generation)
      2. 屏幕摘要生成(Screen Summarization)
      3. 屏幕问题回答(Screen Question-Answering)
      4. 自然语言指令到UI操作的映射(Mapping Instruction to UI Action)
  • 创新之处:

    • 屏幕数据的文本化表示: 提议用HTML语法表示移动屏幕的层级结构数据,包含类属性、内容描述、资源标识等。
    • 连锁思维提示(Chain-of-Thought Prompting): 通过引导模型生成中间过程的逻辑推断来完成复杂任务。
    • 少样本学习范式: 仅使用几个任务示例就可实现对语言模型的显著调整,避免复杂的模型重新训练。
  • 实施步骤与关键技术:

    1. 将移动UI的层次数据转化为HTML格式(如<p>, <button>标签等),模拟网络UI表示。
    2. 基于任务特性设计少样本提示的完整结构(例如输入屏幕、逻辑推断、输出答案)。
    3. 构建并运行基于PaLM大语言模型的实验,评估其在四个场景下的性能。

研究成果

  • 具体成果:

    • 开发了一套针对移动UI的语言任务提示技术,并设计了样例生成算法。
    • 在四个任务场景中,实验用的PaLM模型即便只需要少量数据示例,也取得了可比肩专门训练模型的性能。
    • 第一次在文献中探索屏幕问题生成(Screen Question-Generation)和屏幕问题回答(Screen Question-Answering)任务。
  • 与现有解决方案的比较:

    • 某些任务(如屏幕摘要生成)的人类评估结果优于现有模型(Screen2Words)。
    • 在“自然语言指令到UI操作的映射”(Mapping Instruction to UI Action)任务中,虽未超越专门训练模型Seq2Act,但方法仍然表现出竞争力。
  • 实验结果:

    • 屏幕问题生成任务:语法正确性评分几乎满分(4.98/5.0),显著优于规则模板方法。
    • 屏幕摘要生成任务:基于自动指标略逊,但在人类标注中优于训练模型(LLM生成摘要在64.1%的屏幕上被认为更准确)。
    • 屏幕问题回答:2-shot LLM总回答相关率达84.5%,大幅超过基准模型DistilBERT。
    • 自然语言指令到UI操作映射:1-shot LLM可达74.69%的部分匹配准确率。
  • 局限性与未来方向:

    • 局限性:
      • 当前仅基于移动UI的层次结构表示,未利用像素或其他模式信息。
      • 对复杂多任务或多回合对话的支持有限。
      • 模型的生成内容可能出现不确定性(即“幻觉现象”)。
    • 未来方向:
      • 融合视觉信息改进屏幕表示,并扩展至更复杂的交互场景(如多屏协作)。
      • 提高模型推断效率(如使用模型蒸馏与压缩技术),以支持实时应用。
      • 进一步研究如何提升大语言模型的定制性与可控性。

总结

本研究展示了利用预训练的大语言模型,通过少样本学习,快速实现移动UI上的对话式交互的潜力。提出的提示技术能以简单示例快速适配多任务交互,降低开发门槛,同时推动语言交互的应用创新。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96206/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580895
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
语音用户界面(VUI)设计、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文