使用大型语言模型在智能手机上进行上下文感知的协作文本输入研究

语音用户界面(VUI)设计大语言模型(LLM)的人机协作环境感知与上下文计算软件工程师与开发者消费者与购物者

研究背景与问题

  • 作者发现了哪些问题或挑战?
    智能手机上的文本输入是日常使用中的一个关键部分,但用户在实际场景中常常面临输入困难,例如:情境性限制(如行走使用手机)、句子组织困难等。传统的方法虽然能够提供一些预测功能,但通常忽视了用户设备上的广泛上下文信息(如屏幕内容、时间、位置和活动),因此难以根据用户真实需求进行优化。

  • 为什么这个问题很重要?
    在如今的智能设备使用场景中,文本输入不仅直接影响用户的效率,也是许多交互流程的基础。优化这一领域可以显著提高用户的交互体验,尤其是在通信和服务任务中。

  • 研究动机与相关工作
    作者的研究动机源于近期的成果:大规模语言模型(LLMs)展现了结合上下文生成高质量文本的潜力。然而,尽管这类模型已经广泛应用于特定场景(如桌面自动表单填写或智能眼镜辅助写作),我们对这些模型如何在开放性、真实世界环境中与多样化上下文信息交互的理解仍然有限。


解决方案

  • 作者提出了哪些方法或解决方案?
    作者设计并实现了一种名为 CATIA 的原型系统(Context-Aware Text Input Assistant),这是一种基于智能手机的上下文感知文本输入助手。CATIA 利用设备上的广泛上下文信息(时间、地点、活动等),并使用 LLMs 来生成针对文本填写字段的个性化建议。

  • 该解决方案的创新之处是什么?
    CATIA 将创新点集中在两方面:

    1. 借助 LLMs 推理用户的输入意图(包括消息传递、搜索、评论等),同时支持用户对建议进行协作优化。
    2. 跨屏整合上下文信息以及离屏上下文(如时间、位置、活动)以增强建议的个性化和准确度。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 协作工作流设计:用户长按浮动按钮激活建议系统,交互流程包括捕捉上下文、生成文本建议、用户修改建议并确认最终文本。
    2. 上下文信息收集:通过 Android 的 Accessibility 服务 API,系统持续记录屏幕内容,还结合物理上下文(位置、活动等)和数字上下文(日历事件、应用名称等)。
    3. 生成建议:使用 GPT-4 Turbo 语言模型通过链式思维方法生成文本建议,让模型逐步推理用户意图并生成对应的建议文本。
    4. 延迟优化:系统通过实时流式展示建议字符感降低用户等待时间。

研究成果

  • 取得了哪些具体成果?
    在一个涉及 36 位参与者的为期 7 天的现实环境实验中,CATIA 提供的建议在超过 80% 的情况下被用户接受。建议主要应用于两类场景:人际沟通(消息、评论等)和服务导向任务(搜索、表单填写等)。在大多数情况下,系统生成准确且直接可用的文本建议,同时帮助用户减少输入负担。

  • 与现有解决方案相比,它有哪些优势?

    1. CATIA 能够整合丰富的上下文信息(如屏幕内容和物理上下文),在大多数场景中提供更具针对性、个性化的建议。
    2. 系统设计支持用户与 AI 的协作交互,提升了复杂场景中的文本创作体验。
  • 实验或评估结果是什么?

    • 用户行为和文本输入场景:系统在社交互动场景(消息、评论等)中使用频率最高,其次是服务导向任务(如搜索关键词)。
    • 上下文信息重要性分析:屏幕内容通常是生成建议的主要依据。离屏因素(位置、时间等)在特定情况下支持快速响应,但总体影响相对较小。
    • 用户对不同语言模型效果的评价:较小且成本更低的模型在测试中表现与 GPT-4 Turbo 接近,证明了其部署潜力。
  • 局限性与未来方向

    1. 数据收集范围有限:实验仅涉及了一个文化背景下的 36 名大学生。未来需要更长时间研究和更广泛的用户群数据以提升普适性。
    2. 上下文信息种类有限:屏幕内容多为文本格式,未集成图片、视频等更丰富的上下文数据。
    3. LLM 使用:目前主要使用较大型的 GPT-4 Turbo,未来可探索轻量化、更快的模型,以实现更适合的实时交互性能。
    4. 用户隐私与数据安全:屏幕内容持续收集可能存在隐私风险,需改进数据保护措施。

总体上,该研究提供了实现人机协作文本输入的设计框架与实验数据支持,为智能设备中的 LLM 应用提供了新的视角和实践指导。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188216/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713944
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
语音用户界面(VUI)设计、大语言模型(LLM)的人机协作、环境感知与上下文计算
work
职业/产业
软件工程师与开发者、消费者与购物者
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文