文献标题

EyeSayCorrect: Eye Gaze and Voice Based Hands-free Text Correction for Mobile Devices

文献信息

  • 主题领域: 人机交互,特别是基于眼动追踪和语音识别的移动设备文本校正技术
  • 关键词: 多模态交互, 眼动, 文本校正, 语音输入, 移动设备, 贝叶斯方法, 人机交互, 无障碍, 语音识别, 用户实验

研究背景与问题

  • 问题或挑战:

    1. 在移动设备上进行文本校正通常依赖手动操作,需精确定位光标,这对用户体验不友好,且容易发生错误。
    2. 使用替代输入模式(如眼动追踪和语音输入)有其局限性,例如眼动追踪缺乏精确性,语音输入对环境噪音敏感且面临隐私问题。
  • 重要性:

    • 文本校正是日常使用移动设备时不可或缺的关键功能,尤其在搜索、电子邮件、社交网络中广泛应用。
    • 为有身体障碍的用户提供一种既有效又无需使用双手的文本校正方法,具有重要的社会意义。
  • 研究动机:

    • 开发一种无须手动干预的多模态文本校正方法,融合眼动轨迹定位和语音识别,以克服现有技术的缺点。
    • 针对眼动追踪缺乏精确性问题,引入基于贝叶斯模型的误差容忍文本校正策略。

解决方案

  • 关键方法及解决方案:

    • 提出了EyeSayCorrect系统,结合眼动轨迹定位和语音输入的多模态文本校正方法。
    • 用户通过注视目标单词实现选中,通过语音输入提供新的单词或短语。
    • 利用文本上下文、语音识别结果以及贝叶斯方法确定用户的校正意图。
  • 创新之处:

    • 提出了基于贝叶斯理论的两维度目标选择算法,该算法容忍眼动数据中的噪声,支持选择尺寸较小的文本目标。
    • 为拼写错误的单词设置较高的先验概率,从而优化目标选择的效率。
    • 结合语言模型、词嵌入算法和编辑距离的算法,支持上下文智能校正。
  • 实施步骤与技术细节:

    1. 用户注视屏幕中的某个单词,其周围某个感兴趣区会相应累计注意力值,达到阈值时确定选择目标。
    2. 用户通过语音输入校正后的内容。
    3. 基于目标文本先验概率、眼动轨迹和贝叶斯推断,系统确定用户选择的单词。
    4. 使用Apple Speech框架处理语音识别,并结合上下文生成正确的校正建议。

研究成果

  • 具体成果:

    • 验证了EyeSayCorrect的可行性,证明其能够以“免触摸”的方式实现文本校正。
    • 用户实验表明,在眼动选择阶段,通过为拼错单词设置较高的先验概率,可显著缩短任务完成时间。
  • 实验与评估:

    • 与无先验条件下对比实验表明,使用拼写错误优先的设定改善了用户体验:
      • 小字体情况下,任务完成时间减少了约23.79%,选择单词时间减少了40.35%。
      • 大字体条件下,任务完成时间减少约9.26%。
    • 与传统手触方法的对比显示,EyeSayCorrect的校正速度约为触控方法的65%,但支持免手完成校正的功能。
    • 主观评价表明,参与者更倾向于使用有误拼先验的EyeSayCorrect系统,认为其在降低身体和心理负担方面表现良好。
  • 局限性与未来方向:

    • 局限性:
      • 系统依赖语音输入,可能在公共场景中引发隐私问题。
      • 对于语音识别结果和校正候选质量,仍有一定提升空间。
    • 未来方向:
      • 优化拼写错误单词的贝叶斯先验参数以寻求最佳性能。
      • 探索补充输入模式,如为公共场所引入更加私密的交互模式。
      • 进一步提升系统对不同用户口音和背景噪音的鲁棒性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/79954/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3490099.3511103
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
16 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文