理想的陌生感:听写界面参与度和可读性的眼动研究洞察
语言模型辅助文本输入AI辅助写作与文本生成眼动追踪与注视交互HCI 研究员大学教授与研究人员软件工程师与开发者
文献标题
Desirable Unfamiliarity: Insights from Eye Movements on Engagement and Readability of Dictation Interfaces
出版信息
- 主题领域: 针对语音转文本系统的听写界面进行眼动分析。
- 关键词: 听写界面、语音转文本、眼动追踪、阅读行为、LLM生成摘要、关键词高亮、用户参与度、认知负荷、文本可读性、转录系统。
背景与问题
- 问题/挑战: 原始语音转文本(STT)转录通常由于不流畅、识别错误和冗长而难以阅读。虽然基于LLM的修正可以提高可读性,但可能会改变原意或在语音生成过程中造成干扰。
- 重要性: 提高听写界面的可读性和可用性对于其在个人、专业和教育领域的广泛采用至关重要。
- 动机与相关工作: 现有研究主要关注转录准确性和不流畅修正,但尚未评估诸如关键词高亮或LLM生成摘要等提高可读性的解决方案的有效性。关于听写界面中阅读行为的眼动研究仍属未探索领域。
解决方案
- 提出的方法: 通过眼动追踪研究评估五种听写界面:PLAIN、AOC、RAKE、GP-TSM和SUMMARY,它们在原始语音的保真度、审阅辅助功能和界面响应性方面各有不同。
- 创新点:
- 引入“理想的不熟悉性”概念,表明LLM生成的摘要尽管引入了不熟悉的词汇,但提高了可读性。
- 比较了用于听写界面文本审阅的抽取式方法(RAKE、GP-TSM)与生成式方法(SUMMARY)。
- 分析了眼动数据以理解语音生成和审阅过程中的视觉参与度和阅读努力。
- 提供了未来听写界面设计的可操作性建议。
- 实验流程与关键技术:
- 参与者(N=20)在使用五种界面撰写并审阅社交媒体帖子时进行眼动追踪。
- 界面包括实时转录(PLAIN)、周期性修正(AOC)、关键词高亮(RAKE)、保留语法的高亮(GP-TSM)以及LLM生成的摘要(SUMMARY)。
- 测量生产和审阅阶段的凝视参与度、回归和注视指标。
- 通过问卷和访谈进行定性分析。
结果
- 具体发现:
- 在语音生成过程中,参与者仅有7-11%的时间用于持续阅读,大部分凝视活动集中在监控或避免干扰上。
- SUMMARY减少了内联回归并提高了可读性,但增加了注视指标(如注视次数和持续时间),表明存在不熟悉性。
- RAKE在通过关键词高亮引导阅读注意力方面比GP-TSM更有效。
- 相较基线的优势:
- SUMMARY在审阅中最受欢迎,在用户满意度和阅读轻松度方面显著优于PLAIN、AOC和GP-TSM。
- RAKE在支持回忆方面优于GP-TSM,尽管两者均为抽取式方法。
- 实验/评估:
- 采用五种界面进行被试内实验,任务顺序随机平衡,包含自述文本和外部文本的混合。
- 指标包括凝视参与度(文本内/外、持续阅读、跳跃)、回归和注视测量(注视次数、持续时间)。
- 局限性与未来工作:
- 样本多样性有限(主要为大学生,非英语母语者)。
- LLM输出稳定性和API延迟存在变异性。
- 未来工作应探索图形化摘要表示、个性化高亮以及更广泛的参与者群体。
总结
本研究通过眼动数据调查了听写界面中的视觉参与度和阅读努力,提出了“理想的不熟悉性”概念,表明LLM生成的摘要尽管包含不熟悉的措辞,但能提高可读性。RAKE在引导注意力方面优于GP-TSM,而SUMMARY在审阅中最受欢迎。研究结果表明,听写界面应优先考虑基于要点的表示而非逐字准确性,并减少语音生成过程中的干扰。这些洞察为设计更高效、更用户友好的语音转文本系统提供了指导。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791209
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语言模型辅助文本输入、AI辅助写作与文本生成、眼动追踪与注视交互
work
职业/产业
HCI 研究员、大学教授与研究人员、软件工程师与开发者
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文