改进文本输入研究中的写作任务:引发困难文本并提高错误率计算
大语言模型(LLM)的人机协作AI 辅助创意写作
文献标题
Enhancing the Composition Task in Text Entry Studies: Eliciting Difficult Text and Improving Error Rate Calculation
文献信息
- 主题领域: 人机交互 (Human-Computer Interaction),特别是文本输入技术
- 关键词: 文本输入, 错误率计算, 构造任务, 自然语言输入, 界面评估, 自动纠正, 手表键盘, 用户行为
研究背景与问题
- 发现问题或挑战:
- 在文本输入研究中,参与者通常模拟任务,通过复制短语或编写新消息评估界面。然而,真实世界中用户行为更倾向于自由创作,而非复制短语。
- 使用静态短语集的文本输入评估无法适应语言演变,且短语过短(平均不到六词)难以测试界面错误纠正的能力。
- 构造任务存在挑战:参与者可能倾向于创作简单文本,这不足以测试界面性能,且缺乏参考文本会影响准确的错误率计算。
- 重要性:
- 构造任务更接近真实用户行为,有助于深入了解文本输入界面的实际表现。
- 如语言发展或多语言支持等需求,新型评估方式对于文本输入界面设计具有必要性。
- 研究动机与相关工作:
- 相关研究表明复制任务受多种限制(如用户记忆负担、交互设备限制)。相比之下,构造任务更灵活,能够支持语言的演变和多样性。
- 现有方法如 crowdsourcing 校对程序表现出一定的不准确性,有待进一步改善。
解决方案
-
提出的方法或解决方案:
- 指导参与者创作更复杂的文本: 提出简单的指导策略,让参与者根据指令创作易于识别或难以识别的文本,以测试界面的纠错能力。
- 准确获取参与者想表达的文本: 通过参与者录入参考文本、自发 dictation 或 crowdsourcing 方法获取参考文本,并比较这些方法的准确性。
-
创新之处:
- 指导参与者调整文本难度的简单方法
- 比较多种参考文本获取方法并揭示其优势与局限性
- 提供实验中构造的复杂短语,用于未来研究
-
实施步骤和关键技术:
- 实验1:
- 参与者使用智能手表键盘录入简单及复杂文本,并在实验后键入其意图的参考文本。
- 记录字符错误率 (CER)、任务时间和纠错特性(如长按锁定字符)。
- 使用 crowdsourcing 方法验证参考文本的准确性。
- 实验2:
- 随机混合复杂和简单任务,参与者输入文本后立即 verbal dictation 给实验员,而非在电脑上输入。
- 再次进行错误率计算,并比较 dictation 和 crowdsourcing 方法的准确性。
- 实验1:
研究成果
-
具体成果:
- 参与者能够根据指令成功调整文本难度。
- 难度高的文本包括更多的罕见单词(OOV)和更高的语言模型复杂度(如更高的 perplexity)。
- 在两项实验中,复杂任务呈现更高的错误率 (CER) 和更多的纠错行为(如锁定功能使用频率)。
-
与现有解决方案的比较:
- 与 crowdsourcing 方法相比,参与者提供的参考文本更准确。
- 实验表明,通过简单指令能够有效提高文本复杂性和测试界面纠错能力,而非依赖预设短语集。
- 混合简单和复杂任务尽管能够提升文本复杂性,但可能降低难任务的“创作流”。
-
实验或评估结果:
- 实验结果显示,构造任务比复制任务具有更高的外部效度(反映真实行为)。
- Dictation 方法比 typed reference 更适合某些特定场景(如虚拟现实实验),但需要实验员实时监督。
-
局限性与未来方向:
- 局限性:
- 当前实验集中于英语流利的大学生参与者,结果可能不适合语言技能较低或者缺乏键盘操作经验的用户。
- 复杂任务的创作耗时较长(任务时间平均延长48%左右),提升用户体验的方法尚未完善。
- 未来方向:
- 探索更低成本或无需实时监督的参考文本获取方法。
- 研究该方法对其他语言输入界面或特别场景(如虚拟现实输入)的适用性。
- 基于实验生成复杂短语集的共享可以帮助未来标准短语集的改进与评估。
- 局限性:
总结
本文提出了一种增强文本构造任务的框架,通过指导调整文本难度并优化参考文本的生成方式,可有效提高文本输入研究的准确性和代表性。这些成果为构建接近真实使用场景的文本输入研究提供了新的工具支持,同时揭示了多种参考文本生成方法间的权衡。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何指导用户创建难度不同的文本,以测试文本输入界面的纠错能力?分类: 输入性能、误触控制与交互效率同类问题arrow_forward
- 什么样的方法可以更准确地获取用户的参考文本?分类: 输入性能、误触控制与交互效率同类问题arrow_forward
- 混合简单和复杂任务如何影响参与者的文本创作体验和输入界面评估有效性?分类: 输入性能、误触控制与交互效率同类问题arrow_forward
lightbulb
现实痛点
1- 现有文本输入研究中,测试方法无法反映真实用户行为,特别是复杂文本输入的情况。分类: 输入性能、误触控制与交互效率同类问题arrow_forward
- 100%
时机很重要:在不同时间使用大语言模型如何影响AI辅助创意过程中作者的感知和创意结果
CHI '25· 大语言模型(LLM)的人机协作 +1
- 100%
Wordcraft:基于大语言模型的故事创作
IUI '22· 大语言模型(LLM)的人机协作 +1
- 100%
VISAR:一种具有视觉编程和快速草稿原型的Human-AI论证写作助手
UIST '23· 大语言模型(LLM)的人机协作 +1
- 67%
Metaphoria:一个用于隐喻创造的算法伴侣
CHI '19· 大语言模型(LLM)的人机协作 +1
- 67%
DiaryMate: 理解人类与AI协作进行个人日记记录中的用户感知和体验
CHI '24· 大语言模型(LLM)的人机协作 +2
- 67%
理解人类与AI协同创作中编剧的实践、态度和未来期望
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
来自未来的自我:利用基于大语言模型的代理增强信件交换练习以提升年轻人的职业探索
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
大语言模型时代的创意支持:一项涉及专业作家的实证研究
C&C '24· 大语言模型(LLM)的人机协作 +1
- 67%
共创 AI 中交互动态的感知:Drawcto 中交互模态的比较研究
C&C '24· 大语言模型(LLM)的人机协作 +1
- 67%
深思熟虑、困惑还是不可信:文本呈现如何影响对AI写作工具的感知
C&C '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445199
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助创意写作
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文