PANDALens: 在旅行过程中面向OHMD的AI辅助上下文写作
作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作
文献标题
PANDALens: Towards AI-Assisted In-Context Writing on OHMD During Travels
文献信息
- 主题领域: 人机交互与增强现实技术在游记内容生成中的应用
- 关键词: HMD, 智能眼镜, 人工智能, 大语言模型, 多模态信息, 人机协作写作, 实景写作, 旅游博客
研究背景与问题
- 问题或挑战: 传统的实景写作工具功能较为被动,对用户的体验和观察行为干预较少,导致写作质量较低且存在记忆衰退的问题。此外,用户写作的兴趣和注意力常因智能设备不够智能或设计不够合理而受到干扰。
- 重要性: 写作能有效帮助用户记录个人经历并分享独特感受,尤其是在旅行过程中,这对促进更深刻的反思以及增强旅行体验具有重要意义。
- 研究动机与相关工作: 当前的研究已探讨了自动捕捉重要时刻及减轻后续编辑工作的重要性,但现有系统在文档生成期间缺乏充分有效的人机协作和基于情境的交互机制。
解决方案
- 提出方法: 引入一款名为 PANDALens 的主动型 AI叙述记录辅助系统,结合光学透明头戴显示器(OHMD)设计和多模态信息分析框架,通过人工智能对用户行为和环境进行实时分析以支持个性化的记录与写作。
- 创新点:
- 融合多模态信息(视觉、音频、空间和时间)进行兴趣识别和基于情境的写作。
- 利用大语言模型(LLM),通过实时对话生成相关问题以激发用户表达,并逐步创建详细的旅行叙述。
- 设计了混合主导交互模式,结合人工和自动交互以优化写作体验。
- 提供低干扰性的通知设计和内容生成策略,增强用户专注于主任务(如旅行)的能力。
- 实施步骤:
- 捕捉兴趣时刻: 使用OHMD多模态信息工具检测用户行为,结合语音输入和用户手势来记录瞬间情境。
- 生成情境相关的问题: 使用LLM,根据捕捉的多模态数据生成问题以激励用户深入表达。
- 写作草稿与内容编辑: 用户可选择包括的内容,LLM根据个性化写作风格生成高质量文档。
研究成果
- 具体成果:
- PANDALens能够通过主动建议和实时提问,增加旅行期间用户记录的瞬间次数(增加19.2%)和评论数量(增加72.6%),使内容更丰富。
- 相较于基于智能手机的写作工具(LiveSnippets),PANDALens显著提高了语言质量、创意与吸引力以及写作风格的匹配度。用户的总体写作满意度评分从60.88提高到82.19(满分100)。
- 写作后的编辑时间显著减少了70.7%。
- 优势:
- 与用户主动触发工具相比,混合主导交互方式减轻了用户的记录负担,提升记录质量。
- 多模态信息的整合和利用显著增强了写作内容的表达性和个性化。
- 干扰管理设计确保了记录过程对旅行主要活动的影响可忽略不计。
- 实验或评估结果: 通过真实博物馆场景测试并与LiveSnippets进行对比实验,验证了PANDALens在写作质量、旅行体验提升以及用户满意度方面的显著优势。
- 局限性与未来方向:
- 硬件限制(例如现有OHMD重量、透明度问题)可能影响用户体验。
- 针对更复杂的场景,如社交互动或高噪声环境,可集成更高级的语音识别及图像分析技术。
- 未来应加入更先进的算法以进一步优化兴趣识别并支持更多语言及内容类型(如图像视频叙述)。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3lightbulb
现实痛点
1- 旅行中,用户难以高效记录瞬间并撰写有创意的旅行文档。分类: 创作灵感与发散思维同类问题arrow_forward
- 100%
探索用户对生成式AI重建日常照片的体验
DIS '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
将机器学习数据与策展人协作实践中获得的符号知识整合以改进对话系统
CHI '21· 对话式聊天机器人 +2
- 67%
Rambler:通过LLM辅助的概要操作支持写作的语音功能
CHI '24· 语音用户界面(VUI)设计 +2
- 67%
生成式人工智能的专业用户体验设计师的看法
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
深思熟虑、困惑还是不可信:文本呈现如何影响对AI写作工具的感知
C&C '25· 生成式AI(文本、图像、音乐、视频) +2
- 67%
人们如何提示生成式AI创建交互式VR场景
DIS '24· VR 中的社交与协作 +2
- 67%
携手更好?AI辅助代码翻译评估研究
IUI '22· 生成式AI(文本、图像、音乐、视频) +1
- 67%
Patchview:基于生成式尘埃与磁铁可视化的大型语言模型驱动世界构建系统
UIST '24· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642320
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文