迈向多模态大语言模型与人类专家的对齐:聚焦亲子互动
荣誉提名大语言模型(LLM)的人机协作人体姿态与行为识别儿童交互设计语言治疗师与听觉学家大学教授与研究人员
文献标题
Towards Aligning Multimodal LLMs with Human Experts: A Focus on Parent–Child Interaction
出版信息
- 主题领域: 多模态大语言模型(MLLMs)与专家推理对齐,用于分析亲子互动。
- 关键词: MLLMs, 共同注意, 亲子互动, 言语语言病理学家, 多模态AI, 以人为中心的AI, 专家对齐, 视线, 发声, 动作。
背景与问题
- 问题/挑战: 当前的人工智能系统无法模仿言语语言病理学家(SLPs)在分析复杂社会行为(如亲子互动中的共同注意)时的细致观察和判断实践。
- 重要性: 填补这一空白可以改善发展评估的可及性,特别是对服务不足的社区家庭,并增强人工智能在支持儿童早期发展中的作用。
- 动机与相关研究: 先前的人工智能系统主要集中在治疗材料的创建和照护者的参与,但未能与SLPs的评估专业知识对齐。研究表明,MLLMs可以解释多模态行为,但在社会化任务中表现较弱。本文探讨MLLMs是否可以与SLPs的推理对齐以评估共同注意。
解决方案
- 提出的方法: 一个基于两阶段MLLM的系统,将观察(如视线、动作、发声等行为线索)与判断(互动质量评估)分开。
- 创新点:
- 通过访谈和视频注释表征SLPs对共同注意的推理过程。
- 开发一个MLLM系统,在观察阶段达到85%的准确率,在判断阶段达到64%的准确率,与专家标签对齐。
- 创建一个包含专家标注的共同注意行为数据集,并制定与SLPs工作流程对齐的设计指南。
- 流程与关键技术:
- 与三位SLPs进行访谈和注释会,识别关键行为维度(视线、动作、发声)。
- 将专家启发式方法转化为结构化提示,用于MLLMs从视频中提取行为片段。
- 使用零样本和多样本提示策略评估GPT-4.1的判断准确性。
结果
- 具体发现:
- 观察层面对齐:MLLMs在识别视线、动作和发声线索方面达到81%的准确率。
- 判断层面对齐:多样本提示将准确率提高到64%,宏F1达到0.44,Cohen’s κ达到0.26。
- 相较基线的优势: 结构化提示将行为描述准确率从62%提升至81%,判断对齐优于零样本提示。
- 实验/评估:
- 数据集: 25个YouTube亲子互动视频,由三位SLPs标注。
- 评价指标: 准确率、宏精度、宏召回率、宏F1、Cohen’s κ。
- 模型: Gemini 2.5 Pro用于观察,GPT-4.1用于判断。
- 局限性与未来工作:
- 三位SLPs的小样本量限制了结果的普适性。
- 数据集偏向于神经典型互动,缺乏共同注意较差的例子。
- 第二阶段结果基于手动修正描述,代表性能的上限。
- 未来工作应扩展数据集以包含神经多样化人群,并扩大专家队列。
总结
本研究探讨了多模态大语言模型(MLLMs)与言语语言病理学家(SLPs)在分析亲子互动中共同注意的对齐性。提出的两阶段系统将观察(如视线、动作、发声等行为线索)与判断(互动质量评估)分开。结果表明,观察层面对齐表现出较高的准确率(81%),但判断层面对齐表现较为一般(多样本提示准确率为64%)。研究结果突出了利用MLLMs支持专家工作流程的可行性,并为设计以人为中心的人工智能系统提供了机会,这些系统能够增强专业知识在发展评估中的作用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791267
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、人体姿态与行为识别、儿童交互设计
work
职业/产业
语言治疗师与听觉学家、大学教授与研究人员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文