LLM在评估视频儿童适宜性方面如何辅助父母?
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)认知障碍与神经多样性(自闭症、ADHD、阅读困难)儿童教育工作者HCI 研究员
文献标题
How Well do LLMs Assist Parents in Assessing Child Appropriateness of Videos?
出版信息
- 研究领域: 评估大型语言模型(LLMs)在帮助父母决策儿童安全视频内容中的作用。
- 关键词: LLMs, 儿童安全, 视频审核, 父母决策, 可解释人工智能, GPT-4, 内容适宜性, 透明性, 人机协作, 儿童发展。
背景与问题
- 问题/挑战: 海量的在线视频内容使得手动筛选儿童适宜性变得不切实际。自动化系统缺乏透明性,无法反映多样化的父母价值观,并且在处理复杂内容审核时表现不佳。
- 重要性: 接触不适宜内容可能对儿童造成长期的负面影响,包括心理伤害和不安全行为。父母需要能够在不观看所有内容的情况下做出明智决策的工具。
- 动机与相关研究: 现有系统(如 YouTube Kids)在过滤不适宜内容时有27%的失败率。最先进的模型虽然准确率高,但缺乏可解释性。近期研究表明,LLMs 可以弥合内容审核与可解释性之间的差距,但其在多媒体内容审核中的有效性尚未被探索。
解决方案
- 提出的方法: 评估 GPT-4 在评估和描述 7岁以下儿童适宜的 YouTube 视频时的能力,重点研究其与父母推理的一致性及其作为决策支持工具的潜力。
- 创新点:
- 分析 GPT-4 在儿童适宜性方面的推理能力,包括互动性、安全性和教育价值。
- 比较 LLM 生成的决策与父母判断的差异。
- 开发并评估优化提示,以使 LLM 生成的描述更符合父母偏好。
- 探索 LLM 作为辅助父母决策的工具,而非最终审核决策的工具。
- 研究流程与关键技术:
- 两项研究,共涉及370名父母(研究1:120人;研究2:250人)。
- 研究1:使用110个视频转录文本评估 GPT-4 的分类和解释能力。
- 研究2:测试优化提示生成的视频描述,并比较四组父母的决策(基线组、对照组、两组 LLM 生成描述组)。
- 混合方法分析,包括定性编码、定量准确性指标,以及满意度/信任度量表。
结果
- 具体发现:
- GPT-4 在 Samba 数据集上的准确率为72%,低于现有模型(88–95%准确率)。
- 父母对 LLM 生成的解释满意度为92.1%,但对模型的信任度较低(25.1%信任)。
- 优化提示提高了与父母偏好的一致性,其中一个提示生成的决策与观看完整视频的父母决策在统计上无显著差异(误差范围为0.3)。
- 使用优化提示的父母决策的均方根误差(RMSE)为0.418,而仅基于元数据的决策 RMSE 为0.826。
- 相较基线的优势:
- 优化提示生成的描述使父母能够做出与观看完整视频相当的决策,显著优于基于元数据的决策。
- 优化提示更好地捕捉了父母的细微关注点,如安全性和潜在的未来影响,相较未优化提示表现更优。
- 实验/评估:
- 研究1:将 GPT-4 的分类结果与 Samba 数据集标签和父母判断进行比较。
- 研究2:通过四组参与者(基线组、对照组、两组 LLM 生成描述组)评估优化提示,并使用独立 t 检验和 RMSE 分析。
- 指标:准确率、精确率、召回率、解释满意度(ES)量表、信任/依赖度(TM)量表。
- 局限性与未来工作:
- 仅限于 GPT-4,未评估其他 LLM。
- 仅基于转录文本的上下文,未来研究可使用音视频输入。
- 参与者仅来自美国,结果可能无法全球化推广。
- 未来工作可探索混合或线下研究、更大数据集,以及与 YouTube 等平台上的对话代理集成。
总结
本研究评估了 GPT-4 在帮助父母评估 7岁以下儿童适宜的 YouTube 视频方面的能力。尽管 GPT-4 的分类准确率较低(72%),但其解释获得了父母的高度满意(92.1%满意度)。优化提示提高了与父母偏好的一致性,使得决策与观看完整视频相当。研究结果表明,LLMs 不应做出最终审核决策,但可以作为有效的父母决策辅助工具。未来工作可探索更广泛的应用、更先进的 LLM 模型以及现实场景中的集成,以支持在线儿童安全。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791610
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、认知障碍与神经多样性(自闭症、ADHD、阅读困难)
work
职业/产业
儿童教育工作者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文