从底层构建基准:医疗保健聊天机器人场景中LLM的社区中心化评估

荣誉提名
大语言模型(LLM)的人机协作多语言与跨文化语音交互心理健康应用与在线支持社区认知障碍与神经多样性(自闭症、ADHD、阅读困难)医生、护士、临床医生社区健康工作者AI/ML 研究员与工程师

文献标题

Building Benchmarks from the Ground Up: Community-Centered Evaluation of LLMs in Healthcare Chatbot Settings

出版信息

  • 主题领域: 在文化特定的医疗聊天机器人应用中评估大型语言模型(LLMs)。
  • 关键词: LLM评估、医疗聊天机器人、社区驱动基准、多语言AI、文化基础、公民社会、以用户为中心的设计、印度、AI伦理、包容性AI。

背景与问题

  • 问题/挑战: 现有的LLM基准通常依赖于通用或翻译数据集,未能捕捉多样化社区的文化、语言和情境细微差别,尤其是在医疗等高风险领域。
  • 重要性: 确保LLM的评估方式能够反映弱势群体的真实生活状况,对于其在全球背景下的安全和有效应用至关重要,特别是在医疗领域,不恰当或缺乏敏感性的回应可能造成伤害。
  • 动机与相关工作: 之前的LLM评估工作主要集中在标准化、通常是以西方为中心的基准上,这些基准对非西方用户缺乏生态学效度。尽管存在一些特定领域和多语言的基准,但它们往往未能融入社区特定的文化背景。本文通过提出一个以社区为中心的评估流程来填补这一空白。

解决方案

  • 提出的方法: Samiksha,一个社区驱动的评估流程,整合了来自公民社会组织(CSOs)和社区成员的意见,以创建具有文化基础的LLM基准。
  • 创新点:
    1. 通过与CSOs和数据工作者的共同创建过程,设计反映社区需求和生活经验的基准。
    2. 一个多语言、文化情境化的基准,涵盖三种印度语言(印地语、卡纳达语、马拉雅拉姆语)。
    3. 结合人类和LLM作为评估者的混合方法评估,以分析模型性能和评估者一致性。
  • 流程和关键技术:
    1. 第一阶段 – 公民社会咨询: 与五个专注于医疗的CSO进行访谈,确定关键主题、用户需求和评估标准。
    2. 第二阶段 – 查询创建: 数据工作者根据CSO的见解创建并本地化医疗查询,生成810个原创查询和780个本地化查询。
    3. 第三阶段 – 回应评估: 使用基于CSO输入的评分标准评估LLM的回应,由人工标注者和LLM作为评估者共同完成。

结果

  • 具体发现:
    • 人类评估者提供了更细致且多样化的评分,而LLM评估者的评分则集中在接近满分的范围,且方差较低。
    • 在单独评分中,Qwen3获得了最高的平均分,其次是Sarvam-M和Llama-3.1。
    • 比较评估显示评估者依赖性排名变化,人类更倾向于Qwen3,而LLM评估者更倾向于Sarvam-M。
    • 人类与LLM之间的评估一致性较弱(Pearson r ≈ 0.13),但LLM评估者之间的一致性中等(r ≈ 0.40)。
  • 相较基准的优势: Samiksha通过融入社区特定的文化和语言细微差别,解决了生态学效度和包容性方面的不足,优于现有基准。
  • 实验/评估:
    • 对三种多语言LLM(Sarvam-M、Qwen3-235B-A22B、Llama-3.1-405B-Instruct)在印地语、卡纳达语和马拉雅拉姆语的810个查询上进行了评估。
    • 评估指标包括清晰度、帮助性、准确性和完整性,通过独立和成对比较范式进行评估。
    • 统计分析证实了人类评估与LLM评估之间的显著差异,突出了自动评估者的局限性。
  • 局限性与未来工作:
    • LLM评估者在处理细微的文化和语言差异方面表现不佳,关键评估需要人类参与。
    • 未来工作包括将评估流程扩展到更多领域、语言和地域,并优化结合自动化与人工评估的混合评估工作流程。

总结

Samiksha提出了一种社区驱动的评估流程,用于在文化特定的医疗聊天机器人环境中评估LLM,解决了包容性和生态学效度方面的不足。通过整合CSO和数据工作者的意见,该方法创建了一个涵盖印地语、卡纳达语和马拉雅拉姆语的多语言基准,反映了印度用户的真实生活状况。评估结果展示了人类和LLM作为评估者的优劣势,其判断存在显著差异。Samiksha为包容性LLM评估提供了一个可扩展的、领域无关的模板,为在多样化背景下的更广泛应用铺平了道路。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222390/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791172
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
8 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、多语言与跨文化语音交互、心理健康应用与在线支持社区、认知障碍与神经多样性(自闭症、ADHD、阅读困难)
work
职业/产业
医生、护士、临床医生、社区健康工作者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文