从 AVA 学习:面向政策与发展研究的精选可信生成式人工智能的早期经验教训

生成式AI(文本、图像、音乐、视频)可解释人工智能(XAI)AI 辅助决策与自动化系统算法透明度与可审计性AI/ML 研究员与工程师大学教授与研究人员政府官员与公务员

文献标题

Learning from AVA: Early Lessons from a Curated and Trustworthy Generative AI for Policy and Development Research

出版信息

  • 主题领域: 面向政策与发展研究的生成式人工智能
  • 关键词: 生成式人工智能、认知谦逊、政策研究、发展、引用可验证性、理性拒绝、多语言人工智能、基于证据的综合、谦逊人工智能、世界银行报告

背景与问题

  • 问题 / 挑战: 通用型大型语言模型(LLMs)通常会生成错误信息,并缺乏可验证、基于证据的输出机制,而这对于政策与发展研究至关重要。
  • 重要性: 确保人工智能输出的可信性和可验证性对于政策与发展领域的专业人士做出明智决策并节省时间至关重要。
  • 动机与相关工作: 以往关于LLMs的研究未能充分解决认知谦逊或拒绝不支持查询的能力需求。本论文基于这些空白,提出了一种专门为基于证据的政策研究设计的人工智能系统。

解决方案

  • 提出的方法: AVA(AI + Verified Analysis),一个生成式人工智能平台,利用超过4,000份世界银行报告的精选库提供基于证据的综合分析,并支持多语言功能。
  • 创新点:
    1. 实现引用可验证性,使声明可以追溯到原始来源。
    2. 引入理性拒绝机制,系统对不支持的查询进行拒绝并提供解释和重定向。
    3. 设计了一个面向基于证据查询处理的多代理管道。
    4. 提供设计指南,用于创建专门的、生态系统感知的人工智能系统。
  • 过程与关键技术:
    • AVA使用世界银行报告的精选库作为知识基础。
    • 它采用多代理管道处理用户查询并生成基于证据的响应。
    • 集成了引用可验证性和理性拒绝机制以确保可信度和清晰度。

结果

  • 具体发现: 持续使用AVA与用户每周节省2.4–3.9小时相关。
  • 相较基线的优势: AVA提供了一个专门的“证据引擎”,通过机构来源和页面定位的引用校准了信任度,解决了通用型LLMs的局限性。
  • 实验 / 评估:
    • 在真实环境中评估,参与者超过2,200人,来自116个国家。
    • 方法包括日志分析、问卷调查和20次访谈。
  • 局限性与未来工作: 论文未具体说明详细局限性,但建议进一步探索生态系统感知人工智能及优化设计指南。

总结

AVA是一个专为政策与发展研究设计的生成式人工智能平台,利用世界银行报告的精选库提供基于证据的多语言综合分析。其主要贡献包括引用可验证性和理性拒绝机制,提升了信任度和可用性。通过全球超过2,200名用户的评估,AVA每周节省了2.4–3.9小时的时间,并被认为是一个可靠的“证据引擎”。该研究推进了谦逊人工智能的概念,并为创建可信赖的专门人工智能系统提供了设计洞见。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223524/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791062
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、可解释人工智能(XAI)、AI 辅助决策与自动化系统、算法透明度与可审计性
work
职业/产业
AI/ML 研究员与工程师、大学教授与研究人员、政府官员与公务员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文