机械降神与大型语言模型中的人设:探究AI生成的人设描述的构成
作者
大语言模型(LLM)的人机协作AI 伦理、公平与问责UI/UX 设计师AI/ML 研究员与工程师
文献标题
Deus Ex Machina and Personas from Large Language Models: Investigating the Composition of AI-Generated Persona Descriptions
文献信息
- 主题领域: 人机交互 (Human-Computer Interaction, HCI) 和大型语言模型 (LLMs) 在用户角色(Personas)创建中的应用
- 关键词: 人工智能, 大型语言模型, 人机交互, 用户角色, 评估
研究背景与问题
-
发现的问题或挑战:
- 大型语言模型(如 GPT-4)尽管能够生成虚拟用户角色,但其生成的角色是否具有多样性、真实性和较低的偏见尚存疑。
- AI生成的用户角色是否包含对某些特征(如年龄或职业)的过度强调而产生偏见?
- 生成的角色是否足够高质量以满足现实设计需求?
-
问题的重要性:
- 用户角色用于传达用户需求、行为和偏好的虚构代表,是设计过程的重要工具。
- 如果角色具有偏见或缺乏多样性,设计者可能忽略边缘化用户群体,减低算法的公平性和技术适用性。
-
研究动机与相关工作:
- 之前研究表明,LLM在生成用户角色方面具有潜力,但没有具体研究其多样性和偏见问题。
- 作者认为,LLM生成的用户角色需要更系统的评估,例如用户体验(UX)研究人员和领域专家的评价。
解决方案
-
提出的解决方案:
- 作者提出了一个用 LLM(如 GPT-4)生成用户角色的框架,并通过多层次评估(包括内部评估与领域专家评估)来分析生成的角色的特征、质量和潜在偏见。
-
解决方案的创新之处:
- 使用不同的命令(Prompts)来控制生成角色的特性(如性别、职业和年龄)。
- 创建了大规模数据集(450个用户角色)来评估特定维度(如多样性和一致性)。
- 综合内部评估和领域专家反馈,检验角色在设计用途上的实用性。
-
实施步骤和关键技术:
- 使用 GPT-4 生成用户角色,并设计不同的命令来探讨角色特征的可控性(例如性别是否默认分配)。
- 对角色描述进行定量和定性分析,包括人口统计特征(年龄、职业、国家)、文本模式(字数、多样性)、角色偏见和特性。
- 利用来自 UX 研究者和健康领域专家的内部和外部评价,分析角色的感知质量(如可信度、一致性、信息价值)。
研究成果
-
具体成果:
-
多样性分析:
- 年龄范围覆盖 17 至 67 岁,平均 37 岁,但对年轻群体有一定倾向性。
- 性别在未指定的情况下达到了完美的性别平衡(男性与女性数量相等)。
- 角色职业多样化,涵盖了201种不同的工作,但存在轻微的性别刻板印象(例如女性倾向于护理职业)。
- 国籍主要集中在美国(占比高达86%),尽管未在命令中显式指明地点,表明模型存在“美国为中心”的偏向。
-
角色评估:
- 生成的用户角色在一致性、可信度和设计信息价值方面得分较高,同时具有较低的刻板印象。
- 内部评估者和领域专家普遍认为角色描述可信、具有共鸣(relatability)和正面性。
- 个别专家发现部分角色描述(如角色和其成瘾背景)存在欠现实或不一致之处。
-
文本分析:
- 角色描述平均字数为 381 字,文本长度略随年龄增加而缩短。
- 角色描述多样性较高,无重复内容。
-
痛点分析:
- 痛点分析表明,角色的挑战(如财务问题或人际关系困难)具有一定的逻辑性,并与成瘾类型相关。
-
-
与现有解决方案的比较:
- 比较其他研究中有限的样本(如 5-10 个角色),本研究的450个角色样本使得结果更具统计意义。
- 通过引入专家评价进一步验证了生成角色在现实应用中的可信度和相关性。
-
局限性与未来方向:
- 数据生成基于 GPT-4 的通用知识库,可能存在背景数据的偏差。例如美国用户的过度表示可能来源于 AI 模型的训练数据。
- 缺乏角色真实性的独立验证。未来可将 AI 生成的角色与真实世界数据进行对比。
- 提高 prompt 工程(Prompt Engineering)的鲁棒性,例如覆盖少数群体的更多特征。
未来研究方向:
- 探讨如何用不同的提示和数据管理技术减少角色生成中的偏见。
- 比较 LLM 生成角色与传统手工制作角色的实际设计效果。
- 进一步研究角色生成在社会领域(如公共健康)的特定应用,如更精确描述成瘾群体特征。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- AI生成的虚拟人物描述是否具备多样性、真实性以及低偏见性?分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
- LLM生成的人物描述是否过度强调某些特征(如年龄或职业),从而导致偏见?分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
- 生成的人物描述是否能够满足实际设计需求的质量要求?分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
lightbulb
现实痛点
1- 设计师可能使用偏见或缺乏多样性的虚拟用户模型,忽略边缘化群体需求。分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
- 75%
单元、生成器与透镜:面向大型语言模型面向对象交互的设计框架
UIST '23· 大语言模型(LLM)的人机协作
- 67%
使用AI指南规划自然语言失败
CHI '21· 大语言模型(LLM)的人机协作 +2
- 67%
关于UX从业者在设计实际企业ML系统中的角色研究
CHI '22· 大语言模型(LLM)的人机协作 +2
- 67%
设计负责任的人工智能:适应UX实践以应对负责任的人工智能挑战
CHI '23· 大语言模型(LLM)的人机协作 +2
- 67%
LLM低语者:一种不显眼的攻击以偏见LLM响应
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
大型语言模型的诱惑之歌:用户如何感知与响应大型语言模型中的暗黑模式
CHI '26· 暗黑模式(Dark Patterns)识别 +2
- 67%
友好而非朋友:大语言模型谄媚性如何影响用户信任
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
大规模欺骗:大语言模型生成的 1000 个电子商务组件中的欺骗性设计
CHI '26· AI 伦理、公平与问责 +2
- 67%
包容性提示辅导:一种提升用户算法偏见意识与提示效能的媒体素养方法
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642036
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文