快速演进的AI背景下开发者筛选的鲁棒方法
作者
可解释人工智能(XAI)AI 辅助决策与自动化系统隐私设计与用户控制软件工程师与开发者AI/ML 研究员与工程师UI/UX 设计师
文献标题
Robust Methods for Developer Screening in Rapidly Evolving AI Contexts
出版信息
- 主题领域: 针对AI辅助作弊的抗性筛选方法,用于实证研究中识别程序员。
- 关键词: AI抗性, ChatGPT, 筛选问题, 程序员识别, 基于音频的任务, 实证研究, 可用性安全, 软件工程, 大型语言模型(LLMs), 时间限制。
背景与问题
- 问题/挑战: 现有用于实证研究中识别程序员的筛选方法容易受到AI辅助作弊的影响,特别是来自ChatGPT等工具的威胁。静态视觉格式和短时间限制可以被先进的AI能力绕过。
- 重要性: 确保依赖程序员专业知识的研究的内部有效性至关重要,因为非程序员的参与可能会扭曲研究结果并削弱其普适性。
- 动机与相关工作: 先前的研究提出了静态视觉和代码理解任务作为抗ChatGPT的筛选器,但发现这些方法对抗AI的效果随着技术进步逐渐减弱。本文基于这些研究,探索利用AI在实时处理中的局限性的动态和序列化格式。
解决方案
- 提出的方法: 设计基于音频的序列化筛选问题,通过呈现与编程相关的术语并设置严格的时间限制,抵御AI辅助作弊。
- 创新点:
- 开发了六个基于音频的筛选问题,即使在AI辅助的情况下也能可靠地区分程序员和非程序员。
- 引入序列化格式,逐步揭示信息,最大限度地减少AI工具在时间限制内处理和响应的机会。
- 通过实证评估证明其对抗ChatGPT的鲁棒性,并提供有效筛选设置的配置指南。
- 过程与关键技术:
- 设计了28个筛选问题(12个基于视频,16个基于音频),采用序列化格式。
- 实施严格的时间限制和逐步信息揭示,以阻碍AI辅助的回答。
- 招募并测试了74名参与者,分为三组:未使用ChatGPT的程序员、未使用ChatGPT的非程序员,以及使用ChatGPT的非程序员。
- 通过统计分析,根据预定义的正确性阈值识别有效的筛选问题。
结果
- 具体发现:
- 六个基于音频的筛选问题符合有效性标准,程序员的正确率达到≥92%,而非程序员的正确率≤33.34%。
- 推荐的配置允许95.87–99.69%的程序员通过筛选,同时排除99.69%的非程序员。
- 使用ChatGPT的非程序员由于时间限制和认知负担难以正确回答。
- 相较基线的优势:
- 基于音频的任务通过利用序列化格式和严格的时间限制,在实时处理中利用了AI的局限性,优于静态视觉筛选器。
- 程序员表现出高准确率且几乎没有感受到时间压力,而非程序员则遇到显著困难。
- 实验/评估:
- 研究通过Upwork在线招募了74名参与者。
- 评估包括正确率、感知时间压力以及使用ChatGPT的策略。
- 统计测试证实了推荐的音频问题在对抗AI辅助作弊方面的鲁棒性。
- 局限性与未来工作:
- 对于有听力障碍或语言处理困难的参与者的可访问性问题。
- 对ChatGPT的关注可能无法推广到其他AI工具。
- AI能力的潜在改进可能需要进一步优化筛选方法。
总结
本文提出了一种新颖的方法,通过引入抗AI辅助作弊的基于音频的任务,在实证研究中筛选程序员。通过利用序列化格式和严格的时间限制,所提出的方法能够有效地区分程序员和非程序员,即使在使用ChatGPT等AI工具的情况下亦然。研究确定了六个鲁棒的筛选问题,并提供了高效可靠的实施配置指南。尽管可访问性和未来AI技术的进步仍是挑战,但该研究为保持程序员研究的内部有效性提供了实用解决方案,并强调了在LLMs时代在线研究的更广泛意义。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
质疑人工智能:为可解释人工智能用户体验的设计实践提供信息
CHI '20· 可解释人工智能(XAI) +1
- 83%
如何使用可解释性方法来支持计算机视觉模型中的错误识别?
CHI '22· 可解释人工智能(XAI) +1
- 83%
芝诺:用于机器学习行为评估的交互式框架
CHI '23· 可解释人工智能(XAI) +1
- 71%
基于模型的强化学习适应用户界面
CHI '21· 大语言模型(LLM)的人机协作 +2
- 71%
RiskRAG:一种改进AI模型风险管理报告的数据驱动解决方案
CHI '25· 可解释人工智能(XAI) +2
- 71%
辅助接口的决策论表示
CHI '26· AI 辅助决策与自动化系统 +2
- 71%
AI 记忆差距:用户误记他们用 AI 或不用 AI 创建的内容
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
揭示安卓开发者、用户隐私与开发者降低指纹识别风险意愿之间的关系
CHI '26· 隐私设计与用户控制 +2
- 71%
让设计师保持参与:在多个目标中传达固有的算法权衡
DIS '20· 可解释人工智能(XAI) +2
- 67%
UMLAUT:使用程序结构和模型行为调试深度学习程序
CHI '21· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790302
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统、隐私设计与用户控制
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文