机器学习预测心理健康中的上下文差距:以诊断披露为案例
在社交媒体数据上进行心理健康机器学习(ML)预测的标注数据获取劳动密集型。为了解决这一问题,ML团队推断代理信号或数据中的替代迹象来评估疾病状态并创建训练数据集。然而,这些信号的有效性尚未确定,它们是否与重要的上下文因素一致,以及代理质量如何影响下游模型完整性。我们使用ML和定性方法评估一个流行的代理信号——诊断自我披露——是否产生了一个概念上合理的心理健康ML模型。我们的发现仅通过定性研究发现了主要概念错误——基于诊断披露构建的训练数据编码了狭隘的诊断体验愿景,这种狭隘性会传递到下游ML模型中。这种差距被ML分类器 strong performance所掩盖(F1 = 0.91)。我们讨论了在为以人为本模型创建训练数据时概念差距的含义,并提出了改进研究方法的建议。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文