U2.09.3Side-by-side box plot comparison设计研究
箱线图的长处是并排比较多组分布
别名: 多组箱线图 · 并排分布比较 · grouped box plots
概念解释
并排箱线图(side-by-side box plots)让多组在同一数值标尺上重复使用箱、中位线、须和箱外点,适合比较各组的位置、中央散布和尾部候选。它的优势来自紧凑而一致的摘要,不意味着组越多越好,也不意味着箱线图优于所有分布图。若问题关心峰形、个体轨迹或细微尾部,每组一个箱会压掉所需信息;若问题只需跨组粗筛,它能减少多个独立图之间的换算。
机制
共同数值轴使中位数和四分位端点成为对齐位置,重复图式让读者把注意力放在组间差异。合理排序还能把任务相关的梯度、等级或时间次序转化为空间结构。但每组仍是样本摘要:箱体重叠不证明总体相同,箱体分离也不自动证明差异显著。类别增多、标签变长、箱外点拥挤或组内样本量差异过大时,扫描成本与误读风险会重新上升。
怎么研究
先区分中位数排序、IQR 比较、尾部筛查、完整形状和个体查找任务,再比较并排箱线、点图、ECDF、小提琴图和小倍数。操纵组数、排序、标签、尺度、样本量、分布形状与移动/桌面尺寸,记录正确率、时间、视线往返和置信度。研究应使用预先定义的任务容差,而不是把审美偏好或固定秒数当成成功;也要检查读屏用户能否按组和统计量导航。
边界
跨组比较要求变量单位、纳入规则、时间窗、变换、四分位算法和须线规则一致。时间、流程或等级有自然顺序时不应为了中位数排序破坏语义;探索排名时可按中位数排序并明确排序键。类别太多时,可按有意义层级分面、筛选或交互搜索,但不能只保留差异最大的组。配对或重复测量数据的个体变化不会由独立箱体显示,需要连接点或专门模型。
怎么落地
- 根据主要比较任务确定组序,并让所有组共享可见的数值轴、单位和统计规则。
- 在每组附近提供样本量;形状或个案重要时叠加可辨原始点,或提供按组展开视图。
- 为长标签、窄屏和缩放设计可重排或滚动布局,保持标签与箱体的程序化关联,不只靠位置或颜色识别。
- 提供按组读取的结构化摘要与数据表,包含中位数、Q1、Q3、须端、箱外点数和缺失情况。
- 用真实问题验收组别排名、散布差异和尾部候选;若读者需要反复查图例或把摘要差异解释成显著性,调整排序、标注或分析说明。