Human-Centered Personalization in Radiology AI: Evaluating Trust, Usability, and Cross-Hospital Robustness
Paper Title
Human-Centered Personalization in Radiology AI: Evaluating Trust, Usability, and Cross-Hospital Robustness
Publication Info
- Topic area: Human-centered AI for medical imaging diagnostics
- Keywords: Radiology AI, federated learning, FFT harmonization, CLIP personalization, cross-hospital robustness, interpretability, patient trust, workflow integration, medical imaging, equity
Background and Problem
- Problem / challenge: Variability in imaging devices and protocols across hospitals undermines diagnostic reliability, interpretability, and trust in AI systems. Existing federated learning methods fail to address clinical heterogeneity or provide sufficient personalization and transparency.
- Significance: Addressing these challenges is critical for equitable and trustworthy AI adoption in healthcare, ensuring consistent diagnostics across institutions while preserving clinician agency and patient confidence.
- Motivation and related work: Prior work on federated learning and domain adaptation has improved privacy and generalization but remains insufficient for managing clinical heterogeneity or integrating human-centered design principles. Medical AI systems often lack interpretability and fail to align with clinician workflows or patient expectations, leaving gaps in usability and trust.
Solution
- Proposed approach: A federated learning framework combining FFT-based spectral harmonization and CLIP-based instruction-conditioned personalization to improve diagnostic robustness, interpretability, and equity across hospitals.
- Novelty:
- Integration of FFT-based spectral harmonization to reduce device-induced variability while preserving anatomical fidelity.
- CLIP-based personalization enabling clinicians to steer diagnostic outputs using free-form textual instructions.
- Multi-level evaluation demonstrating technical performance, clinician usability, and patient trust across diverse hospitals and modalities.
- Procedure and key techniques:
- FFT harmonization adjusts amplitude spectra based on radiomics descriptors while preserving phase information for structural fidelity.
- CLIP embeddings align textual instructions with reconstructed images, enabling semantic steering of outputs.
- Federated learning aggregates encrypted model updates across hospitals, ensuring privacy while improving generalization.
- Evaluation includes diagnostic accuracy, clinician workflow integration, and patient-centered outcomes across four hospitals and multiple imaging modalities.
Results
- Concrete findings:
- Diagnostic accuracy improved significantly across tasks: polyp detection (0.88 ± 0.02), rotator cuff tear diagnosis (0.85 ± 0.03), pneumothorax classification (0.89 ± 0.02), and breast cancer segmentation (Dice = 0.82).
- CLIP-based personalization increased text–image alignment (0.72 vs. 0.61 without personalization).
- Reconstruction latency averaged 2.3–6.2 seconds across modalities, within clinically acceptable bounds.
- Advantage over baselines:
- FFT harmonization improved cross-site performance by 3–5%, while CLIP personalization added 2–4% gains.
- Robustness to device variability retained 91% of baseline performance under perturbations, compared to 77% for conventional federated learning.
- Experiments / evaluation:
- Multi-level evaluation with 15 radiologists and 50 patients across four hospitals, covering modalities like endoscopy, ultrasound, X-ray, and CT.
- Surveys and interviews assessed clinician workflow compatibility, interpretability, and patient trust.
- Leave-one-hospital-out tests confirmed generalization across institutions.
- Limitations and future work:
- Limited external validation across additional hospitals and devices.
- Dependency on clinician-provided instructions, which may vary in clarity.
- Need for medical-specific CLIP variants and expanded fairness auditing.
- Prospective trials to measure downstream clinical impact and workflow integration.
Summary
This paper introduces a federated learning framework combining FFT harmonization and CLIP-based personalization to address cross-hospital variability in radiology AI. The system improves diagnostic accuracy, interpretability, and equity while preserving privacy and clinician agency. Multi-level evaluations demonstrate robust performance across diverse modalities and institutions, with significant gains in patient trust and reduced anxiety. Future work will expand validation, enhance fairness auditing, and refine explanation interfaces to support broader adoption in clinical practice.
Research Questions / Practical Problems
Question signals indexed for this paper.
- 100%
Towards Trustable Intelligent Clinical Decision Support Systems: A User Study with Ophthalmologists
IUI '25· Explainable AI (XAI) +1
- 80%
CheXplain: Enabling Physicians to Explore and Understand Data-Driven, AI-Enabled Medical Imaging Analysis
CHI '20· Explainable AI (XAI) +2
- 75%
Clinical Documentation as End-User Programming
CHI '20· Telemedicine & Remote Patient Monitoring
- 60%
“If I Had All the Time in the World”: Ophthalmologists' Perceptions of Anchoring Bias Mitigation in Clinical AI Support
CHI '23· Explainable AI (XAI) +1
- 60%
Harnessing Biomedical Literature to Calibrate Clinicians' Trust in AI Decision Support Systems
CHI '23· Explainable AI (XAI) +1
- 60%
Rethinking the Role of AI with Physicians in Oncology: Revealing Perspectives from Clinical and Research Workflows
CHI '23· Explainable AI (XAI) +1
- 60%
``It Is a Moving Process'': Understanding the Evolution of Explainability Needs of Clinicians in Pulmonary Medicine
CHI '24· Explainable AI (XAI) +1
- 60%
Design and Multi-level Evaluation of MAP-X: a Medically Aligned, Patient-Centered AI Explanation System
CHI '26· Explainable AI (XAI) +1
- 60%
SkinGEN: an Explainable Dermatology Diagnosis-to-Generation Framework with Interactive Vision-Language Models
IUI '25· Brain-Computer Interface (BCI) & Neurofeedback +1
- 60%
Diagnosing Medical Score Calculator Apps
UbiComp '23· Explainable AI (XAI) +1
Based on Jaccard similarity of research subtopics & professions (≥60%)