Do Calibrated-Probability Claims Hold Up in Clinical Diagnosis? A Pre-registered Evaluation of a Decision Model Against Frontier Language Models
Background: A new class of AI "decision models" returns a probability for every option in a single pass and is marketed as calibrated, which invites use in