A risk committee is reviewing an AI model that produces a continuous risk score for each loan applicant. The committee wants to ensure the model is well-calibrated. Which test BEST assesses calibration?
Select an answer to reveal the explanation.
Short Explanation and Infographic
Here's the deal — b is correct because calibration assessment requires comparing predicted probabilities to actual observed outcomes — a calibration plot (reliability diagram) and Brier score directly measure whether a model that predicts 20% default probability actually defaults at 20% in practice. A measures discriminatory power, not calibration.
Full explanation below image
Full Explanation
B is correct because calibration assessment requires comparing predicted probabilities to actual observed outcomes — a calibration plot (reliability diagram) and Brier score directly measure whether a model that predicts 20% default probability actually defaults at 20% in practice. A measures discriminatory power, not calibration. C measures feature contributions. D tests geographic generalization, not calibration.