World Wires · story 3509 · corroborated · 1 source(s)

RewardExplainer: Learning Reward Model Explanations from Counterfactuals

RewardExplainer extracts interpretable response behaviors from reward models using counterfactual preference feedback.

Open in the desk

Coverage

What this site indexes