RewardExplainer: Learning Reward Model Explanations from Counterfactuals
RewardExplainer extracts interpretable response behaviors from reward models using counterfactual preference feedback.
RewardExplainer extracts interpretable response behaviors from reward models using counterfactual preference feedback.