← Topics

Reward Modeling and Preference Learning

Papers on training reward models and critics to learn human preferences through reinforcement learning, including approaches for visual reasoning, multi-objective alignment, and preference-based optimization.

rewardpreferencecriticreinforcement learningreinforcementreward modelsvisual reasoningpreferences

Papers

18

Last 4 weeks

18

New topic

Papers per week

Jun 8Jul 20Aug 24

Papers