500AI
Search

Rafael Rafailov

  • Direct Preference Optimization: Your Language Model is Secretly a Reward Model
  • Disentangling Length from Quality in Direct Preference Optimization
  • From r to Q*: Your Language Model is Secretly a Q-Function

All names