Archit SharmaDirect Preference Optimization: Your Language Model is Secretly a Reward ModelA Critical Evaluation of AI Feedback for Aligning Large Language ModelsSelf-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement LearningAll names