500AI
Search

Archit Sharma

  • Direct Preference Optimization: Your Language Model is Secretly a Reward Model
  • A Critical Evaluation of AI Feedback for Aligning Large Language Models
  • Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement Learning

All names