Arjun Patel
apatel-1995
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
upvoted a paper 2 days ago
X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization upvoted a paper 2 days ago
Hierarchical Continuous Diffusion Language Models liked a dataset 4 days ago
andersonbcdefg/red_teaming_reward_modeling_pairwiseOrganizations
None yet