Ian Cole
codingiancole
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a model 1 day ago
kaiokendev/superhot-13b-16k-no-rlhf-test liked a model 1 day ago
Ablustrund/moss-rlhf-reward-model-7B-zh liked a model 1 day ago
RLHFlow/Llama3.1-8B-PRM-Deepseek-DataOrganizations
None yet