Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learning
Doohyuk Jang
jadohu
AI & ML interests
None yet
Recent Activity
authored a paper about 2 hours ago
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR upvoted a paper about 8 hours ago
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR submitted a paper about 9 hours ago
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR