OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published 13 days ago • 68
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 6 days ago • 33
ChronoVision: Temporal Reasoning via Latent State Reconstruction Paper • 2608.05631 • Published 6 days ago • 38
When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation Paper • 2608.03632 • Published 8 days ago • 22
UniWorld-Design: From Pixel Generation to Layer-Native Design Paper • 2608.03971 • Published 7 days ago • 21