SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness Paper • 2609.20519 • Published 2 days ago • 45
When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation Paper • 2609.20511 • Published 2 days ago • 29
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression Paper • 2609.19969 • Published 2 days ago • 56
What Does Privileged Information Add to On-Policy Self-Distillation? Paper • 2609.20612 • Published 2 days ago • 4
When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models Paper • 2609.19671 • Published 2 days ago • 4
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 2 days ago • 15
Continual Learning Mechanisms Compose for Long-Horizon Memorization Paper • 2609.06986 • Published 12 days ago • 318
ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals Paper • 2609.16816 • Published 4 days ago • 4
Training Specialist Models without Reasoning Trajectories for Domain Expert Distillation Paper • 2609.13770 • Published 7 days ago • 3
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence Paper • 2609.17488 • Published 4 days ago • 167
SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization Paper • 2609.14320 • Published 6 days ago • 23
Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening Paper • 2609.18708 • Published 3 days ago • 62
Register Tokens for Bounded-State Reasoning in Diffusion Language Models Paper • 2609.16372 • Published 5 days ago • 5
How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus Paper • 2609.15504 • Published 5 days ago • 31
Learning to Solve Hard Problems in RL for LLMs by Never Giving Up Paper • 2609.13443 • Published 8 days ago • 10
Lightning Weave: Improving the Accuracy-Efficiency Frontier of Reasoning Models through Capability Composition Paper • 2609.14708 • Published 6 days ago • 2
DataFlex-RL: An Evaluation Platform for RLVR Data Policies Paper • 2609.06107 • Published 14 days ago • 80
Dream-RSI: Recursive Self-Improvement through Evolving Worlds Paper • 2609.14858 • Published 5 days ago • 226
Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction Paper • 2609.13285 • Published 11 days ago • 68
Expert-Space Exploration in MoE Reinforcement Learning Paper • 2609.13058 • Published 8 days ago • 7