See2Think: Do Multimodal Models Really Use Intermediate Visual States? Paper • 2607.26769 • Published 6 days ago • 23
DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation Paper • 2606.31537 • Published Jun 30 • 29