VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding Paper • 2607.14935 • Published 7 days ago • 166
Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation Paper • 2607.09581 • Published 13 days ago • 6
Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget Paper • 2607.13125 • Published 5 days ago • 136
ABot-N1: Toward a General Visual Language Navigation Foundation Model Paper • 2607.10383 • Published 9 days ago • 102
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published 15 days ago • 135
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation Paper • 2607.07608 • Published 15 days ago • 56
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation Paper • 2607.06559 • Published 16 days ago • 95
Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots Paper • 2607.02501 • Published 21 days ago • 57
TurboServe: Serving Streaming Video Generation Efficiently and Economically Paper • 2606.19271 • Published Jun 17 • 37
LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing Paper • 2606.26740 • Published 28 days ago • 82
Agentic Abstention: Do Agents Know When to Stop Instead of Act? Paper • 2606.28733 • Published 26 days ago • 148
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection Paper • 2303.05499 • Published Mar 9, 2023 • 9
Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models Paper • 2606.25041 • Published about 1 month ago • 120
Qwen-AgentWorld: Language World Models for General Agents Paper • 2606.24597 • Published about 1 month ago • 151
PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models Paper • 2606.19534 • Published Jun 17 • 65
Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance Paper • 2606.19195 • Published Jun 17 • 141