LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes Paper • 2609.03796 • Published 13 days ago • 236
DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution Paper • 2608.31106 • Published 16 days ago • 102
KVAE: Family of Tokenizers for Multimodal Generative Models Paper • 2608.05798 • Published Aug 6 • 30
Kandinsky WM 1.0 Collection Image-to-Video models for Physical AI: autonomous driving, robotics, general physics. • 3 items • Updated Aug 4 • 6
SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation Paper • 2605.30116 • Published May 28 • 5
SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Paper • 2607.21553 • Published Jul 23 • 40
Xiaomi-Robotics-U0 Collection Unified embodied synthesis model that bridges foundation image generation and embodied world modeling • 5 items • Updated 7 days ago • 12
Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget Paper • 2607.13125 • Published Jul 18 • 142
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence Paper • 2607.07675 • Published Jul 8 • 65
KVAE 2.0 Collection KVAE 2.0 is a family of image and video tokenizers with a time compression ratio of 4 and spacial compression ratio of 8 and 16 • 3 items • Updated Aug 6 • 5
KVAE-Audio Collection KVAE-Audio is a continuous full-band audio waveform autoencoder • 2 items • Updated Aug 10 • 7
LTX-2.3 Creative Lab Collection LoRAs and IC-LoRAs, trained on the LTX-2.3 model • 26 items • Updated 6 days ago • 91
AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation Paper • 2606.03972 • Published Jun 2 • 15