Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
Codifying the Judge: Scalable Evaluation via Program Distillation
Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling
IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages
FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels
Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
GNM Head: A Generative aNthropometric Model of the human head
dRAE: Representation Autoencoder with Hyper-Spherical Codes
A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
Kimi K3: Open Frontier Intelligence
Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
Data Pyramid for Embodied Manipulation
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey






























