OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper • 2607.23855 • Published 5 days ago • 26
OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano Feature Extraction • 22M • Updated Apr 29 • 79.5k • 28
OpenMOSS-Team/MOSS-VL-Instruct-0408 Video-Text-to-Text • 11B • Updated 15 days ago • 15.3k • 101