Meta's new Video Understanding Multimodal Model used Qwen model for traininghttps://arxiv.org/abs/2412.10360 by BUFU • 2 years ago 7 1 2 years agoARarxiv.org