arxiv:2608.13556
Shengqiong Wu
ChocoWu
AI & ML interests
Large Language Model, Multimodal learning, Scene graph Generation
Recent Activity
authored a paper about 2 hours ago
V-RAE: Rethinking Video Latent Spaces for Generation authored a paper about 2 hours ago
HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning authored a paper about 2 hours ago
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist