الباحثون

Yuqian Fu

المنشورات 3

نسخة أولية وصول مفتوح

MEMO: Multi-Level Entity-Aware Memory for Streaming Video Understanding

Yinying Li, Yuqian Fu, Yulin Dai وآخرون · 2026 · 10.1145/3767308.3835688

Streaming video understanding requires models to process unbounded visual streams while preserving rich visual semantics across vast temporal horizons, posing a fundamental challenge for memory modeling. Existing approaches primarily focus on increasing memory capacity, either by compressing historical information into …

نسخة أولية وصول مفتوح

AHMAD: Adaptive Hybrid Multi-task Vision Learning with Assisted Distillation for Keypoint Detection

Generalist multitasking vision models aim to unify multiple vision tasks within a single framework, enabling more efficient and versatile learning. However, handling diverse vision tasks -- spanning dense and sparse predictions -- remains challenging due to their inherently varying output structures. In this paper, we …

نسخة أولية وصول مفتوح

GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation

Kailing Li, Yu Han, Tianwen Qian وآخرون · 2026

Although vision-language models (VLMs) possess strong visual understanding and reasoning capabilities, existing vision-and-language navigation (VLN) agents struggle to connect semantic reasoning with spatial execution. Two coupled gaps remain in this connection, as intermediate reasoning is not explicitly anchored to v …

المؤلفون المشاركون