الباحثون

Xiaoling Wang

المنشورات 3

نسخة أولية وصول مفتوح

MEMO: Multi-Level Entity-Aware Memory for Streaming Video Understanding

Yinying Li, Yuqian Fu, Yulin Dai وآخرون · 2026 · 10.1145/3767308.3835688

Streaming video understanding requires models to process unbounded visual streams while preserving rich visual semantics across vast temporal horizons, posing a fundamental challenge for memory modeling. Existing approaches primarily focus on increasing memory capacity, either by compressing historical information into …

نسخة أولية وصول مفتوح

TAC-Time: Texts as Channels For Multimodal Time Series Forecasting

Jiayi Liang, Xiaotian Gu, Xinyu Xie وآخرون · 2026

Most existing time series forecasting methods rely solely on numerical observations, overlooking rich contextual information from auxiliary texts. Recent multimodal approaches attempt to incorporate textual signals, but they often treat text as static features or use large language models as forecasting backbones, limi …

نسخة أولية وصول مفتوح

GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation

Kailing Li, Yu Han, Tianwen Qian وآخرون · 2026

Although vision-language models (VLMs) possess strong visual understanding and reasoning capabilities, existing vision-and-language navigation (VLN) agents struggle to connect semantic reasoning with spatial execution. Two coupled gaps remain in this connection, as intermediate reasoning is not explicitly anchored to v …

المؤلفون المشاركون