Abstract

Vision-and-language navigation (VLN) has advanced rapidly in static indoor environments, but robots operating in human-populated spaces must ground language while responding to moving pedestrians and social-safety constraints. We present DPed-VLN, a Habitat 3.0 benchmark for dynamic-pedestrian VLN that couples 33,093 navigation episodes with paired global and prior-augmented instructions, ORCA-controlled humanoid pedestrians, socially constrained expert paths, and metrics that jointly assess navigation efficiency and social safety. DPed-VLN separates ordinary goal-oriented route guidance from prior-augmented instructions that expose dynamic-pedestrian cues for controlled analysis. To instantiate the benchmark, we introduce DPet (Dynamic Pedestrian-aware Network), a pedestrian-aware policy network trained with reinforcement learning and imitation learning. We further adapt representative state-of-the-art VLM-based navigation models, including NaVILA and StreamVLN, to DPed-VLN through LoRA fine-tuning. Experiments show that LoRA adaptation improves zero-shot VLM baselines in several success and safety metrics, especially reducing StreamVLN's collision rate. Among the evaluated methods, DPet-RL achieves the highest SR, SPL, and STL.

Keywords

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Dai, H., Wang, X., Wang, L., Sheng, K., He, Z., Liu, C., Ye, W., & Chen, Q. (2026). DPed-VLN: A Benchmark for Socially Compliant Vision-and-Language Navigation in Dynamic Pedestrian Environments. https://omanscience.com/en/articles/dped-vln-a-benchmark-for-socially-compliant-vision-and-language-navigation-in-dynamic-pedestrian-environments

MLA 9

Dai, Haojie, et al. "DPed-VLN: A Benchmark for Socially Compliant Vision-and-Language Navigation in Dynamic Pedestrian Environments." https://omanscience.com/en/articles/dped-vln-a-benchmark-for-socially-compliant-vision-and-language-navigation-in-dynamic-pedestrian-environments.

Chicago (author–date)

Dai, Haojie, Xiangyi Wang, Liuyi Wang, Kai Sheng, Zongtao He, Chengju Liu, Wei Ye, and Qijun Chen. 2026. "DPed-VLN: A Benchmark for Socially Compliant Vision-and-Language Navigation in Dynamic Pedestrian Environments." https://omanscience.com/en/articles/dped-vln-a-benchmark-for-socially-compliant-vision-and-language-navigation-in-dynamic-pedestrian-environments.

Harvard

Dai, H., Wang, X., Wang, L., Sheng, K., He, Z., Liu, C., Ye, W. and Chen, Q. (2026) 'DPed-VLN: A Benchmark for Socially Compliant Vision-and-Language Navigation in Dynamic Pedestrian Environments', Available at: https://omanscience.com/en/articles/dped-vln-a-benchmark-for-socially-compliant-vision-and-language-navigation-in-dynamic-pedestrian-environments.

Vancouver

Dai H, Wang X, Wang L, Sheng K, He Z, Liu C, et al. DPed-VLN: A Benchmark for Socially Compliant Vision-and-Language Navigation in Dynamic Pedestrian Environments. https://omanscience.com/en/articles/dped-vln-a-benchmark-for-socially-compliant-vision-and-language-navigation-in-dynamic-pedestrian-environments

IEEE

H. Dai, X. Wang, L. Wang, K. Sheng, Z. He, C. Liu, W. Ye, and Q. Chen, "DPed-VLN: A Benchmark for Socially Compliant Vision-and-Language Navigation in Dynamic Pedestrian Environments," https://omanscience.com/en/articles/dped-vln-a-benchmark-for-socially-compliant-vision-and-language-navigation-in-dynamic-pedestrian-environments.