Abstract
Referring Expression Segmentation (RES) links natural-language descriptions to pixel-level object masks. Yet standard evaluation provides limited insight into instance-level referential reasoning: it does not systematically distinguish referential logics, test target preservation across valid grounding paths, or separate target-selection from mask-generation errors. We introduce InstanceBench, an instance-centered diagnostic benchmark comprising 6,194 images, 9,264 target instances, and 25,077 human-verified expressions. Each target-centric expression set (TCES) fixes the image and target mask while pairing a minimal expression with a same-target variant that uses another valid cue or grounding path. A compact referential-logic taxonomy spans direct target evidence, same-class selection, relational and compositional grounding, and exclusion, while logic-critical construction suppresses simpler shortcuts. Identity-aware metrics measure target retention and set-level success while separating selection from mask-generation errors. Across 22 native-mask RES checkpoints from 18 model families, the strongest checkpoint reaches 67.1% mIoU but only 59.6% All@0.7. Controlled interventions confirm language sensitivity, while failure decomposition identifies target selection rather than mask decoding as the main bottleneck. On a controlled training subset, matched supervision improves identity-aware performance, showing that the diagnosed capability responds to targeted supervision. Collectively, InstanceBench supports a measure-diagnose-improve cycle: measuring target consistency across grounding paths, localizing failure sources, and evaluating targeted interventions.
Keywords
Subject
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Li, Y., Zhou, S., Wang, Y., Deng, R., Wang, H., Wei, Z., Zhao, Z., & Zhou, L. (2026). InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation. https://omanscience.com/en/articles/instancebench-diagnosing-referential-reasoning-and-target-identity-in-referring-expression-segmentation
MLA 9
Li, Yuchen, et al. "InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation." https://omanscience.com/en/articles/instancebench-diagnosing-referential-reasoning-and-target-identity-in-referring-expression-segmentation.
Chicago (author–date)
Li, Yuchen, Shaoyang Zhou, Yiran Wang, Ruiyi Deng, Haoyu Wang, Ziru Wei, Zhen Zhao, and Luping Zhou. 2026. "InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation." https://omanscience.com/en/articles/instancebench-diagnosing-referential-reasoning-and-target-identity-in-referring-expression-segmentation.
Harvard
Li, Y., Zhou, S., Wang, Y., Deng, R., Wang, H., Wei, Z., Zhao, Z. and Zhou, L. (2026) 'InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation', Available at: https://omanscience.com/en/articles/instancebench-diagnosing-referential-reasoning-and-target-identity-in-referring-expression-segmentation.
Vancouver
Li Y, Zhou S, Wang Y, Deng R, Wang H, Wei Z, et al. InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation. https://omanscience.com/en/articles/instancebench-diagnosing-referential-reasoning-and-target-identity-in-referring-expression-segmentation
IEEE
Y. Li, S. Zhou, Y. Wang, R. Deng, H. Wang, Z. Wei, Z. Zhao, and L. Zhou, "InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation," https://omanscience.com/en/articles/instancebench-diagnosing-referential-reasoning-and-target-identity-in-referring-expression-segmentation.