[
    {
        "id": "osp-17835",
        "type": "article-journal",
        "title": "InstanceBench: Diagnosing Referential Reasoning and Target Identity in Referring Expression Segmentation",
        "author": [
            {
                "family": "Li",
                "given": "Yuchen"
            },
            {
                "family": "Zhou",
                "given": "Shaoyang"
            },
            {
                "family": "Wang",
                "given": "Yiran"
            },
            {
                "family": "Deng",
                "given": "Ruiyi"
            },
            {
                "family": "Wang",
                "given": "Haoyu"
            },
            {
                "family": "Wei",
                "given": "Ziru"
            },
            {
                "family": "Zhao",
                "given": "Zhen"
            },
            {
                "family": "Zhou",
                "given": "Luping"
            }
        ],
        "URL": "https://omanscience.com/ar/articles/instancebench-diagnosing-referential-reasoning-and-target-identity-in-referring-expression-segmentation",
        "language": "en",
        "issued": {
            "date-parts": [
                [
                    2026
                ]
            ]
        },
        "abstract": "Referring Expression Segmentation (RES) links natural-language descriptions to pixel-level object masks. Yet standard evaluation provides limited insight into instance-level referential reasoning: it does not systematically distinguish referential logics, test target preservation across valid grounding paths, or separate target-selection from mask-generation errors. We introduce InstanceBench, an instance-centered diagnostic benchmark comprising 6,194 images, 9,264 target instances, and 25,077 human-verified expressions. Each target-centric expression set (TCES) fixes the image and target mask while pairing a minimal expression with a same-target variant that uses another valid cue or grounding path. A compact referential-logic taxonomy spans direct target evidence, same-class selection, relational and compositional grounding, and exclusion, while logic-critical construction suppresses simpler shortcuts. Identity-aware metrics measure target retention and set-level success while separating selection from mask-generation errors. Across 22 native-mask RES checkpoints from 18 model families, the strongest checkpoint reaches 67.1% mIoU but only 59.6% All@0.7. Controlled interventions confirm language sensitivity, while failure decomposition identifies target selection rather than mask decoding as the main bottleneck. On a controlled training subset, matched supervision improves identity-aware performance, showing that the diagnosed capability responds to targeted supervision. Collectively, InstanceBench supports a measure-diagnose-improve cycle: measuring target consistency across grounding paths, localizing failure sources, and evaluating targeted interventions."
    }
]