الملخص
VLM bounding-box localization is both language generation and spatial commitment. Parseable fields such as bbox_2d make localization easy to score, but dimensions that emit coordinate tokens need not repair localization after visual evidence is damaged. We study this readout/recovery separation in Qwen3-VL-4B-Instruct on single-object COCO grounding. We compare clean coordinate-token readout rankings with corruption-derived repair rankings, using object-mask endpoint replacement for recovery and clean-input flooring for depth localization. In Qwen3-VL, coordinate-token rankings are inert through layer 24, load-bearing from layers 32-35, and peak at layer 34; corruption-derived rankings harm layers 16-24 but become beneficial near layer 35/final. A Kimi-VL-A3B diagnostic shows a matching output-proximal transition despite a different box format. Object-mask recovery separates rank budgets: $k=250$ shows necessity, $k=500$ shows Top-$k$ restoration above random, and $k=d/2$ is largely capacity-driven. Partial-occlusion sweeps reveal that high-overlap coordinate-token sets can hurt at $k=1000$ and help mainly at half-width, while population corruption-derived sets provide no reliable fixed repair set. Edge-attribution patching shows coordinate-token paths are high precision but low recall for detection recovery, and RMSNorm quasi-layer controls do not close the endpoint-repair gap. Endpoint coordinate triage is therefore a useful circuit prior, but occlusion recovery requires a separate benchmark.
الكلمات المفتاحية
الموضوع
بيانات النشر
- المجلة
- غير متاح
- وصول مفتوح
- وصول مفتوح أخضر
اقتبس هذه المقالة
APA 7
Juanico, D. E. (2026). Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models. https://omanscience.com/ar/articles/readout-is-not-recovery-dissociating-coordinate-emission-from-visual-corruption-repair-in-vision-language-models
MLA 9
Juanico, Drandreb Earl. "Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models." https://omanscience.com/ar/articles/readout-is-not-recovery-dissociating-coordinate-emission-from-visual-corruption-repair-in-vision-language-models.
شيكاغو (المؤلف–التاريخ)
Juanico, Drandreb Earl. 2026. "Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models." https://omanscience.com/ar/articles/readout-is-not-recovery-dissociating-coordinate-emission-from-visual-corruption-repair-in-vision-language-models.
هارفارد
Juanico, D. E. (2026) 'Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models', Available at: https://omanscience.com/ar/articles/readout-is-not-recovery-dissociating-coordinate-emission-from-visual-corruption-repair-in-vision-language-models.
فانكوفر
Juanico DE. Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models. https://omanscience.com/ar/articles/readout-is-not-recovery-dissociating-coordinate-emission-from-visual-corruption-repair-in-vision-language-models
IEEE
D. E. Juanico, "Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models," https://omanscience.com/ar/articles/readout-is-not-recovery-dissociating-coordinate-emission-from-visual-corruption-repair-in-vision-language-models.