Abstract

High annotation reproducibility does not necessarily imply that an LLM-inferred measure captures the construct it is intended to measure. We test this distinction using a dataset from the European Commission's AI Act consultation, linking structured survey responses to free-text consultation submissions from the same stakeholders. LLM annotations of consultation submissions are highly reproducible (intraclass correlations > 0.99), yet show limited convergence with survey-reported measures of the nominal construct they were intended to approximate. Divergence between survey-and LLM-inferred text-based measures varies systematically across stakeholder groups: business associations express greater concern about AI risks in text-based consultations than in survey responses ({g} = +1.0), whereas public authorities and several nonbusiness groups show smaller or negative divergences. Divergences between scores suggest positive spatial autocorrelation across European countries (Moran's I = 0.347, p = 0.036), indicating that stakeholders from neighboring countries tend toward more similar text-based stances towards AI safety concerns. Despite divergence, survey-reported concerns remain strongly associated with support for explainability across all divergence levels. These results demonstrate that LLM annotation reproducibility can coexist with poor construct correspondence and motivate validation procedures that distinguish reproducibility, construct validity, and communication context variation when LLMs are used as measurement instruments.

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Batzdorfer, V., & Santagiustina, C. R. M. A. (2026). Reproducibility is not construct validity: LLM measurement of institutionally situated communication. https://omanscience.com/en/articles/reproducibility-is-not-construct-validity-llm-measurement-of-institutionally-situated-communication

MLA 9

Batzdorfer, Veronika, and Carlo Romano Marcello Alessandro Santagiustina. "Reproducibility is not construct validity: LLM measurement of institutionally situated communication." https://omanscience.com/en/articles/reproducibility-is-not-construct-validity-llm-measurement-of-institutionally-situated-communication.

Chicago (author–date)

Batzdorfer, Veronika, and Carlo Romano Marcello Alessandro Santagiustina. 2026. "Reproducibility is not construct validity: LLM measurement of institutionally situated communication." https://omanscience.com/en/articles/reproducibility-is-not-construct-validity-llm-measurement-of-institutionally-situated-communication.

Harvard

Batzdorfer, V. and Santagiustina, C. R. M. A. (2026) 'Reproducibility is not construct validity: LLM measurement of institutionally situated communication', Available at: https://omanscience.com/en/articles/reproducibility-is-not-construct-validity-llm-measurement-of-institutionally-situated-communication.

Vancouver

Batzdorfer V, Santagiustina CRMA. Reproducibility is not construct validity: LLM measurement of institutionally situated communication. https://omanscience.com/en/articles/reproducibility-is-not-construct-validity-llm-measurement-of-institutionally-situated-communication

IEEE

V. Batzdorfer, and C. R. M. A. Santagiustina, "Reproducibility is not construct validity: LLM measurement of institutionally situated communication," https://omanscience.com/en/articles/reproducibility-is-not-construct-validity-llm-measurement-of-institutionally-situated-communication.