Abstract
A reasoning model asked whether a causal effect is recoverable from observational data can fail in two ways: it refuses an identifiable query or answers a nonidentifiable one. The latter is more consequential, as no observational data can validate the claimed formula. Measuring this failure requires queries that are provably non-identifiable, which prior evaluations lack, and grading that accepts correct formulas in any equivalent form, which string matching cannot provide. We build CERTID, a formal identification pipeline that addresses both limitations. CERTID uses the sound and complete causal identification algorithm ID to certify whether an effect is identifiable from a given graph and query, and verifies returned formulas against structural causal models whose interventional distributions are known exactly. CERTID further develops theoretical results to mitigate structural leakage, repair non-identifiable queries, and establish grading guarantees. We evaluate three frontier reasoning models (Gemini Flash, Gemini Pro, and GPT5.5) on 1,200 certified instances spanning 4 to 50 vertices. Accuracy proves a poor proxy for soundness: on identical instances, the false-claim rate on non-identifiable queries varies by seventeen-fold across models. We also find that models decide identifiability with 97-100% accuracy on graphs generated after the strongest model's training snapshot. Instances, the certification procedure, the verifier, and per-instance records are available at https://anonymous.4open.science/r/certid-D718.
Keywords
Subject
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Behnam, A., & Wang, B. (2026). Reasoning Models Are Accurate but Unsound on Identification. https://omanscience.com/en/articles/reasoning-models-are-accurate-but-unsound-on-identification
MLA 9
Behnam, Arman, and Binghui Wang. "Reasoning Models Are Accurate but Unsound on Identification." https://omanscience.com/en/articles/reasoning-models-are-accurate-but-unsound-on-identification.
Chicago (author–date)
Behnam, Arman, and Binghui Wang. 2026. "Reasoning Models Are Accurate but Unsound on Identification." https://omanscience.com/en/articles/reasoning-models-are-accurate-but-unsound-on-identification.
Harvard
Behnam, A. and Wang, B. (2026) 'Reasoning Models Are Accurate but Unsound on Identification', Available at: https://omanscience.com/en/articles/reasoning-models-are-accurate-but-unsound-on-identification.
Vancouver
Behnam A, Wang B. Reasoning Models Are Accurate but Unsound on Identification. https://omanscience.com/en/articles/reasoning-models-are-accurate-but-unsound-on-identification
IEEE
A. Behnam, and B. Wang, "Reasoning Models Are Accurate but Unsound on Identification," https://omanscience.com/en/articles/reasoning-models-are-accurate-but-unsound-on-identification.