Preprint Open access
When Cosine Similarity Fails to Reflect Linearly Accessible Structure in Dialogue Models
Cosine similarity is widely used to analyze transformer representations, implicitly assuming that similarity reflects task-relevant structure. We study when this assumption fails in dialogue-conditioned large language models. Across three 7-8B chat-tuned models, ambient cosine similarity substantially underestimates li …