الباحثون

Wei Shi

المنشورات 2

نسخة أولية وصول مفتوح

Faithful Activation Verbalization: Reducing Hallucinations in LLM Representation Interpretation

Haiyan Zhao, Zirui Hei, Wei Shi وآخرون · 2026

Activation verbalization methods such as Activation Oracle and Natural Language Autoencoders decode hidden representations of large language models into human-readable natural language. However, existing methods can produce incomplete or hallucinated descriptions, making their activation verbalizations difficult to tru …

المؤلفون المشاركون