نسخة أولية وصول مفتوح
Detecting Pretraining Data in Large Language Models from a Free-Energy Perspective
Detecting pretraining data in large language models is challenging because high likelihood can reflect either training exposure or strong generalization. In the joint space of prediction loss and predictive entropy, a likelihood-only detector uses a horizontal boundary and can mistake predictable non-members for member …