Preprint Open access
RADNPO: Reference-free Adaptive Negative Preference Optimization for LLM Unlearning
Large language models (LLMs) can memorize sensitive, private, or copyrighted content during pre-training, making machine unlearning necessary for removing targeted knowledge. Recent preference optimization (PO)-based unlearning methods improve stability over gradient ascent (GA)-based methods by introducing alignment-s …