الباحثون

Ruiyang Huang

المنشورات 1

نسخة أولية وصول مفتوح

How to Tame a Multi-Headed Hydra? Adaptive Multi-Category Safety Steering for Large Language Models

Chenxi Wang, Ruiyang Huang, Li Huang وآخرون · 2026

As large language models (LLMs) become increasingly widespread, preventing unsafe responses to harmful prompts is essential for their safe deployment. Activation steering offers an approach to improving LLM safety by modifying internal activations during inference without updating model parameters. However, a single pr …

المؤلفون المشاركون