الباحثون

Yanning Wang

المنشورات 1

نسخة أولية وصول مفتوح

How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

Zhankai Ye, Yanning Wang, Yukai Jin وآخرون · 2026

Safety-aligned language models often refuse a harmful request stated directly but answer the same request inside a role-play or narrative wrapper. We measure this vulnerability across languages and registers: attack success on Qwen3-1.7B is already 89.4% in English and 93.0% in modern Chinese, and reaches 95.7% in Clas …

المؤلفون المشاركون