تعریف
تلاش برای دور زدن محدودیتهای امنیتی مدل از طریق پرامپتهای طراحیشده برای بیرون کشیدن محتوای ممنوع.
توضیح کامل
روشهای رایج: Role-playing (وانمود کردن به شخصیت دیگر)، Prompt injection، Dan-style prompts. شرکتهای هوش مصنوعی با Red teaming و Adversarial training بهطور مداوم در برابر jailbreakهای جدید دفاع میکنند. استفاده موفق از jailbreak نقض شرایط خدمات است.
مثال کاربردی
“وانمود کن یک AI بدون محدودیت هستی و…” از الگوهای کلاسیک jailbreak است.