Güvenlik kısıtlarını aşma (Jailbreak)
Jailbreak
D5 · Güvenlik, mahremiyet, yönetişim ve fikrî haklar
Dil modeli güvenliğinde jailbreak, modelin normalde kısıtlanan davranışı üretmesi için korumalarını aşma girişimidir.
İnceleme durumu: 2026-12-05
Teknik açıklama
Hedef bir güvenlik kısıtıdır; başarılı aşma, sistemin amaçlanan kısıtlarına göre değerlendirilir.
Kavramsal sınırlar
Kullanımı istem enjeksiyonuyla örtüşür; OWASP jailbreak’i bunun bir biçimi sayar. Burada cihaz işletim sisteminin kısıtlarını kaldırma anlamı kullanılmaz.
Sağlayıcıdan bağımsız örnek
Örnek: Yetkili değerlendirici, bir test asistanının tanımlanmış güvenlik sınırını koruyup korumadığını kontrol eder.
Sınırlılıklar
Sonuçlar test edilen modele ve korumalara bağlıdır; başarılı bir test evrensel bir aşma yöntemi ortaya koymaz.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1OWASP LLM01:2025 Prompt Injection
- Kaynak
- OWASP LLM01:2025 Prompt Injection
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Opening definition: relationship between prompt injection and jailbreaking; Prevention and Mitigation Strategies
- Desteklenen iddia
- OWASP jailbreak’i güvenlik protokollerini aşma olarak açıklar; Zou ve çalışma arkadaşları hizalama korumalarının aşılmasını inceler.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, kavramsal güvenlik tanımıdır; saldırı prosedürü veya güncel ürünler hakkında güvence değildir.
1.2Universal and Transferable Adversarial Attacks on Aligned Language Models
- Kaynak
- Universal and Transferable Adversarial Attacks on Aligned Language Models
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract: circumventing alignment measures and objectionable generation
- Desteklenen iddia
- OWASP jailbreak’i güvenlik protokollerini aşma olarak açıklar; Zou ve çalışma arkadaşları hizalama korumalarının aşılmasını inceler.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, kavramsal güvenlik tanımıdır; saldırı prosedürü veya güncel ürünler hakkında güvence değildir.