YZ kırmızı takım çalışması
AI red teaming
D5 · Güvenlik, mahremiyet, yönetişim ve fikrî haklar
YZ kırmızı takım çalışması, zararlı çıktıları veya başarısızlıkları belgeleyip ele almak için bir YZ sistemini bilinçli olarak zorlayan testler yürütür.
İnceleme durumu: 2026-12-05
Teknik açıklama
Test durumları insanlarca yazılabilir veya modellerle üretilebilir; bulgular tanımlı kapsam içinde değerlendirilir.
Kavramsal sınırlar
Tek bir jailbreak girişiminden daha geniştir ve kendi başına bir sistemin güvenliğini sertifikalandırmaz.
Sağlayıcıdan bağımsız örnek
Örnek: Yetkili ekip, deneme ortamındaki asistanı mahremiyet ihlalleri açısından test eder ve düzeltme için yeniden üretilebilir bulguları kaydeder.
Sınırlılıklar
Test edilen durumlar ve yöntemler, çalışmanın test edilmemiş koşullar hakkında gösterebileceklerini sınırlar.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1Red Teaming Language Models with Language Models
- Kaynak
- Red Teaming Language Models with Language Models
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract: human-written and model-generated tests for harmful behavior
- Desteklenen iddia
- Yayımlanmış kırmızı takım araştırmaları, dil modellerinin olası zararlı davranışlarını bulmak için insanlarca veya modellerle üretilmiş saldırgan test durumlarını kullanır.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Atıf yapılan çalışmalar dil modellerini ele alır ve yöntemsel belirsizliği belgeler.
1.2Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned
- Kaynak
- Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract: discover, measure and attempt to reduce harmful outputs; uncertainty about red teaming
- Desteklenen iddia
- Yayımlanmış kırmızı takım araştırmaları, dil modellerinin olası zararlı davranışlarını bulmak için insanlarca veya modellerle üretilmiş saldırgan test durumlarını kullanır.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Atıf yapılan çalışmalar dil modellerini ele alır ve yöntemsel belirsizliği belgeler.