Koruma katmanı
Guardrail
D5
Koruma katmanı, belirli riskleri azaltmak için YZ sistemi girdisini, çıktısını, araç kullanımını veya eylemlerini sınırlayan, denetleyen ya da yönlendiren tanımlı kontroldür.
İnceleme durumu: 2026-12-04
Teknik açıklama
Koruma katmanları, belirtilen risk ve bağlam için seçilen girdi ve çıktı denetimlerini, özel işlev-aracı çağrısı etrafındaki denetimleri ve insan incelemesine yönlendirme kurallarını içerebilir.
Kavramsal sınırlar
Koruma katmanı güvenliğin, doğruluğun, yasal uyumun veya her saldırının önlenmesinin garantisi değildir; kapsadığı alan ve hata davranışı bağlam içinde değerlendirilmelidir.
Sağlayıcıdan bağımsız örnek
Yüksek etkili hesap değişikliğinden önce iş akışı yetkilendirme ister, önerilen eylemi izin listesine göre denetler, kararı kaydeder ve istisnaları insan inceleyiciye yönlendirir.
Sınırlılıklar
Kontroller aşılabilir, yanlış yapılandırılabilir, aşırı geniş veya aşırı kısıtlayıcı olabilir; bağımsız test ve izlenen operasyon gerekli olmaya devam eder.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- Kaynak
- NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Printed pp. 13-14: direct and indirect prompt injection and downstream consequences
- Desteklenen iddia
- NIST, doğrudan ve dolaylı istem enjeksiyonunu üretken YZ sistemlerinin amaçlanmayan biçimde davranmasına ve bağlı sistemlerde aşağı akış sonuçları oluşmasına yol açabilen riskler olarak tanımlar.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, bir risk sınıfını tanımlar; belirli bir koruma katmanının bunu önlediğinin garantisi değildir.
1.2OWASP GenAI Security Project, LLM01:2025 Prompt Injection
- Kaynak
- OWASP GenAI Security Project, LLM01:2025 Prompt Injection
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- LLM01:2025 Prompt Injection risk overview
- Desteklenen iddia
- NIST, doğrudan ve dolaylı istem enjeksiyonunu üretken YZ sistemlerinin amaçlanmayan biçimde davranmasına ve bağlı sistemlerde aşağı akış sonuçları oluşmasına yol açabilen riskler olarak tanımlar.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, bir risk sınıfını tanımlar; belirli bir koruma katmanının bunu önlediğinin garantisi değildir.
2.1OpenAI Agents SDK, Guardrails
- Kaynak
- OpenAI Agents SDK, Guardrails
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Overview and Workflow boundaries: input, output, and tool guardrails
- Desteklenen iddia
- OpenAI’ın Agents SDK’sı, girdi, çıktı ve araç koruma katmanlarını kullanıcı girdisi, nihai çıktı ve özel işlev-aracı çağrısı etrafındaki denetimler olarak belgeler.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu SDK’ye özgü kontrol davranışıdır; iş akışı sınırları ve kalan etkileri bunun genel güvenlik garantisi olmadığı anlamına gelir.
2.2OWASP Cheat Sheet Series, LLM Prompt Injection Prevention
- Kaynak
- OWASP Cheat Sheet Series, LLM Prompt Injection Prevention
- Kaynak rolü
- Tamamlayıcı kaynak
- Tam konum
- Agent-specific defenses: validate tool calls, least privilege, and human approval
- Desteklenen iddia
- OpenAI’ın Agents SDK’sı, girdi, çıktı ve araç koruma katmanlarını kullanıcı girdisi, nihai çıktı ve özel işlev-aracı çağrısı etrafındaki denetimler olarak belgeler.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu SDK’ye özgü kontrol davranışıdır; iş akışı sınırları ve kalan etkileri bunun genel güvenlik garantisi olmadığı anlamına gelir.
3.1NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- Kaynak
- NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Printed p. 27: known ground truth and varied evaluation methods
- Desteklenen iddia
- NIST, üretken YZ bilgi bütünlüğünü değerlendirirken bilinen temel gerçeğin ve insan gözetimi ile otomatik değerlendirme dahil çeşitli değerlendirme yöntemlerinin kullanılmasını önerir.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Değerlendirme yöntemleri belirsizliği azaltır ancak yayındaki sistemin her bağlamda güvenli veya doğru olacağını garanti etmez.