Sözlüğe dön

Koruma katmanı

Guardrail

D5

Koruma katmanı, belirli riskleri azaltmak için YZ sistemi girdisini, çıktısını, araç kullanımını veya eylemlerini sınırlayan, denetleyen ya da yönlendiren tanımlı kontroldür.

İnceleme durumu: 2026-12-04

Teknik açıklama

Koruma katmanları, belirtilen risk ve bağlam için seçilen girdi ve çıktı denetimlerini, özel işlev-aracı çağrısı etrafındaki denetimleri ve insan incelemesine yönlendirme kurallarını içerebilir.

Kavramsal sınırlar

Koruma katmanı güvenliğin, doğruluğun, yasal uyumun veya her saldırının önlenmesinin garantisi değildir; kapsadığı alan ve hata davranışı bağlam içinde değerlendirilmelidir.

Sağlayıcıdan bağımsız örnek

Yüksek etkili hesap değişikliğinden önce iş akışı yetkilendirme ister, önerilen eylemi izin listesine göre denetler, kararı kaydeder ve istisnaları insan inceleyiciye yönlendirir.

Sınırlılıklar

Kontroller aşılabilir, yanlış yapılandırılabilir, aşırı geniş veya aşırı kısıtlayıcı olabilir; bağımsız test ve izlenen operasyon gerekli olmaya devam eder.

İlişkili kavramlar

Atomik iddialar ve kanıt

  1. 1.1NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
    Kaynak
    NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Printed pp. 13-14: direct and indirect prompt injection and downstream consequences
    Desteklenen iddia
    NIST, doğrudan ve dolaylı istem enjeksiyonunu üretken YZ sistemlerinin amaçlanmayan biçimde davranmasına ve bağlı sistemlerde aşağı akış sonuçları oluşmasına yol açabilen riskler olarak tanımlar.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, bir risk sınıfını tanımlar; belirli bir koruma katmanının bunu önlediğinin garantisi değildir.
    1.2OWASP GenAI Security Project, LLM01:2025 Prompt Injection
    Kaynak
    OWASP GenAI Security Project, LLM01:2025 Prompt Injection
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    LLM01:2025 Prompt Injection risk overview
    Desteklenen iddia
    NIST, doğrudan ve dolaylı istem enjeksiyonunu üretken YZ sistemlerinin amaçlanmayan biçimde davranmasına ve bağlı sistemlerde aşağı akış sonuçları oluşmasına yol açabilen riskler olarak tanımlar.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, bir risk sınıfını tanımlar; belirli bir koruma katmanının bunu önlediğinin garantisi değildir.
  2. 2.1OpenAI Agents SDK, Guardrails
    Kaynak
    OpenAI Agents SDK, Guardrails
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Overview and Workflow boundaries: input, output, and tool guardrails
    Desteklenen iddia
    OpenAI’ın Agents SDK’sı, girdi, çıktı ve araç koruma katmanlarını kullanıcı girdisi, nihai çıktı ve özel işlev-aracı çağrısı etrafındaki denetimler olarak belgeler.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu SDK’ye özgü kontrol davranışıdır; iş akışı sınırları ve kalan etkileri bunun genel güvenlik garantisi olmadığı anlamına gelir.
    2.2OWASP Cheat Sheet Series, LLM Prompt Injection Prevention
    Kaynak
    OWASP Cheat Sheet Series, LLM Prompt Injection Prevention
    Kaynak rolü
    Tamamlayıcı kaynak
    Tam konum
    Agent-specific defenses: validate tool calls, least privilege, and human approval
    Desteklenen iddia
    OpenAI’ın Agents SDK’sı, girdi, çıktı ve araç koruma katmanlarını kullanıcı girdisi, nihai çıktı ve özel işlev-aracı çağrısı etrafındaki denetimler olarak belgeler.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu SDK’ye özgü kontrol davranışıdır; iş akışı sınırları ve kalan etkileri bunun genel güvenlik garantisi olmadığı anlamına gelir.
  3. 3.1NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
    Kaynak
    NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Printed p. 27: known ground truth and varied evaluation methods
    Desteklenen iddia
    NIST, üretken YZ bilgi bütünlüğünü değerlendirirken bilinen temel gerçeğin ve insan gözetimi ile otomatik değerlendirme dahil çeşitli değerlendirme yöntemlerinin kullanılmasını önerir.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Değerlendirme yöntemleri belirsizliği azaltır ancak yayındaki sistemin her bağlamda güvenli veya doğru olacağını garanti etmez.