Sözlüğe dön

İnsan değerlendirmesi

Human evaluation

D4

İnsan değerlendirmesi, bir sistemin veya çıktılarının belirtilmiş görev ve protokol altında insanlarca yapılandırılmış yargılanmasıdır.

İnceleme durumu: 2026-11-26

Teknik açıklama

Değerlendiriciler, yargıların ve bunlardaki değişkenliğin kaydedilebilmesi için anotasyon yönergeleri, derecelendirme ölçekleri ve birden çok anotatör kullanabilir.

Kavramsal sınırlar

İnsan değerlendirmesi kayda geçirilmemiş görüş değildir; kendiliğinden anlaşmazlıktan arınmış da değildir.

Sağlayıcıdan bağımsız örnek

İki inceleyici, üzerinde anlaşılmış bir derecelendirme anahtarıyla üretilmiş özetin gerekli olguları koruyup korumadığını bağımsız biçimde yargılayabilir; ardından uyumu ve çözülemeyen durumları kaydedebilir.

Sınırlılıklar

İnsan anotasyonu belirsizlik ve anlaşmazlık içerebilir; bu nedenle protokol değişkenliği gizlemek yerine kaydetmelidir.

İlişkili kavramlar

Atomik iddialar ve kanıt

  1. 1.1NIST AI 600-1, Generative Artificial Intelligence Profile — D4 evidence slice
    Kaynak
    NIST AI 600-1, Generative Artificial Intelligence Profile — D4 evidence slice
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    MAP 2.3 action text, printed p. 27
    Desteklenen iddia
    NIST, bilgi bütünlüğünü değerlendirirken kullanılabilecek çeşitli yöntemler arasında insan gözetimini ve otomatik değerlendirmeyi sayar.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Kaynak, insan gözetimini tek bir derecelendirme yöntemiyle eşitlemez veya insanlar arasında uzlaşıyı garanti etmez.
  2. 2.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak
    NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Section 3, printed p. 12
    Desteklenen iddia
    NIST, güvenilir yapay zekâ nitelikleri için metrikler ve bunların eşik değerleri seçilirken insan yargısının kullanılması gerektiğini belirtir.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, süreçte insan yargısının açık biçimde kullanılmasını destekler; insan yargısının nesnel olduğunu göstermez.
  3. 3.1Liang et al., Holistic Evaluation of Language Models
    Kaynak
    Liang et al., Holistic Evaluation of Language Models
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Section 8.5.1: annotation guidelines, rating scales, and multiple annotators
    Desteklenen iddia
    HELM, insan değerlendirmesi uygulamalarını anotasyon yönergeleri, derecelendirme ölçekleri ve birden çok anotatör kullanımıyla açıklar.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, bildirilen değerlendirme uygulamalarını açıklar; her görev için tek bir protokol öngörmez.
  4. 4.1Aroyo and Welty, Truth Is a Lie: Crowd Truth and the Seven Myths of Human Annotation
    Kaynak
    Aroyo and Welty, Truth Is a Lie: Crowd Truth and the Seven Myths of Human Annotation
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Abstract; "The Seven Myths" and "Disagreement Is Bad," printed pp. 16-17
    Desteklenen iddia
    Aroyo ve Welty, belirsizliği ve anlaşmazlığı insan anotasyonunun bilgi taşıyan özellikleri olarak açıklar.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, her anlaşmazlığın arzu edilir olduğunu veya insan değerlendirmesinin kullanılabilir sonucu olmadığını söylemez.