İnsan değerlendirmesi
Human evaluation
D4
İnsan değerlendirmesi, bir sistemin veya çıktılarının belirtilmiş görev ve protokol altında insanlarca yapılandırılmış yargılanmasıdır.
İnceleme durumu: 2026-11-26
Teknik açıklama
Değerlendiriciler, yargıların ve bunlardaki değişkenliğin kaydedilebilmesi için anotasyon yönergeleri, derecelendirme ölçekleri ve birden çok anotatör kullanabilir.
Kavramsal sınırlar
İnsan değerlendirmesi kayda geçirilmemiş görüş değildir; kendiliğinden anlaşmazlıktan arınmış da değildir.
Sağlayıcıdan bağımsız örnek
İki inceleyici, üzerinde anlaşılmış bir derecelendirme anahtarıyla üretilmiş özetin gerekli olguları koruyup korumadığını bağımsız biçimde yargılayabilir; ardından uyumu ve çözülemeyen durumları kaydedebilir.
Sınırlılıklar
İnsan anotasyonu belirsizlik ve anlaşmazlık içerebilir; bu nedenle protokol değişkenliği gizlemek yerine kaydetmelidir.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1NIST AI 600-1, Generative Artificial Intelligence Profile — D4 evidence slice
- Kaynak
- NIST AI 600-1, Generative Artificial Intelligence Profile — D4 evidence slice
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- MAP 2.3 action text, printed p. 27
- Desteklenen iddia
- NIST, bilgi bütünlüğünü değerlendirirken kullanılabilecek çeşitli yöntemler arasında insan gözetimini ve otomatik değerlendirmeyi sayar.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Kaynak, insan gözetimini tek bir derecelendirme yöntemiyle eşitlemez veya insanlar arasında uzlaşıyı garanti etmez.
2.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak
- NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Section 3, printed p. 12
- Desteklenen iddia
- NIST, güvenilir yapay zekâ nitelikleri için metrikler ve bunların eşik değerleri seçilirken insan yargısının kullanılması gerektiğini belirtir.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, süreçte insan yargısının açık biçimde kullanılmasını destekler; insan yargısının nesnel olduğunu göstermez.
3.1Liang et al., Holistic Evaluation of Language Models
- Kaynak
- Liang et al., Holistic Evaluation of Language Models
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Section 8.5.1: annotation guidelines, rating scales, and multiple annotators
- Desteklenen iddia
- HELM, insan değerlendirmesi uygulamalarını anotasyon yönergeleri, derecelendirme ölçekleri ve birden çok anotatör kullanımıyla açıklar.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, bildirilen değerlendirme uygulamalarını açıklar; her görev için tek bir protokol öngörmez.
4.1Aroyo and Welty, Truth Is a Lie: Crowd Truth and the Seven Myths of Human Annotation
- Kaynak
- Aroyo and Welty, Truth Is a Lie: Crowd Truth and the Seven Myths of Human Annotation
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract; "The Seven Myths" and "Disagreement Is Bad," printed pp. 16-17
- Desteklenen iddia
- Aroyo ve Welty, belirsizliği ve anlaşmazlığı insan anotasyonunun bilgi taşıyan özellikleri olarak açıklar.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, her anlaşmazlığın arzu edilir olduğunu veya insan değerlendirmesinin kullanılabilir sonucu olmadığını söylemez.