Kıyaslama testi
Benchmark
D4
Kıyaslama testi, görevleri veya veriyi, bir protokolü ve bir ya da daha fazla metriği birleştiren tanımlı karşılaştırmalı değerlendirme düzenidir.
İnceleme durumu: 2027-08-28
Teknik açıklama
İnsanların belirtilmiş görevler ve puanlama koşulları altında sonuçları karşılaştırmasını sağlar.
Kavramsal sınırlar
Kıyaslama testi tek bir metrik değildir; sonuçları her operasyonel ortamı değil, belirtilmiş düzeni betimler.
Sağlayıcıdan bağımsız örnek
Birden çok ekip, aynı sürümlenmiş sınıflandırma görevlerini aynı puanlama kurallarıyla çalıştırabilir ve bildirdikleri sonuçları görev sınırlamalarıyla birlikte karşılaştırabilir.
Sınırlılıklar
Performans tek tek görevler arasında anlamlı ölçüde değişebilir; laboratuvar ölçümleri operasyonel ortamlardaki risklerden farklı olabilir.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1Hendrycks et al., Measuring Massive Multitask Language Understanding
- Kaynak
- Hendrycks et al., Measuring Massive Multitask Language Understanding
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract: 57-task test, task-level results, and shortcomings
- Desteklenen iddia
- MMLU çalışması, metin modellerinin çok görevli doğruluğunu karşılaştırmak için 57 görevli bir test sunar ve model performansındaki görev düzeyi farklılıkları bildirir.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, bir kıyaslama testini ve sonuçlarını açıklar; evrensel bir kıyaslama testi tasarımı ortaya koymaz.
2.1Liang et al., Holistic Evaluation of Language Models
- Kaynak
- Liang et al., Holistic Evaluation of Language Models
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract; Sections 2.3-2.4: scenarios, metrics, and adaptations
- Desteklenen iddia
- HELM, değerlendirmeyi tek bir puandan ziyade senaryolar, metrikler ve uyarlamalar uzayı olarak tanımlar.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, araştırma çerçevesinin sınıflandırmasıdır ve her kıyaslama testinin tüm olası senaryoları kapsamasını gerektirmez.
3.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak
- NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Section 1.2.1, Risk in real-world settings, printed p. 6
- Desteklenen iddia
- NIST, laboratuvar ölçümlerinin operasyonel ortamlarda ortaya çıkan risklerden farklı olabileceğini belirtir.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, kıyaslama testi kanıtını yararsız kılmaz; sonraki çalışma hakkında ne gösterebileceğini sınırlar.