Sözlüğe dön

Kıyaslama testi

Benchmark

D4

Kıyaslama testi, görevleri veya veriyi, bir protokolü ve bir ya da daha fazla metriği birleştiren tanımlı karşılaştırmalı değerlendirme düzenidir.

İnceleme durumu: 2027-08-28

Teknik açıklama

İnsanların belirtilmiş görevler ve puanlama koşulları altında sonuçları karşılaştırmasını sağlar.

Kavramsal sınırlar

Kıyaslama testi tek bir metrik değildir; sonuçları her operasyonel ortamı değil, belirtilmiş düzeni betimler.

Sağlayıcıdan bağımsız örnek

Birden çok ekip, aynı sürümlenmiş sınıflandırma görevlerini aynı puanlama kurallarıyla çalıştırabilir ve bildirdikleri sonuçları görev sınırlamalarıyla birlikte karşılaştırabilir.

Sınırlılıklar

Performans tek tek görevler arasında anlamlı ölçüde değişebilir; laboratuvar ölçümleri operasyonel ortamlardaki risklerden farklı olabilir.

İlişkili kavramlar

Atomik iddialar ve kanıt

  1. 1.1Hendrycks et al., Measuring Massive Multitask Language Understanding
    Kaynak
    Hendrycks et al., Measuring Massive Multitask Language Understanding
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Abstract: 57-task test, task-level results, and shortcomings
    Desteklenen iddia
    MMLU çalışması, metin modellerinin çok görevli doğruluğunu karşılaştırmak için 57 görevli bir test sunar ve model performansındaki görev düzeyi farklılıkları bildirir.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, bir kıyaslama testini ve sonuçlarını açıklar; evrensel bir kıyaslama testi tasarımı ortaya koymaz.
  2. 2.1Liang et al., Holistic Evaluation of Language Models
    Kaynak
    Liang et al., Holistic Evaluation of Language Models
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Abstract; Sections 2.3-2.4: scenarios, metrics, and adaptations
    Desteklenen iddia
    HELM, değerlendirmeyi tek bir puandan ziyade senaryolar, metrikler ve uyarlamalar uzayı olarak tanımlar.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, araştırma çerçevesinin sınıflandırmasıdır ve her kıyaslama testinin tüm olası senaryoları kapsamasını gerektirmez.
  3. 3.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak
    NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Section 1.2.1, Risk in real-world settings, printed p. 6
    Desteklenen iddia
    NIST, laboratuvar ölçümlerinin operasyonel ortamlarda ortaya çıkan risklerden farklı olabileceğini belirtir.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, kıyaslama testi kanıtını yararsız kılmaz; sonraki çalışma hakkında ne gösterebileceğini sınırlar.