Sözlüğe dön

Metrik

Metric

D4

Metrik, bir sistemi veya çıktısını değerlendirmek için belirtilmiş bir ölçütü işler hâle getirir.

İnceleme durumu: 2027-08-28

Teknik açıklama

Metrik, belirtilmiş bir ölçütü işler hâle getirir; seçimi ve yorumlanması bağlamı dışarıda bırakabilir, manipüle edilebilir veya grup farklılıklarını gizleyebilir.

Kavramsal sınırlar

Metrik, senaryoları ve uyarlamaları da belirleyebilen değerlendirme düzeninin bir bileşenidir.

Sağlayıcıdan bağımsız örnek

Yönlendirme görevinde bir ekip, doğru kuyruğa gönderilen taleplerin oranını hesaplayabilir ve bu hesabın hangi talep türlerini gizlediğini inceleyebilir.

Sınırlılıklar

Metrikler aşırı basitleştirilebilir, manipüle edilebilir veya etkilenen gruplar ve bağlamlarla zayıf uyum gösterebilir.

İlişkili kavramlar

Atomik iddialar ve kanıt

  1. 1.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak
    NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Section 1.2.1, "Availability of reliable metrics," printed p. 6
    Desteklenen iddia
    NIST, sağlam ve doğrulanabilir ölçüm yöntemleri konusunda uzlaşma eksikliğini ve kullanım senaryoları arasındaki farklılıkları yapay zekâ risk ölçümünde zorluk olarak tanımlar.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, metriklerin kullanılamaz olduğu anlamına gelmez; yeterliliklerinin bağlam içinde ele alınması gerektiği anlamına gelir.
  2. 2.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak
    NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Section 1.2.1, "Availability of reliable metrics," printed p. 6
    Desteklenen iddia
    NIST, ölçüm yaklaşımlarının aşırı basitleştirilebileceği, manipüle edilebileceği, beklenmedik biçimde kullanılabileceği veya gruplar ile bağlamlar arasındaki farkları hesaba katmayabileceği konusunda uyarır.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, yorumlama ve tasarım hakkında bir uyarıdır; her metriğin yanıltıcı olduğu iddiası değildir.
  3. 3.1Liang et al., Holistic Evaluation of Language Models
    Kaynak
    Liang et al., Holistic Evaluation of Language Models
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Sections 2.3-2.4: desiderata, scenarios, adaptations, and metrics
    Desteklenen iddia
    HELM, metrikleri istenen özelliklerin işler hâle getirilmesi olarak ele alır ve değerlendirme çalıştırmalarını senaryolar, uyarlamalar ve metriklerle yapılandırır.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, HELM'in değerlendirme çerçevesini açıklar; her sistem için tek bir metrik kümesi öngörmez.