Metrik
Metric
D4
Metrik, bir sistemi veya çıktısını değerlendirmek için belirtilmiş bir ölçütü işler hâle getirir.
İnceleme durumu: 2027-08-28
Teknik açıklama
Metrik, belirtilmiş bir ölçütü işler hâle getirir; seçimi ve yorumlanması bağlamı dışarıda bırakabilir, manipüle edilebilir veya grup farklılıklarını gizleyebilir.
Kavramsal sınırlar
Metrik, senaryoları ve uyarlamaları da belirleyebilen değerlendirme düzeninin bir bileşenidir.
Sağlayıcıdan bağımsız örnek
Yönlendirme görevinde bir ekip, doğru kuyruğa gönderilen taleplerin oranını hesaplayabilir ve bu hesabın hangi talep türlerini gizlediğini inceleyebilir.
Sınırlılıklar
Metrikler aşırı basitleştirilebilir, manipüle edilebilir veya etkilenen gruplar ve bağlamlarla zayıf uyum gösterebilir.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak
- NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Section 1.2.1, "Availability of reliable metrics," printed p. 6
- Desteklenen iddia
- NIST, sağlam ve doğrulanabilir ölçüm yöntemleri konusunda uzlaşma eksikliğini ve kullanım senaryoları arasındaki farklılıkları yapay zekâ risk ölçümünde zorluk olarak tanımlar.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, metriklerin kullanılamaz olduğu anlamına gelmez; yeterliliklerinin bağlam içinde ele alınması gerektiği anlamına gelir.
2.1NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak
- NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0) — D4 evidence slice
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Section 1.2.1, "Availability of reliable metrics," printed p. 6
- Desteklenen iddia
- NIST, ölçüm yaklaşımlarının aşırı basitleştirilebileceği, manipüle edilebileceği, beklenmedik biçimde kullanılabileceği veya gruplar ile bağlamlar arasındaki farkları hesaba katmayabileceği konusunda uyarır.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, yorumlama ve tasarım hakkında bir uyarıdır; her metriğin yanıltıcı olduğu iddiası değildir.
3.1Liang et al., Holistic Evaluation of Language Models
- Kaynak
- Liang et al., Holistic Evaluation of Language Models
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Sections 2.3-2.4: desiderata, scenarios, adaptations, and metrics
- Desteklenen iddia
- HELM, metrikleri istenen özelliklerin işler hâle getirilmesi olarak ele alır ve değerlendirme çalıştırmalarını senaryolar, uyarlamalar ve metriklerle yapılandırır.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, HELM'in değerlendirme çerçevesini açıklar; her sistem için tek bir metrik kümesi öngörmez.