Nicemleme
Quantization
D2 · Üretken YZ, yetenekler ve sınırlar
Model sıkıştırmada nicemleme, model değerlerini daha az bitle veya daha sınırlı bir sayısal değer kümesiyle temsil etmektir.
İnceleme durumu: 2026-12-05
Teknik açıklama
Ağırlık nicemlemesi, parametreleri saklamak için gereken belleği azaltabilir; GPTQ, eğitim sonrası kullanılan yöntemlerden biridir.
Kavramsal sınırlar
Ağırlık başına daha az bit, daha az parametreden farklıdır. Bu madde model değerlerini ele alır; veri işlemedeki her nicemleme kullanımını kapsamaz.
Sağlayıcıdan bağımsız örnek
Örnek: Mühendis, daha düşük bitli modeli özgün sürümüyle aynı görev ve cihaz üzerinde karşılaştırır.
Sınırlılıklar
Doğruluk düşebilir; yalnızca sıkıştırma, belirli bir cihazdaki gecikmeyi veya kaliteyi ortaya koymaz.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1Google Machine Learning Glossary: quantization
- Kaynak
- Google Machine Learning Glossary: quantization
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- quantization: reducing bits for parameters; possible decrease in prediction correctness
- Desteklenen iddia
- Google, model nicemlemesini parametreler için kullanılan bitleri azaltma olarak açıklar ve tahmin doğruluğunda olası kayıplara dikkat çeker.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Çok anlamlı terimin parametre sıkıştırma anlamı kullanılır.
2.1GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- Kaynak
- GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract: weight quantization to 3 or 4 bits and evaluated compression results
- Desteklenen iddia
- GPTQ, düşük bit genişliklerinde eğitim sonrası ağırlık nicemlemesini değerlendirir.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Ölçülen sonuçları her modele veya donanım yapılandırmasına otomatik olarak uygulanmaz.