Uzmanlar karışımı (MoE)
Mixture of experts (MoE)
D2 · Üretken YZ, yetenekler ve sınırlar
Uzmanlar karışımı mimarisi, girdileri uzman bileşenlere yönlendirir ve bu bileşenlerin katkılarını birleştirir veya seçer.
İnceleme durumu: 2026-12-05
Teknik açıklama
Seyrek dil modeli uygulamalarında bir token için yalnızca bazı uzmanlar etkinleşir; böylece toplam parametrelerle etkin parametreler ayrılır.
Kavramsal sınırlar
Uzmanlar model bileşenleridir; zorunlu olarak ayrı ajanlar veya insanlarca tanımlanmış konu uzmanları değildir.
Sağlayıcıdan bağımsız örnek
Örnek: Yönlendirici, model işlemeye devam etmeden önce her tokenı seçilen sinir ağı bileşenlerine gönderir.
Sınırlılıklar
Seyrek etkinleşme, etkin hesaplamayı azaltabilir; toplam ve etkin parametre sayıları farklı olabilir; yönlendirme ve iletişim ödünleşimler getirir.
İlişkili kavramlar
Atomik iddialar ve kanıt
1.1Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
- Kaynak
- Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract: selecting parameters for incoming examples, routing and training instability
- Desteklenen iddia
- Switch Transformers, seyrek uzman yönlendirmesini açıklar; iletişim maliyetlerini ve eğitim kararsızlığını ele alır.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- Bu, seyrek MoE’yi açıklar; her karışım modeli için gereklilik değildir.
2.1Mixtral of Experts
- Kaynak
- Mixtral of Experts
- Kaynak rolü
- Yetkili kaynak
- Tam konum
- Abstract: router selects two experts for each token; total and active parameters
- Desteklenen iddia
- Mixtral, her katmanda token başına iki uzman seçer; toplam parametrelerle etkin parametreleri ayırır.
- Son doğrulama
- Gözden geçirme tarihi
- Kapsam sınırlaması
- İki uzman, Mixtral’ın tasarım tercihidir; evrensel MoE sayısı değildir.