Sözlüğe dön

Uzmanlar karışımı (MoE)

Mixture of experts (MoE)

D2 · Üretken YZ, yetenekler ve sınırlar

Uzmanlar karışımı mimarisi, girdileri uzman bileşenlere yönlendirir ve bu bileşenlerin katkılarını birleştirir veya seçer.

İnceleme durumu: 2026-12-05

Teknik açıklama

Seyrek dil modeli uygulamalarında bir token için yalnızca bazı uzmanlar etkinleşir; böylece toplam parametrelerle etkin parametreler ayrılır.

Kavramsal sınırlar

Uzmanlar model bileşenleridir; zorunlu olarak ayrı ajanlar veya insanlarca tanımlanmış konu uzmanları değildir.

Sağlayıcıdan bağımsız örnek

Örnek: Yönlendirici, model işlemeye devam etmeden önce her tokenı seçilen sinir ağı bileşenlerine gönderir.

Sınırlılıklar

Seyrek etkinleşme, etkin hesaplamayı azaltabilir; toplam ve etkin parametre sayıları farklı olabilir; yönlendirme ve iletişim ödünleşimler getirir.

İlişkili kavramlar

Atomik iddialar ve kanıt

  1. 1.1Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
    Kaynak
    Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Abstract: selecting parameters for incoming examples, routing and training instability
    Desteklenen iddia
    Switch Transformers, seyrek uzman yönlendirmesini açıklar; iletişim maliyetlerini ve eğitim kararsızlığını ele alır.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    Bu, seyrek MoE’yi açıklar; her karışım modeli için gereklilik değildir.
  2. 2.1Mixtral of Experts
    Kaynak
    Mixtral of Experts
    Kaynak rolü
    Yetkili kaynak
    Tam konum
    Abstract: router selects two experts for each token; total and active parameters
    Desteklenen iddia
    Mixtral, her katmanda token başına iki uzman seçer; toplam parametrelerle etkin parametreleri ayırır.
    Son doğrulama
    Gözden geçirme tarihi
    Kapsam sınırlaması
    İki uzman, Mixtral’ın tasarım tercihidir; evrensel MoE sayısı değildir.