Sebuah sparse layer bergaya Switch dapat mengarahkan banyak token ke expert yang sama meskipun setiap expert memiliki kapasitas komputasi identik. Router membuat pilihan per token dari skor yang dihasilkan model; mekanisme ini tidak dengan sendirinya menghasilkan pembagian yang rata. Kapasitas expert yang tetap kemudian menjadi batas tegas antara preferensi routing dan jumlah komputasi expert yang diterima untuk sebuah batch.
Dalam formulasi Switch Transformer, setiap token diarahkan ke expert dengan probabilitas router tertinggi. Setiap expert memperoleh kapasitas token tetap yang diturunkan dari jumlah token, jumlah expert, dan capacity factor. Saat assignment melampaui kapasitas tersebut, token berlebih mengalami overflow alih-alih memperbesar batch expert tanpa batas.
Top-1 routing membuat aktivasi bersifat sparse
Misalkan sebuah sparse layer memiliki E expert. Untuk representasi token x, router menghasilkan logit untuk seluruh expert lalu mengubahnya menjadi probabilitas:
p = softmax(W_r x)
e* = argmax_e p_eExpert terpilih e* memproses token tersebut. Pilihan top-1 ini berbeda dari feed-forward layer dense yang memakai set parameter sama untuk setiap token. Model dapat menyimpan banyak set parameter expert sambil mengaktifkan hanya satu expert untuk satu token pada layer ini.
Aktivasi sparse tidak berarti aktivasi seimbang. Dua token dapat memilih expert yang sama, dan satu batch dapat menghasilkan distribusi assignment yang timpang. Probabilitas router menyatakan preferensi model, bukan jaminan penjadwalan.
Kapasitas expert membatasi token yang diterima setiap expert
Definisi kapasitas Switch yang umum adalah
C = (T / E) * capacity_factordengan T sebagai jumlah token yang dirutekan dan E sebagai jumlah expert. Implementasi konkret perlu memetakan nilai ini ke kapasitas integer sesuai aturan bentuk tensor yang dipakai.
Capacity factor 1.0 menyediakan kapasitas yang sesuai dengan pembagian token secara rata. Nilai di atas 1.0 menambahkan buffer untuk ketimpangan routing. Slot tambahan mengurangi risiko overflow, tetapi dapat menambah padding, komputasi, dan komunikasi yang terkait dengan batch expert.
Kapasitas merupakan properti pengaturan eksekusi, bukan aturan yang memaksa router memilih setiap expert tepat T / E kali. Router tetap dapat memilih satu expert untuk lebih dari C token.
Overflow muncul saat preferensi melampaui kapasitas
Ambil T = 12 token, E = 3 expert, dan capacity factor 1.0. Kapasitas setiap expert adalah:
C = (12 / 3) * 1.0 = 4Misalkan top-1 routing menghasilkan jumlah assignment berikut:
expert 0: 7 token
expert 1: 3 token
expert 2: 2 tokenExpert 0 memiliki tiga assignment di atas kapasitas empat token, walaupun masih ada lima slot kosong pada expert 1 dan 2. Kapasitas tetap per expert tidak otomatis memindahkan slot kosong tersebut ke expert yang kelebihan beban.
Pada desain Switch Transformer, token overflow tidak diproses oleh expert terpilih pada sparse layer tersebut. Perilaku ini spesifik untuk desain routing itu; sistem mixture-of-experts lain dapat memakai kebijakan overflow, aturan rerouting, beberapa expert terpilih, atau skema kapasitas dinamis yang berbeda.
Capacity factor menukar overflow dengan ruang kerja cadangan
Menaikkan capacity factor mengubah batas eksekusi tanpa mengubah aturan dasar pemilihan top-1. Dengan contoh 12 token dan 3 expert yang sama, faktor 1.5 memberi kapasitas nominal enam token per expert:
C = (12 / 3) * 1.5 = 6Assignment tujuh token ke expert 0 masih melewati kapasitas, tetapi kini hanya satu token yang overflow. Sistem mencadangkan ruang batch expert lebih besar untuk menyerap ketimpangan.
Buffer tersebut memiliki biaya. Batch expert statis dapat berisi slot yang tidak dipakai ketika routing lebih seimbang daripada kapasitas yang dicadangkan. Pada eksekusi terdistribusi, kapasitas lebih besar juga dapat memperbesar perpindahan data untuk mengirim representasi token ke expert dan menggabungkan hasilnya. Kapasitas dengan demikian mengendalikan tradeoff sistem, bukan memberi jaminan kualitas model.
Tekanan penyeimbangan router terpisah dari kapasitas keras
Training Switch Transformer memakai objective load balancing tambahan untuk mendorong distribusi routing antar-expert. Objective tersebut mengubah tekanan optimisasi pada router; mekanisme itu tidak menggantikan batas kapasitas tetap.
Pemisahan ini penting karena tekanan optimisasi yang lunak dan batas eksekusi yang keras bekerja pada tahap berbeda. Objective penyeimbang dapat membuat ketimpangan berat menjadi kurang menarik selama training, sedangkan kapasitas tetap menentukan apa yang terjadi saat assignment aktual pada batch tertentu tidak seimbang.
Routing sparse tidak memerlukan keseimbangan sempurna, dan objective tambahan tidak dapat menjamin jumlah token identik pada setiap expert untuk setiap batch. Kapasitas tetap dibutuhkan pada implementasi yang memerlukan bentuk tensor expert atau beban per-expert yang terbatas.
Jumlah token dan grup routing menentukan perhitungan kapasitas
Simbol T memerlukan definisi pada tingkat implementasi. Sistem terdistribusi dapat melakukan routing token dalam grup lokal, bukan pada seluruh token dari global batch. Dalam kondisi itu, kapasitas dihitung untuk grup routing yang dipakai implementasi dan ketimpangan diamati di dalam batas tersebut.
Perbedaan ini memengaruhi overflow sekaligus utilisasi. Dua sistem dengan global batch size, jumlah expert, dan capacity factor nominal yang sama dapat menghadapi kondisi routing efektif berbeda jika grup dispatch-nya berbeda.
Padding token juga perlu diperlakukan secara eksplisit. Token yang dikecualikan dari routing tidak semestinya diam-diam dihitung sebagai workload biasa kecuali implementasi memang menetapkannya demikian. Persamaan kapasitas hanya bermakna ketika populasi tokennya sesuai dengan semantik dispatch aktual.
Parameter sparse tidak membuat routing tanpa biaya
Top-1 routing mengurangi jumlah expert yang aktif per token, tetapi sparse layer tetap memiliki komputasi router, dispatch token, eksekusi expert, dan penggabungan hasil. Ketika expert berada pada perangkat berbeda, operasi dispatch dan combine dapat sensitif terhadap biaya komunikasi.
Kapasitas expert memberi bentuk terbatas pada operasi tersebut dalam desain Switch. Kapasitas juga menampilkan ketimpangan sebagai kejadian yang dapat diukur: overflow menandakan permintaan router terhadap suatu expert melampaui ruang yang dicadangkan untuk expert tersebut.
Batas teknisnya jelas. Top-1 routing menentukan expert yang dipilih, capacity factor menentukan ruang per-expert yang dicadangkan, dan overflow menangani assignment yang melewati ruang itu. Tekanan load balancing dapat memengaruhi distribusi assignment, tetapi tidak menghapus batas kapasitas.