Kapasitas Expert Mengubah Routing MoE yang Timpang Menjadi Token Overflow
Layer Mixture-of-Experts yang sparse dapat mengarahkan banyak token ke expert yang sama walaupun setiap expert memiliki kapasitas nominal identik. Router membuat pilihan berdasarkan token, sedangkan eksekusi terdistribusi lazimnya menyediakan slot token yang terbatas untuk setiap expert. Ketika dua mekanisme itu tidak selaras, jumlah assignment dapat melampaui buffer eksekusi expert. Batas tersebut bukan sifat bawaan seluruh arsitektur MoE. Batas itu muncul pada desain routing dengan kapasitas terbatas, termasuk formulasi routing pada Switch Transformers. Pada sistem semacam ini, kapasitas expert mengubah distribusi routing yang timpang menjadi kondisi operasional: sebagian assignment masuk ke slot yang tersedia, sedangkan sisanya harus mengikuti kebijakan overflow yang eksplisit.