Langsung ke konten

Arsip

Inferensi

2 artikel
Kecerdasan Buatan 13 Sep 2026 8 min read

Menyeimbangkan Routing Sparse Mixture-of-Experts di Bawah Batas Kapasitas

Layer sparse mixture-of-experts tidak mengirim setiap token melalui setiap blok parameter. Router memberi skor pada expert yang tersedia, memilih subset kecil untuk setiap token, lalu melakukan dispatch representasi token hanya ke expert terpilih. Conditional computation ini menjadi daya tarik utama desain sparse MoE, tetapi sekaligus menciptakan masalah alokasi sumber daya di dalam model. Router dapat memilih expert yang sama untuk banyak token. Hardware, sementara itu, memiliki buffer dan kapasitas komunikasi yang terbatas. Kebijakan routing yang tampak masuk akal dari skor token saja dapat menghasilkan expert yang overload, expert yang menganggur, komunikasi tidak merata, atau assignment yang dibuang.

Kecerdasan Buatan 06 Sep 2026 9 min read

Percepat Generasi LLM dengan Speculative Decoding

Model bahasa autoregresif menghasilkan teks satu token demi satu token. Meski accelerator memiliki komputasi paralel yang besar, model biasanya tidak dapat menentukan token ke-12 sebelum token ke-11 diketahui. Ketergantungan ini membuat latensi generasi sulit dikurangi hanya dengan menambahkan lebih banyak hardware paralel. Speculative decoding mengatasi bottleneck ini dengan mengerjakan pekerjaan murah lebih dulu sebelum model yang mahal. Draft model yang lebih cepat mengusulkan beberapa token berikutnya. Target model lengkap kemudian mengevaluasi usulan tersebut bersama-sama dan menerima bagian yang konsisten dengan distribusinya sendiri. Dengan algoritma acceptance-and-correction yang tepat, cara komputasi generasi berubah tanpa mengubah distribusi yang didefinisikan target model.