Langsung ke konten

Arsip

Arsitektur Model

4 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

SwiGLU Mengendalikan Kanal Feed-Forward Transformer dengan Proyeksi Kedua

SwiGLU membagi input feed-forward transformer ke dua jalur proyeksi, menerapkan SiLU pada satu jalur, lalu mengalikan kedua hasil secara elemen per elemen. Proyeksi kedua bukan statistik tambahan: nilainya langsung mengendalikan jalur yang sudah diaktivasi sebelum proyeksi output. Untuk hidden state x, bentuk struktural yang umum adalah: g = SiLU(x W_gate) u = x W_up h = g * u y = h W_down Bias, orientasi proyeksi, lebar intermediate, dan nama parameter dapat berbeda antar arsitektur. Batas yang mendefinisikan operasi ini adalah perkalian elemen per elemen antara cabang proyeksi nonlinear dan cabang proyeksi lainnya.

Kecerdasan Buatan 24 Sep 2026 5 min read

Sliding-Window Attention Membatasi Setiap Query pada Horizon Token Lokal

Sebuah layer causal attention tidak harus membuka seluruh token sebelumnya untuk setiap query. Dengan sliding window selebar w, query pada posisi i dapat dibatasi ke posisi-posisi terbaru alih-alih seluruh prefix. Graf attention menjadi lokal: token lama keluar dari kumpulan koneksi langsung meskipun token tersebut tetap berada di dalam sequence. Batas ini mengubah komputasi, lalu lintas memori, dan jalur informasi sekaligus. Sliding-window attention bukan sekadar implementasi full attention yang lebih efisien. Ketika mask membuang pasangan key-value yang jauh, layer menjalankan pola dependensi yang berbeda.

Kecerdasan Buatan 24 Sep 2026 4 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menormalisasi vektor hidden state tanpa mengurangi mean koordinatnya. Satu perbedaan ini memisahkannya dari LayerNorm pada antarmuka matematis: RMSNorm mengendalikan skala melalui statistik root mean square, sedangkan offset yang sama pada seluruh koordinat tetap menjadi bagian dari representasi yang ditransformasikan. Untuk vektor x dengan lebar D, salah satu bentuk umum RMSNorm adalah: rms(x) = sqrt(mean(x_i^2) + eps) y_i = g_i * x_i / rms(x) Di sini g_i adalah skala per koordinat yang dapat dilatih dan eps adalah nilai positif kecil yang ditentukan implementasi model. Parameterisasi dan detail numerik yang tepat merupakan bagian dari kontrak checkpoint dan runtime.

Kecerdasan Buatan 24 Sep 2026 5 min read

Kapasitas Expert MoE Membatasi Routing Token

Layer Mixture-of-Experts yang sparse dapat memiliki banyak jaringan expert sambil hanya mengaktifkan sebagian kecil untuk setiap token. Conditional computation ini bergantung pada router, tetapi skor router saja tidak menentukan graph yang benar-benar dieksekusi. Pada implementasi dengan batch expert terbatas, setiap expert juga memiliki jumlah slot token yang terbatas. Kondisi ini menambahkan batas kedua setelah pemilihan expert: sebuah token dapat memilih expert yang sudah tidak memiliki kapasitas. Penanganan overflow tersebut merupakan keputusan implementasi dan arsitektur yang berdampak langsung pada training dan serving.