Kecerdasan Buatan
24 Sep 2026
5 min read
RMSNorm Menskalakan Hidden State Tanpa Mean Centering
RMSNorm menskalakan vektor berdasarkan root mean square tanpa lebih dulu mengurangi nilai rata-rata vektor tersebut. Ketiadaan mean centering ini menjadi perbedaan utama terhadap LayerNorm: keduanya dapat mengendalikan skala vektor, tetapi hanya LayerNorm yang secara eksplisit menggeser koordinat agar rata-rata sampelnya berada di nol. Untuk hidden vector x dengan lebar d, bentuk RMSNorm yang umum adalah: rms = sqrt((1/d) * sum(x_i^2) + epsilon) y_i = gain_i * x_i / rms Posisi epsilon, presisi numerik saat reduksi, dan keberadaan affine term tambahan dapat berbeda antar-implementasi. Struktur utamanya tetap berupa pembagian dengan statistik RMS, bukan standard deviation yang dihitung setelah mean dikurangi.