Langsung ke konten

Arsip

Normalisasi

6 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

RMSNorm Menskalakan Hidden State Tanpa Mean Centering

RMSNorm menormalisasi vektor hidden state tanpa mengurangi mean koordinatnya. Satu perbedaan ini memisahkannya dari LayerNorm pada antarmuka matematis: RMSNorm mengendalikan skala melalui statistik root mean square, sedangkan offset yang sama pada seluruh koordinat tetap menjadi bagian dari representasi yang ditransformasikan. Untuk vektor x dengan lebar D, salah satu bentuk umum RMSNorm adalah: rms(x) = sqrt(mean(x_i^2) + eps) y_i = g_i * x_i / rms(x) Di sini g_i adalah skala per koordinat yang dapat dilatih dan eps adalah nilai positif kecil yang ditentukan implementasi model. Parameterisasi dan detail numerik yang tepat merupakan bagian dari kontrak checkpoint dan runtime.

Kecerdasan Buatan 24 Sep 2026 4 min read

QK Normalization Membatasi Skala Logit Attention Sebelum Softmax

QK normalization menempatkan normalisasi pada vektor query dan key sebelum dot product attention. Operasi ini mengubah geometri perhitungan skor: magnitudo vektor tidak lagi masuk ke dot product dalam bentuk mentah yang sama, sementara keselarasan arah tetap menjadi bagian dari skor. Untuk satu vektor query q dan key k, scaled dot-product attention biasa membentuk skor seperti: s = dot(q, k) / sqrt(D) Varian dengan QK normalization lebih dulu menjalankan fungsi normalisasi yang ditetapkan model:

Kecerdasan Buatan 23 Sep 2026 4 min read

RMSNorm Menskalakan Aktivasi Tanpa Memusatkan Mean

RMSNorm menskalakan hidden vector memakai magnitudo root-mean-square, tetapi tidak lebih dulu mengurangi mean antarfitur dari vector tersebut. Perbedaan ini bukan sekadar bentuk LayerNorm dengan ekspresi yang lebih pendek. Transformasi input yang hilang akibat normalisasi juga berbeda, begitu pula informasi yang tetap terlihat oleh operasi berikutnya. Pada implementasi transformer, batas ini berkaitan langsung dengan hubungan antara residual state, normalisasi, dan proyeksi sesudahnya. Denominator berasal dari momen kedua mentah Untuk hidden vector (x \in \mathbb{R}^d), salah satu bentuk RMSNorm yang umum adalah

Kecerdasan Buatan 23 Sep 2026 5 min read

RMSNorm Mengatur Skala Aktivasi Tanpa Memusatkan Mean

RMSNorm menormalisasi vektor menggunakan root mean square, bukan standard deviation setelah centering. Perbedaan kecil ini menghilangkan pengurangan mean dari tahap normalisasi. Akibatnya, RMSNorm dan LayerNorm dapat merespons perubahan skala dengan pola serupa pada kondisi tertentu, tetapi memberi respons berbeda terhadap pergeseran aditif pada hidden state. Perbedaan tersebut relevan pada implementasi transformer karena normalisasi menjadi bagian dari geometri residual path. Mengganti satu aturan normalisasi dengan aturan lain bukan sekadar mengganti rangkaian operasi aritmetika; pergantian itu mengubah transformasi aktivasi yang dibatalkan dan informasi yang tetap diteruskan ke komputasi berikutnya.

Kecerdasan Buatan 14 Sep 2026 5 min read

Perbandingan RMSNorm dan Layer Normalization

Layer normalisasi dapat terlihat saling menggantikan ketika bentuk output-nya serupa, tetapi invariansinya tidak sama. RMSNorm menskalakan ulang vektor aktivasi menggunakan root mean square tanpa terlebih dahulu mengurangi nilai rata-rata vektor. Layer normalization melakukan centering pada vektor, lalu menskalakannya menggunakan varians. Tidak adanya operasi centering merupakan perbedaan utamanya. Hal ini mengubah transformasi mana pada vektor aktivasi yang hilang setelah normalisasi dan mana yang tetap terlihat oleh bagian jaringan berikutnya. Kedua operasi menormalisasi besaran yang berbeda Untuk vektor aktivasi x dengan d komponen, LayerNorm menghitung mean dan varians pada dimensi yang dinormalisasi:

Kecerdasan Buatan 13 Sep 2026 6 min read

Perbandingan RMSNorm dan LayerNorm pada Transformer

LayerNorm dan RMSNorm dapat menempati posisi struktural yang sama pada transformer sambil menerapkan operasi berbeda pada residual stream. LayerNorm mengurangi feature mean sebelum melakukan scaling berdasarkan ukuran penyebaran. RMSNorm melewati operasi centering dan melakukan scaling langsung dari root mean square feature. Perbedaan aljabar kecil tersebut mengubah transformasi mana pada vektor aktivasi yang dihapus oleh normalisasi. Artinya, mengganti satu operasi dengan yang lain secara umum bukan edit yang mempertahankan fungsi model yang sudah ada.