RMSNorm menskalakan hidden vector memakai magnitudo root-mean-square, tetapi tidak lebih dulu mengurangi mean antarfitur dari vector tersebut. Perbedaan ini bukan sekadar bentuk LayerNorm dengan ekspresi yang lebih pendek. Transformasi input yang hilang akibat normalisasi juga berbeda, begitu pula informasi yang tetap terlihat oleh operasi berikutnya.

Pada implementasi transformer, batas ini berkaitan langsung dengan hubungan antara residual state, normalisasi, dan proyeksi sesudahnya.

Denominator berasal dari momen kedua mentah

Untuk hidden vector (x \in \mathbb{R}^d), salah satu bentuk RMSNorm yang umum adalah

[ r(x)=\sqrt{\frac{1}{d}\sum_{i=1}^{d}x_i^2+\epsilon}, ]

kemudian

[ y_i=g_i\frac{x_i}{r(x)}, ]

dengan (g_i) sebagai skala per fitur dan (\epsilon) sebagai parameter kecil pada perhitungan denominator.

Statistik di dalam akar adalah mean dari kuadrat nilai fitur. Besaran ini merupakan momen kedua mentah terhadap nol, bukan varians terhadap mean fitur. Jika mean fitur tidak nol, kedua besaran tersebut berbeda.

LayerNorm dalam bentuk standarnya lebih dulu menghitung mean fitur (\mu), lalu melakukan normalisasi berdasarkan deviasi (x_i-\mu) dan variansnya. RMSNorm mempertahankan offset fitur pada numerator dan mengukur magnitudo terhadap nol.

Perbedaan tersebut tetap berlaku ketika library tertentu menggabungkan operasi ini ke dalam fused kernel. Fusion dapat mengubah detail eksekusi tanpa mengubah statistik yang mendefinisikan RMSNorm.

Penskalaan seragam dihilangkan, pergeseran seragam tidak

Jika (\epsilon) diabaikan sementara, mengalikan semua fitur dengan skalar positif (a) tidak mengubah arah hasil normalisasi:

[ \frac{a x}{\operatorname{RMS}(a x)}

\frac{a x}{a\operatorname{RMS}(x)}

\frac{x}{\operatorname{RMS}(x)}. ]

Untuk skalar negatif, vector hasil normalisasi berubah tanda. Ketika (\epsilon) tidak nol, invariansi skala eksak tidak berlaku untuk sembarang magnitudo karena suku tambahan tersebut tidak ikut diskalakan dengan (a^2).

Menambahkan konstanta yang sama ke seluruh fitur memberi perilaku berbeda. Untuk (x’ = x + c\mathbf{1}), numerator dan statistik root-mean-square sama-sama berubah. RMSNorm tidak menghapus offset bersama tersebut.

LayerNorm standar memiliki sifat aljabar yang berbeda: pengurangan mean fitur menghapus pergeseran aditif seragam sebelum normalisasi varians. Perbedaan ini relevan saat menelaah offset pada residual stream. Mengganti satu normalisasi dengan yang lain karena itu merupakan perubahan arsitektur, bukan sekadar penggantian kernel.

Skala per fitur mengatur kembali amplitudo tiap koordinat

Setelah normalisasi, RMSNorm umumnya mengalikan setiap koordinat dengan parameter (g_i). Statistik normalisasi dipakai bersama dalam grup fitur yang dinormalisasi, sedangkan parameter skala dapat memberi amplitudo berbeda pada masing-masing koordinat.

Skala tersebut tidak merekonstruksi norm input. Ia menyediakan transformasi diagonal yang dapat dioptimalkan setelah normalisasi magnitudo bersama. Proyeksi linear berikutnya menerima vector dengan magnitudo RMS global yang telah dinormalisasi sesuai pengaruh (\epsilon), kemudian dibentuk per koordinat oleh parameter skala.

Sebagian API menyediakan pilihan tambahan seperti element type, normalized shape, atau nilai default epsilon. Pilihan tersebut merupakan kontrak implementasi, bukan sifat universal mekanisme RMSNorm. Kompatibilitas checkpoint bergantung pada kecocokan parameterisasi dan perilaku numerik yang diharapkan model.

Epsilon paling terasa pada magnitudo kecil

Suku (\epsilon) mencegah pembagian dengan denominator nol dan memengaruhi vector yang magnitudo kuadratnya kecil dibandingkan konstanta tersebut. Untuk vector yang seluruh elemennya nol, output sebelum skala tetap nol selama aritmetika menghasilkan denominator yang finite.

Jika magnitudo RMS jauh lebih besar daripada (\epsilon), pengaruh relatif suku tambahan tersebut mengecil. Di dekat nol, nilainya dapat mengubah faktor normalisasi secara material. Karena itu epsilon lebih tepat diperlakukan sebagai bagian dari implementasi model daripada knob deployment yang dapat diganti tanpa konsekuensi.

Penempatan dan nilai epsilon yang berbeda juga dapat memengaruhi reproduksi checkpoint. Dua formula yang tampak serupa pada aktivasi biasa dapat menghasilkan selisih numerik pada magnitudo kecil atau aritmetika berpresisi rendah.

Presisi numerik memengaruhi proses reduksi

RMSNorm memerlukan reduksi atas nilai fitur yang dikuadratkan. Operasi kuadrat, akumulasi, pembagian dengan jumlah fitur, akar kuadrat, reciprocal, dan penskalaan akhir semuanya berlangsung dalam presisi terbatas. Implementasi dapat menaikkan sebagian operasi antara ke tipe yang lebih lebar atau memakai fused kernel dengan strategi reduksi khusus perangkat.

Pilihan tersebut dapat menghasilkan selisih output kecil meskipun formula matematisnya sama. Efek ini terpisah dari perbedaan arsitektural antara RMSNorm dan LayerNorm. Sebuah model dapat konsisten memakai RMSNorm, sementara dua runtime masih menghasilkan nilai yang sedikit berbeda akibat urutan reduksi atau presisi accumulator.

Serving terkuantisasi menambahkan batas lain. Runtime dapat melakukan dequantization, normalisasi dalam format floating-point, lalu quantization kembali atau meneruskan hasilnya ke proyeksi terkuantisasi. Persamaan normalisasi saja tidak menentukan jalur data tersebut.

Posisi pada residual block mengubah komputasi di sekitarnya

Jenis normalisasi dan posisi normalisasi merupakan dua pilihan desain yang berbeda. Pada transformer pre-normalized, residual state dapat melewati sublayer melalui residual connection sementara versi yang telah dinormalisasi masuk ke attention atau transformasi feed-forward. Pada susunan post-normalized, normalisasi bekerja pada titik berbeda dalam pembaruan residual.

RMSNorm sendiri tidak menentukan susunan tersebut. Pemeriksaan arsitektur model perlu mencakup formula normalisasi sekaligus posisinya terhadap residual addition dan proyeksi sublayer.

Kehati-hatian yang sama berlaku pada klaim optimisasi atau kecepatan serving. Tidak adanya pengurangan mean memang menghapus satu statistik dari operasi matematis, tetapi latency aktual bergantung pada kernel fusion, traffic memori, bentuk tensor, hardware, dtype, dan bagian lain execution graph. Jumlah operasi saja tidak menetapkan hasil performa end-to-end.

Batas teknis RMSNorm lebih sempit: mekanisme ini menormalisasi magnitudo vector terhadap nol tanpa memusatkan fitur. Offset bersama antarfitur tetap dipertahankan, berbeda dari LayerNorm standar yang akan menghapusnya, sementara skala vector yang masuk ke komputasi di sekitarnya tetap dikendalikan.