Sebuah attention head dapat menempatkan sebagian besar massa probabilitas pada satu posisi tanpa memberikan bukti kuat bahwa posisi tersebut mengendalikan output akhir model. Entropi bobot attention mengukur konsentrasi, bukan pengaruh kausal.

Pemisahan ini relevan saat attention map dipakai sebagai diagnostik. Entropi dapat menunjukkan apakah sebuah head menyebarkan massa secara luas atau memusatkannya pada sedikit posisi untuk query tertentu. Nilai itu sendiri tidak menetapkan bahwa token dengan bobot tertinggi membawa fitur yang menentukan prediksi downstream.

Entropi merangkum distribusi bobot

Untuk satu posisi query, misalkan sebuah attention head menghasilkan bobot ternormalisasi a_1, ..., a_n setelah masking dan softmax, dengan

a_i >= 0
sum_i a_i = 1

Entropi Shannon untuk distribusi tersebut adalah

H(a) = -sum_i a_i log(a_i)

Distribusi yang terkonsentrasi pada satu posisi memiliki entropi mendekati nol. Distribusi seragam pada n posisi yang tersedia memiliki entropi log(n). Di antara kedua batas itu, entropi meningkat ketika massa probabilitas tersebar lebih merata.

Besaran ini merupakan properti bobot ternormalisasi. Entropi tidak memeriksa value vector, output projection, residual stream, layer berikutnya, atau output task akhir.

Basis log hanya mengubah satuan. Logaritma natural menghasilkan entropi dalam nat, sedangkan logaritma basis 2 menghasilkan bit. Perbandingan perlu memakai konvensi yang sama.

Panjang sequence mengubah batas atas

Entropi mentah tidak langsung sebanding pada distribusi attention dengan jumlah posisi tersedia yang berbeda. Query yang dapat mengakses empat posisi memiliki entropi maksimum log(4), sedangkan query yang dapat mengakses 4.000 posisi memiliki batas maksimum jauh lebih besar.

Salah satu normalisasi yang umum adalah

H_norm(a) = H(a) / log(n)

untuk n > 1, dengan n menghitung posisi yang benar-benar tersedia setelah masking. Bentuk ini memetakan distribusi seragam ke 1 dan distribusi one-hot mendekati 0.

Normalisasi hanya mengatasi perubahan batas atas. Normalisasi tidak membuat dua head otomatis setara secara semantik. Head yang berbeda dapat bekerja pada representasi berbeda, dan nilai entropi yang sama dapat berasal dari pola bobot yang sangat berbeda.

Padding mask dan causal mask juga perlu diperhitungkan. Memasukkan posisi yang telah di-mask ke dalam n akan merusak normalisasi karena posisi tersebut bukan kandidat dalam distribusi.

Entropi yang sama tidak berarti struktur attention yang sama

Entropi memadatkan seluruh vektor probabilitas menjadi satu skalar. Pemadatan ini membuang identitas posisi.

Perhatikan dua distribusi:

A = [0.8, 0.1, 0.1, 0.0]
B = [0.0, 0.1, 0.1, 0.8]

Keduanya memiliki entropi yang sama karena memuat nilai probabilitas yang sama. Namun, massa dominannya menunjuk ke posisi berbeda.

Distribusi dengan bentuk berbeda juga dapat menghasilkan nilai entropi yang berdekatan. Tren entropi dapat menandakan perubahan konsentrasi tanpa menunjukkan posisi mana yang memperoleh atau kehilangan massa. Analisis yang mempertahankan informasi posisi tetap memerlukan bobot asli atau representasi struktur lainnya.

Bobot attention tidak memuat magnitudo value

Untuk satu head, output attention sebelum output projection dapat ditulis sebagai

o = sum_i a_i v_i

dengan v_i sebagai value vector pada posisi i.

Entropi hanya melihat a_i. Entropi tidak melihat arah atau magnitudo v_i. Sebuah posisi dapat menerima bobot attention besar sementara value vector-nya memberi kontribusi kecil pada arah yang relevan untuk komputasi downstream. Sebaliknya, beberapa bobot yang lebih kecil dapat menggabungkan value vector menjadi output yang besar.

Output projection dan agregasi multi-head menambah batas lain. Head yang sangat terkonsentrasi dapat diredam atau ditransformasikan setelah weighted sum, sementara head lain atau residual path membawa informasi yang lebih dominan pada komputasi berikutnya.

Karena itu, entropi attention rendah tepat disebut sebagai routing yang terkonsentrasi di dalam operasi attention tersebut. Menyebutnya sebagai feature importance tinggi menambahkan klaim yang tidak didukung oleh entropi itu sendiri.

Residual path memisahkan attention dari pengaruh total

Transformer block umumnya tidak mengganti residual stream dengan hasil attention. Kontribusi attention digabungkan dengan residual path, lalu diproses oleh transformasi tambahan sesuai arsitektur.

Akibatnya, output dapat tetap stabil ketika pola satu attention head berubah. Residual stream mungkin sudah membawa informasi yang diperlukan layer berikutnya, atau komponen lain dapat mengompensasi perubahan kontribusi tersebut.

Kondisi sebaliknya juga dapat terjadi: pergeseran attention yang terlihat kecil dapat berdampak jika pergeseran itu mengubah arah yang sensitif bagi komputasi berikutnya. Kedua kondisi tersebut tidak dapat disimpulkan hanya dari entropi.

Ini merupakan batas penggunaan metrik, bukan kekurangan pada definisinya. Entropi memang dirancang untuk merangkum distribusi probabilitas, bukan untuk mengukur efek kausal end-to-end.

Klaim kausal memerlukan intervensi atau atribusi dengan asumsi eksplisit

Jika pertanyaannya adalah pengaruh kausal terhadap output model, evaluasi perlu menghubungkan perubahan internal dengan output tersebut. Analisis dapat memakai ablation terkontrol, activation replacement, intervensi pada value vector, atau metode atribusi lain dengan asumsi yang dinyatakan secara jelas.

Sebagai contoh, mengganti output satu head dengan nilai referensi lalu mengukur perubahan pada target logit menguji properti yang berbeda dari pengukuran entropi attention head itu. Intervensi mengubah komputasi dan mengamati respons downstream. Entropi hanya menggambarkan distribusi bobot semula.

Intervensi juga memiliki batas. Menghapus komponen dapat menghasilkan internal state yang berbeda dari state pada inferensi normal, dan efeknya dapat bergantung pada baseline atau nilai pengganti. Analisis kausal perlu melaporkan semantik intervensi bersama hasilnya.

Entropi tetap berguna sebagai diagnostik

Batas tersebut tidak membuat entropi attention kehilangan fungsi. Metrik ini berguna untuk pertanyaan yang memang berkaitan dengan konsentrasi.

Di banyak request, entropi dapat menandai head yang secara konsisten memakai distribusi sempit atau lebar. Di berbagai posisi token, entropi dapat menunjukkan lokasi perubahan konsentrasi. Saat membandingkan model, metrik ini dapat merangkum pergeseran distribusi ketika masking, context length, arsitektur, atau konfigurasi serving berubah.

Penggunaan tersebut menjadi lebih jelas ketika entropi disertai scope pengukuran yang tepat: layer, head, posisi query, mask, panjang sequence, dan aturan agregasi. Rata-rata entropi lintas head atau token menambahkan lapisan ringkasan lain dan dapat menyembunyikan perilaku yang heterogen.

Batasnya jelas: entropi attention melaporkan bentuk bobot attention yang telah dinormalisasi. Klaim mengenai kepentingan token, kandungan informasi, atau kendali kausal memerlukan evidence dari besaran atau intervensi yang menghubungkan bobot tersebut dengan bagian komputasi model lainnya.