Transformer decoder-only menghasilkan distribusi next-token hanya setelah hidden state terakhir melewati normalisasi output model dan proyeksi vocabulary. Logit lens menggunakan kembali jalur output tersebut pada state dari block transformer yang lebih awal. Hasilnya adalah rangkaian distribusi vocabulary yang dapat memperlihatkan perubahan preferensi token seiring kedalaman model.

Metode ini menarik karena memetakan vektor internal ke ruang token yang familiar tanpa melatih classifier terpisah. Kemudahan tersebut juga menciptakan batas interpretasi yang tegas: state intermediate tidak selalu dioptimalkan agar dapat langsung di-decode oleh pemetaan output terakhir. Distribusi token yang dapat dibaca adalah probe terhadap state tersebut, bukan jaminan bahwa model sudah menetapkan prediksi yang sama.

Probe menggunakan kembali pemetaan vocabulary model

Misalkan h_l adalah state residual stream setelah block transformer l. Untuk model yang jalur output akhirnya menerapkan normalisasi N, lalu matrix vocabulary W_U dan bias b, logit akhir biasa dapat ditulis sebagai

z_final = W_U N(h_L) + b

Probe logit lens dasar menggantinya dengan state yang lebih awal:

z_l = W_U N(h_l) + b

Menerapkan softmax pada z_l menghasilkan distribusi vocabulary untuk layer tersebut. Membandingkan distribusi ini pada berbagai kedalaman dapat memperlihatkan sebuah token kandidat menjadi dominan, menghilang, atau digantikan ketika block berikutnya mengubah residual stream.

Ekspresi persisnya bergantung pada arsitektur model. Sebagian model tidak memiliki bias output. Penempatan normalisasi dan parameter sharing juga berbeda-beda. Probe harus mengikuti jalur output model yang sebenarnya, bukan mengasumsikan formula decoder universal.

State intermediate dapat tidak selaras dengan decoder akhir

Proyeksi vocabulary dilatih untuk menerima representasi yang diberikan pada output model. State residual yang lebih awal ikut berpartisipasi dalam komputasi, tetapi tidak harus berada pada basis representasi yang dapat ditafsirkan dengan bersih oleh decoder akhir.

Hal ini menimbulkan kemungkinan mismatch. State awal dapat memuat informasi yang dapat digunakan block berikutnya meskipun proyeksi langsung memberi informasi tersebut probabilitas kecil dalam ruang vocabulary. Sebaliknya, sebuah token dapat memperoleh skor probe tinggi pada satu layer lalu kehilangan posisinya setelah transformasi attention dan feed-forward berikutnya.

Karena itu, perubahan antarlayer sering lebih informatif dibanding memperlakukan satu probabilitas intermediate sebagai pernyataan yang terkalibrasi. Probe menunjukkan kompatibilitas antara state internal dan pemetaan vocabulary akhir pada titik tersebut di jaringan.

Normalisasi merupakan bagian dari pengukuran

Menerapkan proyeksi output langsung pada residual state yang belum dinormalisasi dapat mencampurkan dua efek: arah representasi dan skala. Pada arsitektur dengan layer normalisasi akhir, mereproduksi normalisasi tersebut sebelum proyeksi memberikan jalur output probe yang lebih dekat dengan jalur yang digunakan untuk prediksi next-token sebenarnya.

Meski demikian, operasi tersebut tetap bersifat counterfactual untuk layer intermediate. Parameter normalisasi akhir dioptimalkan dalam konteks jaringan lengkap. Menggunakannya kembali pada layer yang lebih awal tidak mengubah state intermediate menjadi output model yang sebenarnya.

Perbedaan ini penting saat membandingkan implementasi. Dua tool yang sama-sama disebut logit lens dapat menghasilkan keluaran berbeda karena satu menerapkan normalisasi akhir sementara yang lain memproyeksikan residual state mentah. Ranking token keduanya karena itu dapat berbeda tanpa berarti salah satu implementasi mengalami kesalahan aritmetika.

Ranking token membawa lebih sedikit asumsi daripada probabilitas mentah

Softmax mengubah logit probe menjadi angka yang menyerupai probabilitas next-token biasa. Kemiripan ini dapat mendorong klaim yang lebih kuat daripada yang didukung probe. Distribusi intermediate tidak selalu terkalibrasi, dan besar probabilitas dapat dipengaruhi oleh skala representasi, detail normalisasi, serta keselarasan dengan decoder akhir.

Ranking token, selisih logit, atau perubahan posisi token tertentu di antara layer dapat memberikan pengukuran yang lebih sempit. Besaran ini tetap bergantung pada proyeksi decoder, tetapi tidak memperlakukan nilai softmax intermediate seolah memiliki status yang sama dengan probabilitas prediktif akhir model.

Perbandingan yang berguna juga menetapkan posisi token yang sedang diperiksa. Pada transformer autoregressive, setiap posisi sequence memiliki residual state sendiri. Membandingkan posisi berbeda di antara layer akan mencampurkan kedalaman dengan konteks prediksi yang berbeda.

Probe residual stream tidak mengisolasi kontribusi sebuah komponen

Residual state memuat akumulasi kontribusi dari operasi attention dan feed-forward sebelumnya. Melakukan decode terhadap h_l menunjukkan proyeksi vocabulary dari state gabungan pada layer l; hal itu tidak mengatribusikan preferensi token kepada block terakhir saja.

Mengurangi state yang bersebelahan dapat memperlihatkan update yang ditambahkan oleh sebuah block, tetapi memproyeksikan selisih tersebut merupakan pengukuran berbeda dari memproyeksikan residual stream penuh. Karena normalisasi dan komputasi nonlinear berikutnya dapat mengubah interaksi antar-update, selisih yang di-decode tidak boleh disamakan dengan efek kausal lengkap block terhadap prediksi akhir.

Atribusi komponen memerlukan pengukuran yang memang dirancang untuk atribusi, seperti controlled activation replacement atau ablation dengan intervensi yang didefinisikan secara jelas. Logit lens lebih sesuai untuk mengamati bagaimana struktur token yang dapat di-decode berkembang melalui jaringan.

Token awal yang stabil tidak berarti komputasi telah berhenti

Sebuah token dapat tetap berada di posisi teratas ranking probe selama banyak layer sementara margin terhadap alternatifnya terus berubah. Block berikutnya juga dapat mengubah representasi yang digunakan untuk token generasi selanjutnya, bahkan ketika ranking token yang sedang diperiksa tampak stabil.

Kebalikannya juga berlaku pada tingkat interpretasi: ranking awal yang tidak stabil tidak membuktikan bahwa jaringan tidak memiliki informasi yang relevan. Informasi tersebut mungkin dikodekan dalam bentuk yang tidak dapat langsung di-decode oleh pemetaan vocabulary akhir pada kedalaman tersebut.

Logit lens karena itu paling dapat dipertanggungjawabkan ketika digunakan sebagai pandangan terhadap struktur yang selaras dengan decoder, dengan detail arsitektur dan posisi layer tetap dinyatakan secara eksplisit. Metode ini dapat memperlihatkan lintasan yang berguna melalui ruang token, tetapi lintasan tersebut tetap merupakan proyeksi komputasi internal, bukan transkrip komputasi itu sendiri.