Sebuah transformer dapat membawa informasi yang berguna tentang distribusi next-token akhirnya beberapa block sebelum final layer. Membaca informasi tersebut tidak sesederhana menerapkan output projection model ke setiap hidden state intermediate. Final output head dikalibrasi untuk representasi di ujung jaringan, sedangkan residual representation dapat bergeser sepanjang kedalaman.
Tuned lens mengatasi ketidakcocokan itu dengan translator affine terpisah untuk setiap layer yang diperiksa. Translator memetakan residual state intermediate ke representasi yang dapat didekode oleh final normalization dan output projection yang dibekukan. Hasilnya adalah distribusi token yang dapat dibandingkan antar-layer tanpa mengasumsikan bahwa setiap layer sudah menggunakan basis representasi final.
Direct unembedding mengasumsikan basis representasi bersama
Untuk decoder-only transformer, misalkan h_l adalah residual state setelah layer l. Readout intermediate sederhana dapat melewatkan h_l melalui final normalization dan vocabulary projection yang sama dengan yang digunakan di akhir model:
z_l = W_U norm(h_l)
p_l = softmax(z_l)Di sini W_U adalah output projection model. Direct readout ini sering disebut logit lens.
Operasinya mudah dihitung, tetapi interpretasinya membawa asumsi kuat: residual state intermediate harus sudah tersusun sehingga final normalization dan output projection menjadi decoder yang sesuai. Transformer block tidak diwajibkan mempertahankan susunan tersebut. Fitur yang berguna bagi block berikutnya dapat direpresentasikan dalam bentuk yang sulit didekode oleh final head.
Distribusi token yang tampak aneh pada layer awal karena itu dapat mencerminkan ketidakcocokan readout, bukan ketiadaan informasi yang relevan. Membandingkan raw intermediate logits sepanjang kedalaman mencampurkan dua efek: perubahan internal state model dan perubahan kompatibilitas state tersebut dengan final output head.
Tuned lens menambahkan translator pada setiap layer
Tuned lens menyisipkan affine map khusus layer sebelum final readout yang dibekukan:
h'_l = A_l h_l + b_l
z_l = W_U norm(h'_l)
p_l = softmax(z_l)Transformer tetap dibekukan. Hanya parameter translator A_l dan b_l yang di-fit untuk setiap layer. Objective fitting meminta state intermediate yang telah diterjemahkan mereproduksi distribusi final model, biasanya melalui divergence antara distribusi lens dan distribusi final transformer.
Ini mengubah pertanyaan yang diajukan. Direct unembedding menanyakan apa yang dihasilkan final output head dari intermediate state apa adanya. Tuned lens menanyakan prediksi final apa yang dapat didekode setelah koreksi affine yang di-fit untuk representasi pada kedalaman tersebut.
Koreksi ini penting karena affine map dapat mengompensasi rotasi, pergeseran, dan rescaling sistematis pada residual representation. Namun, ia tidak dapat merekonstruksi informasi arbitrer yang tidak ada dalam h_l. Jika suatu perbedaan token belum dienkode dalam state yang diperiksa, translator affine lokal layer tidak memiliki transformer block berikutnya untuk memulihkannya.
Lintasan prediksi memperlihatkan refinement sepanjang kedalaman
Setelah setiap layer terpilih memiliki decoder yang kompatibel, distribusi yang dihasilkan membentuk lintasan sepanjang kedalaman model. Developer dapat memeriksa probabilitas token target, peringkat kandidat token, entropy, atau divergence terhadap distribusi final.
Misalkan sebuah prompt pada akhirnya menghasilkan probabilitas tinggi untuk token Paris. Trace tuned lens dapat menunjukkan bahwa Paris mulai dapat didekode di middle layer dan tetap kompetitif sesudahnya. Prompt lain mungkin menunjukkan beberapa kandidat lokasi saling bertukar peringkat hingga block akhir. Pola tersebut menggambarkan perubahan keterdekodean informasi output sepanjang kedalaman; pola itu tidak menetapkan satu urutan reasoning internal yang unik.
Perbedaan ini berguna saat debugging perilaku model. Jika token yang diharapkan menjadi sangat dapat didekode lalu kehilangan probabilitas mendekati akhir, investigasi dapat difokuskan pada transformasi berikutnya. Jika token tidak pernah dapat didekode melalui lens, bentuk kegagalannya berbeda. Trace mempersempit lokasi yang perlu diperiksa, tetapi tidak dengan sendirinya mengidentifikasi attention head, fitur MLP, atau causal pathway yang bertanggung jawab.
Probe yang di-fit mengubah sifat bukti
Tuned lens adalah probe dengan parameter trainable. Output-nya tidak boleh diperlakukan sebagai transkrip literal komputasi internal transformer.
Translator dioptimalkan untuk mengekstrak informasi prediksi final dari intermediate state. Akibatnya, informasi dapat dibuat lebih mudah dibaca daripada jika final head transformer sendiri diterapkan langsung pada layer tersebut. Ini adalah koreksi yang memang dimaksudkan untuk representation mismatch, tetapi juga berarti distribusi hasil dekode sebagian ditentukan oleh probe.
Kapasitas probe menetapkan batas penting. Translator affine lebih terbatas daripada decoder nonlinear yang dalam, sehingga jumlah komputasi baru yang dapat diperkenalkannya juga terbatas. Meski demikian, decoding yang berhasil hanya menunjukkan bahwa informasi relevan dapat dipulihkan secara linear setelah transformasi yang di-fit; hal itu tidak menunjukkan bahwa transformer block berikutnya menggunakan mapping yang persis sama.
Perbandingan juga bergantung pada cara translator di-fit. Lens yang dilatih pada satu distribusi teks dapat menghadapi distribusi hidden state berbeda pada domain lain. Transformer dapat tetap berperilaku normal sementara probe menjadi kurang terkalibrasi. Evaluasi lens dan evaluasi model dasarnya karena itu merupakan dua hal terpisah.
Final normalization termasuk dalam definisi readout
Detail implementasi di sekitar normalization dapat mengubah intermediate logits secara material. Banyak arsitektur decoder-only menerapkan final normalization sebelum vocabulary projection. Lens yang dimaksudkan untuk mendekati final readout model sebaiknya mempertahankan frozen normalization yang relevan pada jalur decoding.
Komputasi persisnya bergantung pada arsitektur. Penempatan residual, tipe normalization, tied embeddings, struktur output head, dan batas block berbeda antar-keluarga model. Formula generik berguna untuk reasoning, tetapi kode harus menurunkan readout dari arsitektur model aktual, bukan mengasumsikan setiap transformer mengekspos komponen identik.
Batas layer juga memerlukan definisi stabil. Membaca residual state sebelum block, setelah attention, setelah MLP, atau setelah keseluruhan block menghasilkan objek berbeda. Mencampurkan posisi-posisi ini antar-eksperimen dapat menciptakan perubahan semu yang berasal dari instrumentation, bukan perilaku model.
Output lens adalah bukti observasional
Distribusi token intermediate paling berguna sebagai permukaan diagnostik. Distribusi tersebut dapat memperlihatkan di mana kandidat prediksi mulai dapat didekode, di mana distribusi berubah tajam, dan di mana dua prompt mulai berbeda sepanjang kedalaman. Observasi itu dapat memotivasi pengujian yang lebih terarah.
Klaim kausal memerlukan intervensi. Activation patching, ablation, atau modifikasi terkontrol lain dapat menguji apakah suatu komponen atau representasi benar-benar memengaruhi output final dalam kondisi tertentu. Tuned lens sendiri membaca informasi dari hidden state; ia tidak membuktikan bahwa fitur yang didekode menyebabkan prediksi.
Batas ini menjaga metode tetap berguna tanpa memaksanya menjawab pertanyaan yang lebih kuat daripada desainnya. Tuned lens meningkatkan keterbandingan intermediate readout dengan mengoreksi representation mismatch khusus layer, sedangkan causal analysis tetap merupakan operasi terpisah.