Decoder dapat menaikkan atau menekan peluang sebuah token tanpa mengubah bobot model. Tambahkan konstanta pada logit token sebelum softmax, lalu probabilitasnya berubah relatif terhadap token lain dalam vocabulary. Operasinya sederhana, tetapi dampaknya bergantung pada posisi bias di pipeline decoding dan transformasi yang berjalan sesudahnya.
Karena itu, bias logit aditif berguna sebagai kontrol inferensi, bukan sebagai constraint semantik umum. Bias mengubah skor yang dipakai decoder. Bias tidak menulis ulang representasi internal model dan tidak menjamin sebuah konsep hilang dari teks yang dihasilkan.
Bias bekerja pada skor sebelum normalisasi
Untuk vocabulary dengan logit z_1, ..., z_V, softmax biasa memberikan
p_i = exp(z_i) / sum_j exp(z_j)Misalkan decoder menambahkan vektor bias b sebelum normalisasi:
p'_i = exp(z_i + b_i) / sum_j exp(z_j + b_j)Nilai b_i positif menaikkan token i relatif terhadap token yang menerima bias lebih kecil. Nilai negatif menurunkannya. Denominator dihitung ulang dari seluruh logit yang sudah disesuaikan, sehingga perubahan pada satu token juga mengubah probabilitas ternormalisasi token lain walaupun logit mereka tidak berubah.
Properti yang berguna terdapat pada odds relatif. Untuk token i dan k,
p'_i / p'_k = exp((z_i - z_k) + (b_i - b_k))Dibandingkan distribusi tanpa bias, rasio odds keduanya dikalikan dengan
exp(b_i - b_k)pada penempatan bias aditif seperti ini. Dampak terhadap odds relatif ditentukan oleh selisih dua nilai bias, bukan salah satu nilai secara terpisah.
Menambahkan konstanta yang sama ke seluruh logit vocabulary tidak mengubah hasil setelah softmax. Offset bersama tersebut hilang saat normalisasi. Vektor bias hanya berpengaruh melalui perbedaan antarentri.
Perubahan probabilitas bergantung pada distribusi awal
Bias positif yang tetap tidak menghasilkan kenaikan probabilitas yang tetap. Pergeseran aditif yang sama dapat memberi dampak normalisasi yang sangat berbeda sesuai logit pesaing.
Ambil satu token target dengan probabilitas awal p dan bias c, sementara semua token lain menerima bias nol. Probabilitas setelah penyesuaian dapat ditulis sebagai
p' = exp(c) p / (1 - p + exp(c) p)Ekspresi ini menunjukkan dua batas. Pertama, bias mengalikan odds token target terhadap token lain dengan exp(c). Kedua, probabilitas akhirnya tetap bergantung pada p. Token yang bermula dengan probabilitas sangat kecil dapat tetap jarang dipilih setelah bias positif moderat, sedangkan bias yang sama pada token yang sudah kompetitif dapat membuatnya dominan.
Kasus bias negatif mengikuti sifat serupa. Bias negatif berhingga menurunkan odds, tetapi secara matematis tidak memaksa probabilitas menjadi nol. Eksklusi eksak memerlukan mekanisme yang menghapus token dari set kandidat atau memberinya skor efektif berupa negative infinity sesuai konvensi numerik implementasi.
Temperature mengubah kekuatan efektif bias
Urutan pipeline berpengaruh ketika temperature scaling digunakan. Jika logit yang sudah menerima bias dibagi dengan temperature T > 0, distribusinya menjadi
p'_i = softmax((z_i + b_i) / T)dan selisih bias menyumbang (b_i - b_k) / T pada selisih log-odds. T yang lebih rendah memperbesar kontribusi tersebut; T yang lebih tinggi mengecilkannya.
Implementasi lain dapat menskalakan logit model lebih dulu lalu menambahkan bias yang tidak ikut diskalakan:
p'_i = softmax(z_i / T + b_i)Kedua ekspresi itu tidak ekuivalen kecuali bias diskalakan secara konsisten. Nama parameter logit bias pada sebuah API tidak dengan sendirinya menetapkan posisinya terhadap temperature, repetition penalty, vocabulary mask, atau processor lain. Urutan tersebut merupakan properti implementasi.
Perbedaan ini juga memengaruhi reproduksibilitas. Dua serving stack dapat menerima nilai bias numerik yang sama tetapi menghasilkan distribusi berbeda jika urutan processor-nya berbeda.
Penyaringan kandidat dapat mengesampingkan ranking hasil bias
Sampling sering memiliki tahap selain softmax. Top-k filtering dapat mempertahankan sejumlah kandidat dengan skor tertinggi. Top-p filtering dapat membentuk set kandidat dari massa probabilitas kumulatif. Vocabulary mask dapat membuang token sebelum sampling. Processor lain dapat mengubah skor berdasarkan konteks yang sudah dihasilkan.
Bias positif dapat menaikkan posisi token sebelum tahap tersebut, tetapi tidak menjamin token bertahan dari seluruh filter berikutnya. Sebaliknya, token tanpa bias dapat hilang karena processor lain mengecualikannya.
Interaksi pastinya bergantung pada urutan. Jika pemilihan top-k berjalan setelah bias diterapkan, bias dapat mengubah keanggotaan set top-k. Jika hard vocabulary mask berjalan sesudahnya, mask tetap dapat menghapus token tanpa memedulikan skor yang sudah disesuaikan. Menganggap semua kontrol decoding sebagai satu operasi softmax akan mengaburkan batas ini.
Untuk debugging, artefak yang relevan adalah pipeline pemrosesan skor: logit mentah model, setiap processor sesuai urutan, set kandidat akhir, dan distribusi sampling. Hanya melihat token yang akhirnya terpilih akan menghilangkan state antara yang diperlukan untuk mengaitkan perubahan dengan satu processor tertentu.
Kontrol token bukan kontrol teks
Bias logit bekerja pada token ID. Constraint teks bekerja pada string atau konten semantik. Kedua tingkat ini tidak berimpit.
Satu kata yang terlihat dapat memiliki beberapa tokenisasi sesuai vocabulary tokenizer, spasi di depan, kapitalisasi, tanda baca, atau byte di sekitarnya. Menekan satu token ID tidak otomatis menekan setiap sequence yang menghasilkan teks sama. Sebuah konsep juga dapat dinyatakan melalui sinonim atau parafrasa dengan token yang tidak pernah menerima bias.
Bias positif memiliki batas serupa. Menaikkan peluang satu token tidak menjamin sequence kata tertentu, sebab langkah decoding berikutnya menerima distribusi model baru yang dikondisikan pada token yang sudah dikeluarkan. Frasa multi-token memerlukan analisis terhadap rangkaian distribusi kondisional, bukan satu penyesuaian vocabulary yang statis.
Untuk constraint leksikal ketat, decoder memerlukan mekanisme yang dirancang berdasarkan sequence token yang diizinkan atau dilarang, sering kali dengan state untuk melacak kecocokan parsial. Untuk pembatasan semantik, pergeseran skor pada tingkat token merupakan proxy yang lebih lemah lagi karena ekuivalensi semantik tidak direpresentasikan oleh satu set token tetap.
Nilai ekstrem bertemu perilaku finite precision
Persamaan di atas mengasumsikan aritmetika bilangan real. Implementasi serving memakai tipe numerik berhingga dan biasanya menerapkan transformasi softmax yang stabil secara numerik. Penyesuaian positif atau negatif yang sangat besar dapat bertemu clipping, saturation, batas eksplisit, atau penanganan khusus dari processor.
Bias positif besar juga tidak menghasilkan probabilitas di atas satu; normalisasi mendistribusikan ulang massa pada set kandidat. Saat skor target menjadi dominan, probabilitasnya mendekati satu pada set kandidat berhingga yang selain itu tidak berubah. Skor negatif berhingga yang cukup besar mendekati nol tanpa menjadi hard exclusion eksak pada softmax matematis.
Untuk API inferensi eksternal, rentang bias yang diterima dan penanganan nilai ekstrem merupakan kontrak API, bukan properti softmax itu sendiri. Detail tersebut perlu berasal dari dokumentasi implementasi atau kontrak antarmuka yang dapat diamati, bukan dari persamaan bias aditif.
Bias adalah intervensi lokal pada decoding
Bias logit aditif memiliki interpretasi yang sempit: mengubah skor token tertentu pada satu langkah decoding. Pada penambahan langsung sebelum softmax, selisih bias diterjemahkan secara eksak menjadi perubahan multiplikatif pada odds relatif sebelum processor lain ikut bekerja.
Presisi tersebut berguna karena memisahkan properti matematis dari perilaku produk yang lebih luas. Temperature, filtering, hard mask, struktur tokenizer, logit yang bergantung pada konteks, dan urutan processor dapat mengubah sequence yang akhirnya dipilih. Nilai bias paling tepat diperlakukan sebagai satu intervensi lokal dalam pipeline decoding, dengan cakupan yang ditentukan oleh tahap tempat bias diterapkan.