Langsung ke konten

Arsip

Softmax

3 artikel
Kecerdasan Buatan 23 Sep 2026 5 min read

Temperature Scaling Mengubah Ketajaman Softmax Tanpa Mengubah Urutan Logit

Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif T, logit dibagi dengan T sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda. Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.

Kecerdasan Buatan 23 Sep 2026 5 min read

Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil

Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key. Bentuk yang umum adalah Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V dengan d_k sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.

Kecerdasan Buatan 23 Sep 2026 6 min read

Bias Logit Aditif Mengubah Odds Token Sebelum Sampling

Decoder dapat menaikkan atau menekan peluang sebuah token tanpa mengubah bobot model. Tambahkan konstanta pada logit token sebelum softmax, lalu probabilitasnya berubah relatif terhadap token lain dalam vocabulary. Operasinya sederhana, tetapi dampaknya bergantung pada posisi bias di pipeline decoding dan transformasi yang berjalan sesudahnya. Karena itu, bias logit aditif berguna sebagai kontrol inferensi, bukan sebagai constraint semantik umum. Bias mengubah skor yang dipakai decoder. Bias tidak menulis ulang representasi internal model dan tidak menjamin sebuah konsep hilang dari teks yang dihasilkan.