Kecerdasan Buatan
23 Sep 2026
5 min read
Penalti Repetisi Mengubah Skor Token Berdasarkan Output Sebelumnya
Penalti repetisi mengubah distribusi next-token tanpa mengubah parameter model atau komputasi hidden state. Model tetap menghasilkan logit dari konteks saat ini, tetapi decoder mengubah skor tertentu berdasarkan token yang sudah muncul. Sampling kemudian bekerja pada skor hasil perubahan tersebut, bukan langsung pada output model. Pemisahan ini relevan saat mereproduksi perilaku generation. Dua sistem dapat menjalankan bobot model dan token ID yang identik tetapi menghasilkan continuation berbeda karena rumus penalti, cakupan riwayat token, atau posisi aturan itu dalam pipeline decoding tidak sama.