Langsung ke konten

Arsip

Model Sekuens

1 artikel
Kecerdasan Buatan 17 Sep 2026 5 min read

Teacher Forcing Menciptakan Kesenjangan Distribusi Prefix

Model autoregresif memprediksi token berikutnya dari sebuah prefix. Dalam training dengan teacher forcing, prefix tersebut biasanya berasal dari sequence referensi. Saat generasi, prefix berisi token yang dikeluarkan model sendiri. Satu kesalahan prediksi karena itu dapat mengubah konteks yang digunakan untuk seluruh prediksi berikutnya. Perbedaan ini sering disebut exposure bias. Detail engineering yang lebih berguna adalah bahwa training dan generasi dapat menyajikan distribusi prefix yang berbeda kepada predictor kondisional yang sama. Validasi token-level pada prefix referensi yang bersih tidak sepenuhnya menggambarkan perilaku ketika model memasuki prefix yang jarang muncul selama training.