Langsung ke konten

Arsip

Multi-Token Prediction

1 artikel
Kecerdasan Buatan 24 Sep 2026 5 min read

Prediksi Multi-Token Menambahkan Loss Token Masa Depan Paralel pada Trunk Model Bersama

Model bahasa next-token biasanya menerapkan satu objektif prediksi pada posisi t: representasi hidden pada posisi tersebut dipakai untuk memberi skor pada token x_(t+1). Prediksi multi-token mengubah batas training itu. Satu trunk model menghasilkan representasi bersama, lalu beberapa output head memprediksi sejumlah token sesudah posisi tersebut. Mekanisme ini menambahkan supervisi pada beberapa offset masa depan tanpa memerlukan trunk transformer terpisah untuk setiap offset. Jadi, perubahan utamanya berada pada objektif training dan prediction head, bukan jaminan bahwa generasi autoregresif biasa dapat mengeluarkan beberapa token tanpa pemeriksaan dalam satu langkah eksak.