Model draft dapat mengusulkan token yang tidak akan dipilih model target pada random draw yang sama, tetapi speculative sampling tetap dapat mempertahankan distribusi model target. Syarat utamanya bukan prediksi draft yang selalu tepat. Ketepatan distribusi berasal dari aturan acceptance dan koreksi setelah rejection.
Dua sifat ini perlu dipisahkan. Kualitas draft menentukan seberapa sering proposal lolos verifikasi. Konstruksi rejection-correction menentukan apakah sampel akhir mengikuti distribusi target.
Acceptance bergantung pada rasio probabilitas
Misalkan model target mendefinisikan distribusi next-token (p(x)), sedangkan model draft yang lebih cepat mendefinisikan (q(x)) pada ruang token yang sama. Proposal (x) diambil dari (q).
Aturan canonical speculative sampling menerima proposal tersebut dengan probabilitas
[ A(x) = \min\left(1, \frac{p(x)}{q(x)}\right). ]
Untuk token dengan (q(x) > 0), massa probabilitas dari proposal draft yang diterima menjadi
[ q(x)A(x) = \min(q(x), p(x)). ]
Persamaan ini memperlihatkan fungsi verifikasi. Jika probabilitas draft untuk sebuah token tidak melampaui probabilitas target, setiap proposal token itu dapat diterima. Jika draft memberi bobot terlalu besar, hanya bagian yang didukung target yang lolos acceptance.
Massa yang diterima belum tentu sama dengan (p). Proposal yang ditolak menyisakan massa probabilitas target yang masih harus dialokasikan.
Rejection membuka distribusi residual
Definisikan residual positif
[ r(x) = \max(0, p(x)-q(x)). ]
Setelah rejection, token pengganti diambil dari distribusi residual yang dinormalisasi:
[ p_{\mathrm{res}}(x) = \frac{\max(0, p(x)-q(x))} {\sum_y \max(0, p(y)-q(y))}. ]
Residual ini memuat massa target yang belum tercakup oleh proposal draft yang diterima. Token yang diberi probabilitas lebih besar oleh draft daripada target memiliki massa residual nol; bagian massa target yang sah sudah direpresentasikan melalui acceptance.
Probabilitas rejection total adalah
[ 1 - \sum_x \min(p(x),q(x)). ]
Untuk distribusi diskret yang ternormalisasi, nilai tersebut juga sama dengan
[ \sum_x \max(0,p(x)-q(x)). ]
sehingga denominator residual tepat sama dengan probabilitas bahwa koreksi diperlukan.
Gabungan massa acceptance dan rejection yang diikuti sampling residual menghasilkan kembali (p(x)). Distribusi draft mengubah jalur untuk memperoleh sampel, tetapi distribusi marginal akhir tetap sama dengan distribusi target ketika aturan ini diterapkan secara tepat.
Kualitas draft mengubah acceptance, bukan hukum target
Term overlap
[ \sum_x \min(p(x),q(x)) ]
merupakan probabilitas acceptance yang diharapkan untuk satu proposal. Distribusi draft yang dekat dengan target memiliki overlap lebih besar sehingga koreksi lebih jarang terjadi. Draft yang buruk masih dapat dipakai dalam sampler yang exact, tetapi rejection menjadi lebih sering dan keuntungan komputasinya dapat hilang.
Batas sistem ini penting. Dalam skema exact, draft yang lebih kuat terutama berfungsi sebagai optimasi performa. Draft tersebut bukan sumber jaminan distribusi.
Keseimbangan biaya juga mencakup latency model draft, biaya verifikasi target, panjang kandidat, memory traffic, perilaku batching, dan overhead implementasi. Acceptance rate saja tidak membuktikan adanya speedup end-to-end.
Beberapa token draft membentuk batas pada rejection pertama
Speculative decoding biasanya mengusulkan rangkaian token, bukan satu token terisolasi. Model draft menghasilkan beberapa kandidat secara autoregresif, lalu model target mengevaluasi probabilitas untuk posisi-posisi tersebut secara paralel sejauh arsitektur dan runtime mendukungnya.
Verifikasi tetap berjalan menurut urutan token karena setiap token yang diterima menentukan prefix untuk posisi berikutnya. Begitu satu token draft ditolak, token draft setelahnya berasal dari prefix yang bukan lagi prefix aktif hasil generasi. Kandidat setelah titik tersebut tidak dapat langsung dipertahankan seolah verifikasi sebelumnya berhasil.
Decoder menerapkan koreksi pada posisi rejection pertama dan membuang suffix yang belum diverifikasi pada speculative round tersebut. Round berikutnya dimulai dari prefix yang sudah dikoreksi.
Jika seluruh token proposal dalam satu blok diterima, algoritme canonical dapat mengambil satu token tambahan dari evaluasi target yang sudah tersedia untuk posisi berikutnya. Token tambahan ini menjadi bagian dari keuntungan throughput: satu verifikasi target yang mahal dapat memajukan generasi lebih jauh daripada sekadar jumlah posisi yang diperiksa.
Verifikasi greedy memiliki kontrak berbeda
Pada greedy decoding, runtime dapat membandingkan token draft dengan token argmax target dan mempertahankan prefix yang cocok. Mekanisme tersebut dapat mereproduksi output greedy target pada eksekusi deterministik yang sesuai, tetapi konstruksinya berbeda dari sampling probabilistik dengan rejection correction.
Untuk generasi stokastik, menerima token draft hanya karena token tersebut termasuk kandidat dengan probabilitas target tinggi tidak otomatis mempertahankan distribusi target. Mengganti token yang ditolak langsung dari distribusi target mentah, bukan residual, juga secara umum mengubah massa probabilitas karena sebagian massa target sudah diberikan melalui proposal yang diterima.
Karena itu, klaim exact melekat pada algoritme acceptance-and-correction tertentu, bukan pada setiap sistem yang memakai label speculative decoding.
Detail numerik dan runtime tetap menjadi batas implementasi
Persamaan di atas menggambarkan distribusi probabilitas dalam aritmetika ideal. Inference produksi memakai logit berpresisi terbatas, implementasi softmax, random-number generator, filter token, dan processor yang spesifik terhadap model. Jika probabilitas draft dan target mengalami transformasi berbeda sebelum verifikasi, distribusi yang dipakai aturan acceptance tidak lagi mewakili kontrak sampling yang sama.
Temperature, vocabulary mask, top-k filtering, nucleus filtering, repetition penalty, dan processor lain harus ditempatkan secara konsisten dengan algoritme yang diterapkan runtime. Sistem dapat sengaja memakai verifier aproksimatif demi throughput tambahan, tetapi preservasi exact terhadap distribusi target awal memerlukan pembuktian tersendiri untuk aturan yang sudah dimodifikasi itu.
Batas mekanismenya tetap spesifik: proposal draft dapat mengurangi pekerjaan serial model target, sementara exact rejection correction mengalokasikan ulang massa probabilitas sehingga proposal yang diterima dan rejection yang dikoreksi menjumlah menjadi distribusi target. Performa berasal dari proposal murah dan acceptance tinggi. Fidelitas distribusi berasal dari matematika verifier.