Langsung ke konten

Arsip

LLM Inference

2 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Sliding-Window Attention Membatasi Akses Token Secara Langsung

Transformer kausal tidak harus membuka seluruh token sebelumnya untuk setiap posisi query. Pada sliding-window attention, posisi i hanya dapat melakukan attention terhadap rentang key terdahulu yang terbatas. Token di luar rentang itu tidak ikut dalam operasi attention pada layer tersebut, meskipun masih menjadi bagian dari input model. Batas ini bukan sekadar mengubah bentuk matriks attention. Ia memisahkan akses langsung dari informasi yang hanya dapat mencapai suatu posisi setelah diteruskan melalui hidden state perantara.

Kecerdasan Buatan 24 Sep 2026 5 min read

Prefix KV Cache Hanya Menggunakan Ulang Prefix Token yang Sama

Cache hit pada prefix berhenti di titik pertama ketika request baru tidak lagi dapat memakai state yang sudah dihitung. Objek yang digunakan ulang bukan sekadar potongan teks. Objek tersebut adalah state model dari urutan prefix token tertentu, dengan kondisi eksekusi yang membuat state itu kompatibel dengan request baru. Pada inference transformer, state tersebut umumnya berupa key-value cache yang dibentuk saat prefill. Pemakaiannya kembali dapat menghapus komputasi berulang pada prefix yang sama, sedangkan suffix setelah titik divergensi tetap diproses secara normal.