Pertahankan Attention Sinks pada Streaming Transformers
Attention cache yang dibatasi menciptakan mode kegagalan tertentu pada autoregressive transformer: menghapus semua token lama dapat mengganggu attention meskipun token tersebut tidak lagi membawa konten tugas yang berguna. Beberapa posisi awal dapat menyerap attention mass dari banyak query berikutnya. Jika cache eviction menghapusnya, kualitas generation dapat menurun lebih besar daripada yang diperkirakan dari nilai semantiknya. Posisi-posisi ini sering disebut attention sinks. Implikasi praktisnya sempit tetapi berguna: streaming cache dapat mempertahankan prefix kecil berisi posisi sink sambil merotasi sisa kapasitasnya untuk token-token terbaru.