Kecerdasan Buatan
23 Sep 2026
5 min read
Grouped-Query Attention Berbagi KV Head di Antara Grup Query
Grouped-query attention (GQA) mengubah satu rasio struktural di dalam layer attention: jumlah query head dapat lebih besar daripada jumlah key dan value head. Beberapa query head memakai key dan value head hasil proyeksi yang sama. Komputasi pada sisi query tetap terpisah per head, sedangkan state KV dibagi di dalam setiap grup. Asimetri ini berpengaruh langsung pada decoding autoregresif karena key dan value dari token sebelumnya disimpan di cache. Semakin sedikit KV head yang berbeda, semakin sedikit pula state KV per token yang perlu dipertahankan untuk langkah decoding berikutnya.