Langsung ke konten

Arsip

Kompresi Model

1 artikel
Kecerdasan Buatan 16 Sep 2026 5 min read

Pangkas Head Attention Transformer dengan Dampak yang Terukur

Sebuah blok multi-head attention dapat memiliki head yang ketika dihapus hanya sedikit mengubah metrik target pada set evaluasi tertentu. Pengamatan ini membuat pemangkasan head attention menarik: identifikasi head berdampak rendah, hapus kontribusinya, lalu pertahankan head yang lebih penting bagi workload target. Bagian yang sulit bukan membuat output sebuah head menjadi nol. Yang perlu ditentukan adalah apa yang sebenarnya diukur oleh intervensi tersebut dan apakah model hasilnya benar-benar mengeksekusi lebih sedikit pekerjaan. Head yang dimask, head yang dihapus secara struktural, dan kernel attention yang lebih cepat adalah gagasan yang berkaitan, tetapi bukan hasil yang sama.