Uji Mekanisme Transformer dengan Activation Patching
Sebuah transformer dapat menghasilkan dua output berbeda dari prompt yang hanya berbeda pada satu detail relevan, tetapi pemeriksaan attention weight atau kemiripan hidden state tidak membuktikan state internal mana yang benar-benar penting bagi perbedaan tersebut. Activation patching menjawab pertanyaan yang lebih sempit dengan melakukan intervensi pada forward pass: mengganti activation tertentu dengan activation yang bersesuaian dari run lain, lalu mengukur perubahan output. Hasilnya bersifat kausal terhadap intervensi tersebut. Namun, hasil itu tidak otomatis mengidentifikasi circuit lengkap, mekanisme unik, atau feature yang dapat diberi makna langsung oleh manusia. Batas ini penting agar hasil patching tidak ditafsirkan terlalu jauh.