Langsung ke konten

Arsip

Transformer

6 artikel
Kecerdasan Buatan 18 Sep 2026 4 min read

Perlakukan Logit Lens sebagai Readout, Bukan Jejak Kausal

Sebuah transformer dapat menampilkan residual state intermediate yang sangat mendukung satu token saat diproyeksikan dengan proyeksi kosakata akhir model, lalu menghasilkan token lain setelah block berikutnya dijalankan. Logit lens membuat preferensi intermediate itu terlihat. Hasil tersebut tidak menetapkan bahwa preferensi itu menyebabkan output akhir. Batas ini relevan saat developer memakai peringkat token per layer untuk memeriksa perilaku model. Logit lens adalah readout: metode ini menanyakan apa yang akan dilaporkan output head model jika diterapkan pada representasi intermediate. Forward pass aktual mengajukan persoalan berbeda karena setiap block yang tersisa dapat mengubah representasi tersebut sebelum readout akhir.

Kecerdasan Buatan 17 Sep 2026 7 min read

Seimbangkan Routing Token pada Model Sparse Mixture-of-Experts

Layer sparse mixture-of-experts dapat memiliki banyak jaringan expert sambil hanya mengevaluasi sebagian kecil untuk setiap token. Router memungkinkan sparsitas ini: router memberi skor pada expert, memilih sejumlah kecil expert, lalu mengirim setiap token melalui jalur komputasi yang dipilih. Pemilihan tersebut bukan sekadar detail optimisasi. Jika banyak token terkonsentrasi pada sedikit expert, sebagian device dapat menerima jauh lebih banyak pekerjaan daripada yang lain, batas kapasitas dapat membuang atau mengalihkan assignment, dan expert yang menerima sedikit traffic memperoleh lebih sedikit gradient dari task. Karena itu, keseimbangan router memengaruhi komputasi sekaligus fungsi yang direpresentasikan model.

Kecerdasan Buatan 17 Sep 2026 6 min read

Mempertahankan Attention Sink dalam KV Cache Terbatas

KV cache terbatas tampak cocok dengan aturan eviction sederhana: setelah cache penuh, buang pasangan key-value tertua dan pertahankan token terbaru. Pada sebagian transformer decoder-only, aturan ini dapat menurunkan kualitas generasi secara tajam setelah urutan melewati jendela yang dipertahankan. Kegagalan tersebut tidak hanya berasal dari hilangnya konten semantik lama. Token awal dapat menerima attention besar meski teksnya hanya membawa sedikit informasi yang berguna untuk prediksi saat ini. Perilaku ini umum disebut attention sink. Dampaknya penting bagi desain inferensi streaming karena kebijakan cache yang mempertahankan prefix awal kecil ditambah sliding window terbaru dapat berperilaku sangat berbeda dari sliding window murni dengan batas memori yang serupa.

Kecerdasan Buatan 16 Sep 2026 6 min read

Kelompokkan Panjang Sequence untuk Mengurangi Padding yang Terbuang

Batch berpadding dibentuk oleh sequence terpanjang, bukan panjang rata-ratanya. Jika sebuah batch berisi jumlah token 120, 124, 131, dan 900, setiap sequence dapat direpresentasikan dengan panjang 900. Sebagian besar posisi pada tiga baris pertama kemudian berisi padding, bukan token input. Length bucketing mengubah komposisi batch tanpa mengubah model. Contoh dengan jumlah token serupa ditempatkan berdekatan sebelum batch dibentuk. Panjang maksimum dalam setiap batch menjadi lebih dekat dengan panjang anggotanya, sehingga jumlah posisi padding yang diproses oleh operasi yang masih memakai bentuk batch persegi panjang berkurang.

Kecerdasan Buatan 13 Sep 2026 8 min read

Menyeimbangkan Routing Sparse Mixture-of-Experts di Bawah Batas Kapasitas

Layer sparse mixture-of-experts tidak mengirim setiap token melalui setiap blok parameter. Router memberi skor pada expert yang tersedia, memilih subset kecil untuk setiap token, lalu melakukan dispatch representasi token hanya ke expert terpilih. Conditional computation ini menjadi daya tarik utama desain sparse MoE, tetapi sekaligus menciptakan masalah alokasi sumber daya di dalam model. Router dapat memilih expert yang sama untuk banyak token. Hardware, sementara itu, memiliki buffer dan kapasitas komunikasi yang terbatas. Kebijakan routing yang tampak masuk akal dari skor token saja dapat menghasilkan expert yang overload, expert yang menganggur, komunikasi tidak merata, atau assignment yang dibuang.

Kecerdasan Buatan 06 Sep 2026 9 min read

Percepat Generasi LLM dengan Speculative Decoding

Model bahasa autoregresif menghasilkan teks satu token demi satu token. Meski accelerator memiliki komputasi paralel yang besar, model biasanya tidak dapat menentukan token ke-12 sebelum token ke-11 diketahui. Ketergantungan ini membuat latensi generasi sulit dikurangi hanya dengan menambahkan lebih banyak hardware paralel. Speculative decoding mengatasi bottleneck ini dengan mengerjakan pekerjaan murah lebih dulu sebelum model yang mahal. Draft model yang lebih cepat mengusulkan beberapa token berikutnya. Target model lengkap kemudian mengevaluasi usulan tersebut bersama-sama dan menerima bagian yang konsisten dengan distribusinya sendiri. Dengan algoritma acceptance-and-correction yang tepat, cara komputasi generasi berubah tanpa mengubah distribusi yang didefinisikan target model.