<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Attention on Nalar</title>
    <link>https://nalar.dev/id/tags/attention/</link>
    <description>Recent content in Attention on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Tue, 15 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/attention/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Isolasi Attention Antar-Sequence Training yang Dipack</title>
      <link>https://nalar.dev/id/isolasi-attention-antar-sequence-training-yang-dipack/</link>
      <pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/isolasi-attention-antar-sequence-training-yang-dipack/</guid>
      <description>&lt;p&gt;Padding dapat menghabiskan sebagian besar batch training ketika panjang sequence bervariasi. Sequence packing mengurangi pemborosan ini dengan menempatkan beberapa sampel pendek ke dalam satu blok token. Secara aritmetika ini menarik: lebih banyak token non-padding dapat dimuat ke tensor dengan panjang tetap yang sama.&lt;/p&gt;&#xA;&lt;p&gt;Packing juga mengubah struktur yang dilihat attention. Causal mask standar hanya mencegah token memperhatikan posisi setelahnya. Mask tersebut tidak mengetahui bahwa dua span yang bersebelahan berasal dari sampel berbeda. Tanpa batas tambahan, token pada span kedua dapat memperhatikan token dari span pertama.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Pertahankan Attention Sinks pada Streaming Transformers</title>
      <link>https://nalar.dev/id/pertahankan-attention-sinks-pada-streaming-transformers/</link>
      <pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/pertahankan-attention-sinks-pada-streaming-transformers/</guid>
      <description>&lt;p&gt;Attention cache yang dibatasi menciptakan mode kegagalan tertentu pada autoregressive transformer: menghapus semua token lama dapat mengganggu attention meskipun token tersebut tidak lagi membawa konten tugas yang berguna. Beberapa posisi awal dapat menyerap attention mass dari banyak query berikutnya. Jika cache eviction menghapusnya, kualitas generation dapat menurun lebih besar daripada yang diperkirakan dari nilai semantiknya.&lt;/p&gt;&#xA;&lt;p&gt;Posisi-posisi ini sering disebut attention sinks. Implikasi praktisnya sempit tetapi berguna: streaming cache dapat mempertahankan prefix kecil berisi posisi sink sambil merotasi sisa kapasitasnya untuk token-token terbaru.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Batasi Pertumbuhan KV Cache pada Streaming LLM Inference</title>
      <link>https://nalar.dev/id/batasi-pertumbuhan-kv-cache-pada-streaming-llm-inference/</link>
      <pubDate>Sat, 12 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/batasi-pertumbuhan-kv-cache-pada-streaming-llm-inference/</guid>
      <description>&lt;p&gt;Inference transformer autoregresif biasanya menyimpan state key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang state tersebut. Cache bertambah seiring panjang sequence. Untuk stream yang berjalan lama, pertumbuhan itu akhirnya menjadi kendala memori meskipun generation tetap berlangsung satu token pada satu waktu.&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;KV cache eviction&lt;/strong&gt; membatasi state tersebut dengan membuang posisi cache tertentu. Efek terhadap memori cukup langsung: lebih sedikit pasangan key-value yang dipertahankan berarti lebih sedikit ruang cache yang terpakai. Efek terhadap model lebih halus. Setelah sebuah posisi dihapus, layer attention berikutnya tidak dapat memakai key dan value yang sebelumnya di-cache dalam komputasi attention biasa. Kebijakan eviction dengan demikian mengubah penggunaan resource sekaligus riwayat attention efektif.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Ukur Konsentrasi Attention dengan Entropi</title>
      <link>https://nalar.dev/id/ukur-konsentrasi-attention-dengan-entropi/</link>
      <pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/ukur-konsentrasi-attention-dengan-entropi/</guid>
      <description>&lt;p&gt;Attention pada Transformer sering diperiksa sebagai matriks bobot. Cara ini cukup untuk beberapa contoh, tetapi menjadi sulit ketika Anda perlu membandingkan banyak head, layer, token, atau beberapa model run. Ringkasan yang berguna adalah &lt;strong&gt;entropi attention&lt;/strong&gt;: angka yang menggambarkan seberapa terkonsentrasi atau tersebar suatu distribusi attention.&lt;/p&gt;&#xA;&lt;p&gt;Entropi dapat menjawab pertanyaan yang sempit tetapi praktis: apakah query menempatkan sebagian besar massa attention pada sedikit posisi yang tersedia, atau menyebarkannya secara luas? Entropi tidak memberi tahu apakah model benar, apakah sebuah token menyebabkan prediksi, atau apakah sebuah head penting. Dengan memahami batas tersebut, entropi menjadi diagnostik ringkas untuk perilaku attention.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
