<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>LLM Inference on Nalar</title>
    <link>https://nalar.dev/id/tags/llm-inference/</link>
    <description>Recent content in LLM Inference on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 24 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/llm-inference/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Multi-Head Latent Attention Mengompresi State KV Sebelum Ekspansi Spesifik Head</title>
      <link>https://nalar.dev/id/id/multi-head-latent-attention-mengompresi-state-kv-sebelum-ekspansi-spesifik-head/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/id/multi-head-latent-attention-mengompresi-state-kv-sebelum-ekspansi-spesifik-head/</guid>
      <description>&lt;p&gt;Multi-Head Latent Attention mengubah state yang dipertahankan selama decoding autoregresif. Alih-alih mengharuskan cache berisi tensor key dan value penuh untuk setiap token serta attention head, arsitektur ini dapat menyimpan representasi laten berdimensi lebih kecil dan membentuk informasi key/value spesifik head melalui struktur proyeksi.&lt;/p&gt;&#xA;&lt;p&gt;Perbedaannya berada tepat pada batas cache. Multi-head attention konvensional umumnya menyimpan key dan value per head setelah proyeksi. MLA memindahkan sebagian representasi tersebut ke balik bottleneck yang ringkas, sehingga bentuk state persisten tidak lagi sama dengan bentuk komputasi yang dikonsumsi attention.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Prefix KV Cache Hanya Menggunakan Ulang Prefix Token yang Sama</title>
      <link>https://nalar.dev/id/id/prefix-kv-cache-hanya-menggunakan-ulang-prefix-token-yang-sama/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/id/prefix-kv-cache-hanya-menggunakan-ulang-prefix-token-yang-sama/</guid>
      <description>&lt;p&gt;Cache hit pada prefix berhenti di titik pertama ketika request baru tidak lagi dapat memakai state yang sudah dihitung. Objek yang digunakan ulang bukan sekadar potongan teks. Objek tersebut adalah state model dari urutan prefix token tertentu, dengan kondisi eksekusi yang membuat state itu kompatibel dengan request baru.&lt;/p&gt;&#xA;&lt;p&gt;Pada inference transformer, state tersebut umumnya berupa key-value cache yang dibentuk saat prefill. Pemakaiannya kembali dapat menghapus komputasi berulang pada prefix yang sama, sedangkan suffix setelah titik divergensi tetap diproses secara normal.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Sliding-Window Attention Membatasi Akses Token Secara Langsung</title>
      <link>https://nalar.dev/id/id/sliding-window-attention-membatasi-akses-token-secara-langsung/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/id/sliding-window-attention-membatasi-akses-token-secara-langsung/</guid>
      <description>&lt;p&gt;Transformer kausal tidak harus membuka seluruh token sebelumnya untuk setiap posisi query. Pada sliding-window attention, posisi &lt;code&gt;i&lt;/code&gt; hanya dapat melakukan attention terhadap rentang key terdahulu yang terbatas. Token di luar rentang itu tidak ikut dalam operasi attention pada layer tersebut, meskipun masih menjadi bagian dari input model.&lt;/p&gt;&#xA;&lt;p&gt;Batas ini bukan sekadar mengubah bentuk matriks attention. Ia memisahkan akses langsung dari informasi yang hanya dapat mencapai suatu posisi setelah diteruskan melalui hidden state perantara.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
