<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>PagedAttention on Nalar</title>
    <link>https://nalar.dev/id/tags/pagedattention/</link>
    <description>Recent content in PagedAttention on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Wed, 23 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/pagedattention/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>PagedAttention Memetakan Blok KV Logis ke Memori Fisik yang Tidak Kontigu</title>
      <link>https://nalar.dev/id/pagedattention-memetakan-blok-kv-logis-ke-memori-fisik-tidak-kontigu/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/pagedattention-memetakan-blok-kv-logis-ke-memori-fisik-tidak-kontigu/</guid>
      <description>&lt;p&gt;KV cache sebuah request autoregresif bertambah ketika token baru diproses, sementara panjang akhir sequence belum diketahui saat decoding dimulai. Reservasi satu area kontigu sebesar panjang maksimum mengikat memori pada kapasitas yang mungkin tidak pernah terpakai. PagedAttention mengubah batas alokasi tersebut: sequence direpresentasikan sebagai blok KV logis, lalu block table memetakan setiap blok logis ke blok fisik yang tidak harus bersebelahan di memori GPU.&lt;/p&gt;&#xA;&lt;p&gt;Mekanisme ini mengubah penempatan dan alokasi cache. Persamaan attention tidak berubah, dan jumlah state KV per token yang dipertahankan tidak otomatis berkurang.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
