<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Prefix Caching on Nalar</title>
    <link>https://nalar.dev/id/tags/prefix-caching/</link>
    <description>Recent content in Prefix Caching on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 24 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/prefix-caching/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Prefix Caching Menggunakan Ulang State KV untuk Prefix Token Identik</title>
      <link>https://nalar.dev/id/id/prefix-caching-menggunakan-ulang-state-kv-untuk-prefix-token-identik/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/id/prefix-caching-menggunakan-ulang-state-kv-untuk-prefix-token-identik/</guid>
      <description>&lt;p&gt;Serving autoregresif sering menerima request yang dimulai dengan urutan token panjang yang sama. System prompt, tool schema, header dokumen tetap, atau konteks berulang lain dapat membuat model menghitung state attention untuk prefix yang sama berkali-kali. Prefix caching menargetkan pekerjaan prefill yang berulang itu dengan mempertahankan state key-value yang kompatibel dan menghubungkan request berikutnya ke state tersebut.&lt;/p&gt;&#xA;&lt;p&gt;Batas penggunaan ulang adalah state token yang identik, bukan kemiripan semantik. Dua prompt yang menyampaikan maksud serupa tetapi menghasilkan token berbeda tidak memiliki entry prefix cache yang dapat dipertukarkan.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Prefix KV Cache Hanya Menggunakan Ulang Prefix Token yang Sama</title>
      <link>https://nalar.dev/id/id/prefix-kv-cache-hanya-menggunakan-ulang-prefix-token-yang-sama/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/id/prefix-kv-cache-hanya-menggunakan-ulang-prefix-token-yang-sama/</guid>
      <description>&lt;p&gt;Cache hit pada prefix berhenti di titik pertama ketika request baru tidak lagi dapat memakai state yang sudah dihitung. Objek yang digunakan ulang bukan sekadar potongan teks. Objek tersebut adalah state model dari urutan prefix token tertentu, dengan kondisi eksekusi yang membuat state itu kompatibel dengan request baru.&lt;/p&gt;&#xA;&lt;p&gt;Pada inference transformer, state tersebut umumnya berupa key-value cache yang dibentuk saat prefill. Pemakaiannya kembali dapat menghapus komputasi berulang pada prefix yang sama, sedangkan suffix setelah titik divergensi tetap diproses secara normal.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
