<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Model Serving on Nalar</title>
    <link>https://nalar.dev/id/tags/model-serving/</link>
    <description>Recent content in Model Serving on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Wed, 23 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/model-serving/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Reuse Prefix KV Cache Bergantung pada Identitas Konteks yang Tepat</title>
      <link>https://nalar.dev/id/reuse-prefix-kv-cache-bergantung-pada-identitas-konteks-yang-tepat/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/reuse-prefix-kv-cache-bergantung-pada-identitas-konteks-yang-tepat/</guid>
      <description>&lt;p&gt;Prefix cache dapat menghilangkan komputasi prefill yang berulang tanpa mengubah output model, tetapi hanya jika key dan value yang tersimpan mewakili konteks prefix yang sama dengan state yang seharusnya dihasilkan request baru. Kecocokan teks yang terlihat belum cukup. Jalur serving pada akhirnya bekerja dengan token ID, posisi, parameter model, dan state attention yang bergantung pada implementasi.&lt;/p&gt;&#xA;&lt;p&gt;Batas ini membuat prefix caching berbeda dari cache teks biasa. Cache teks menyimpan hasil yang terkait dengan sebuah input. KV prefix cache menyimpan state perantara yang validitasnya bergantung pada komputasi yang membentuknya.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Reuse Prefix KV Cache Bergantung pada Riwayat Token yang Identik</title>
      <link>https://nalar.dev/id/reuse-prefix-kv-cache-bergantung-pada-riwayat-token-yang-identik/</link>
      <pubDate>Tue, 22 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/reuse-prefix-kv-cache-bergantung-pada-riwayat-token-yang-identik/</guid>
      <description>&lt;p&gt;Satu entri KV cache bukan representasi yang dapat dipakai ulang untuk sembarang teks yang tampak mirip. Pada transformer autoregresif, key dan value yang tersimpan adalah state perantara yang dihasilkan untuk prefix token tertentu dalam konteks eksekusi tertentu. Reuse valid hanya jika request baru mencapai batas state yang sama.&lt;/p&gt;&#xA;&lt;p&gt;Batas itu lebih ketat daripada kecocokan karakter yang terlihat. Tokenisasi, urutan token, penanganan posisi, identitas model, state adapter, serta input lain yang memengaruhi hidden state dapat menentukan apakah prefix dalam cache masih mewakili komputasi yang dibutuhkan request baru.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Speculative Decoding Menghubungkan Kecepatan Draft dengan Tingkat Penerimaan</title>
      <link>https://nalar.dev/id/speculative-decoding-menghubungkan-kecepatan-draft-dengan-tingkat-penerimaan/</link>
      <pubDate>Tue, 22 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/speculative-decoding-menghubungkan-kecepatan-draft-dengan-tingkat-penerimaan/</guid>
      <description>&lt;p&gt;Generasi autoregresif biasanya maju satu token yang diterima pada satu waktu. Setiap token baru memperpanjang prefix, sehingga evaluasi target model berikutnya bergantung pada token yang dipilih pada posisi sebelumnya. Speculative decoding mengubah jadwal eksekusi: proses draft yang lebih murah mengusulkan beberapa token ke depan, lalu target model mengevaluasi posisi tersebut bersama-sama dan menentukan seberapa panjang proposal yang dapat dipertahankan.&lt;/p&gt;&#xA;&lt;p&gt;Susunan ini dapat mengurangi jumlah pemanggilan target model yang bersifat serial untuk setiap token output. Verifikasi tetap memiliki biaya, dan blok draft yang lebih panjang tidak otomatis lebih baik. Titik operasi yang berguna bergantung pada kecepatan pembuatan proposal, seberapa sering proposal lolos verifikasi target, dan biaya yang ditanggung serving stack untuk pekerjaan yang akhirnya ditolak.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
