<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Inference LLM on Nalar</title>
    <link>https://nalar.dev/id/tags/inference-llm/</link>
    <description>Recent content in Inference LLM on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Tue, 15 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/inference-llm/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Kuantisasi KV Cache dengan Error Budget yang Eksplisit</title>
      <link>https://nalar.dev/id/kuantisasi-kv-cache-dengan-error-budget-eksplisit/</link>
      <pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kuantisasi-kv-cache-dengan-error-budget-eksplisit/</guid>
      <description>&lt;p&gt;Inference transformer autoregresif menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang proyeksi tersebut. Ketika context length dan jumlah sequence concurrent meningkat, KV cache ini dapat menjadi bagian besar dari memori accelerator.&lt;/p&gt;&#xA;&lt;p&gt;Kuantisasi KV cache menyimpan tensor tersebut pada presisi lebih rendah dan merekonstruksi aproksimasi ketika attention menggunakannya. Perhitungan memorinya menarik, tetapi error yang dihasilkan bukan perturbasi generik seperti pada model weight. Key yang terkuantisasi memengaruhi attention score sebelum softmax, sedangkan value terkuantisasi memengaruhi weighted sum setelah attention probability terbentuk.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
