<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Kuantisasi on Nalar</title>
    <link>https://nalar.dev/id/tags/kuantisasi/</link>
    <description>Recent content in Kuantisasi on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 24 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/kuantisasi/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Kuantisasi KV Cache Mengurangi State Attention dengan Biaya Rekonstruksi</title>
      <link>https://nalar.dev/id/id/kuantisasi-kv-cache-mengurangi-state-attention-dengan-biaya-rekonstruksi/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/id/kuantisasi-kv-cache-mengurangi-state-attention-dengan-biaya-rekonstruksi/</guid>
      <description>&lt;p&gt;Decoding autoregresif menambahkan tensor key dan value ke cache pada setiap layer transformer. Cache mencegah token lama diproyeksikan ulang menjadi key dan value, tetapi kebutuhan penyimpanannya terus bertambah bersama panjang sequence. Kuantisasi KV cache mengubah representasi penyimpanan tersebut: entri lama atau entri tertentu dikodekan dengan bit lebih sedikit, lalu direkonstruksi saat dipakai oleh attention.&lt;/p&gt;&#xA;&lt;p&gt;Mekanisme ini merupakan pertukaran pada format memori. Token tidak dihapus dari konteks attention dan bobot model tidak diubah. Jumlah byte untuk state cache berkurang, dengan konsekuensi berupa error kuantisasi, metadata skala atau zero point, serta kerja konversi pada jalur decode.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Outlier Aktivasi Dapat Mendominasi Skala Kuantisasi Per-Tensor</title>
      <link>https://nalar.dev/id/outlier-aktivasi-dapat-mendominasi-skala-kuantisasi-per-tensor/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/outlier-aktivasi-dapat-mendominasi-skala-kuantisasi-per-tensor/</guid>
      <description>&lt;p&gt;Quantizer per-tensor memetakan setiap nilai dalam tensor aktivasi melalui satu skala bersama. Keterikatan ini menjadi relevan saat sebagian besar aktivasi berada dalam interval sempit, tetapi beberapa nilai memiliki magnitudo jauh lebih besar. Nilai besar tersebut dapat menentukan skala, sedangkan area pusat yang padat direpresentasikan dengan jarak antarnilai yang lebih kasar daripada kebutuhan rentangnya sendiri.&lt;/p&gt;&#xA;&lt;p&gt;Ini bukan berarti setiap aktivasi besar merupakan error atau aman untuk dihapus. Outlier dapat membawa state model yang berguna. Persoalannya bersifat numerik: satu skala harus mencakup nilai dengan magnitudo yang sangat berbeda.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Outlier Aktivasi Dapat Menentukan Skala untuk Seluruh Grup Kuantisasi</title>
      <link>https://nalar.dev/id/outlier-aktivasi-dapat-menentukan-skala-untuk-seluruh-grup-kuantisasi/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/outlier-aktivasi-dapat-menentukan-skala-untuk-seluruh-grup-kuantisasi/</guid>
      <description>&lt;p&gt;Quantizer dengan lebar integer tetap hanya memiliki jumlah kode representatif yang terbatas. Ketika banyak aktivasi memakai satu skala, satu nilai dengan magnitudo jauh lebih besar dapat memaksa skala tersebut mencakup rentang nilai real yang lebih lebar. Nilai lain kemudian hanya memakai lebih sedikit interval kode yang berguna di sekitar wilayah tempat nilainya terkonsentrasi.&lt;/p&gt;&#xA;&lt;p&gt;Perilaku ini bukan pernyataan umum bahwa kuantisasi gagal ketika berhadapan dengan angka besar. Penyebabnya lebih spesifik: nilai dalam grup kuantisasi yang sama berbagi parameter untuk memetakan bilangan real ke kode integer.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Kuantisasi KV Cache dengan Error Budget yang Eksplisit</title>
      <link>https://nalar.dev/id/kuantisasi-kv-cache-dengan-error-budget-eksplisit/</link>
      <pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kuantisasi-kv-cache-dengan-error-budget-eksplisit/</guid>
      <description>&lt;p&gt;Inference transformer autoregresif menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke konteks terdahulu tanpa menghitung ulang proyeksi tersebut. Ketika context length dan jumlah sequence concurrent meningkat, KV cache ini dapat menjadi bagian besar dari memori accelerator.&lt;/p&gt;&#xA;&lt;p&gt;Kuantisasi KV cache menyimpan tensor tersebut pada presisi lebih rendah dan merekonstruksi aproksimasi ketika attention menggunakannya. Perhitungan memorinya menarik, tetapi error yang dihasilkan bukan perturbasi generik seperti pada model weight. Key yang terkuantisasi memengaruhi attention score sebelum softmax, sedangkan value terkuantisasi memengaruhi weighted sum setelah attention probability terbentuk.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Kuantisasi KV Cache dengan Error Budget Key dan Value Terpisah</title>
      <link>https://nalar.dev/id/kuantisasi-kv-cache-dengan-error-budget-key-dan-value-terpisah/</link>
      <pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kuantisasi-kv-cache-dengan-error-budget-key-dan-value-terpisah/</guid>
      <description>&lt;p&gt;Inference transformer autoregressive menyimpan tensor key dan value dari token sebelumnya agar setiap token baru dapat melakukan attention ke posisi terdahulu tanpa menghitung ulang seluruh prefix. KV cache tersebut bertambah bersama sequence length, jumlah layer, batch size, dan jumlah key-value head yang disimpan. Pada context panjang, jejak memorinya dapat langsung membatasi jumlah request konkuren atau context length yang dapat digunakan.&lt;/p&gt;&#xA;&lt;p&gt;Kuantisasi KV cache mengurangi byte per elemen yang disimpan. Namun, aproksimasi yang dihasilkan tidak setara dengan menguantisasi struktur data pasif. Cached key ikut dalam perhitungan attention score, sedangkan cached value dicampur berdasarkan attention weight yang dihasilkan. Error pada kedua tensor itu karena itu memasuki operasi attention pada titik yang berbeda.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
