<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Inferensi Model on Nalar</title>
    <link>https://nalar.dev/id/tags/inferensi-model/</link>
    <description>Recent content in Inferensi Model on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Wed, 16 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/inferensi-model/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Kendalikan Repetisi dengan Contrastive Search Decoding</title>
      <link>https://nalar.dev/id/kendalikan-repetisi-dengan-contrastive-search-decoding/</link>
      <pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kendalikan-repetisi-dengan-contrastive-search-decoding/</guid>
      <description>&lt;p&gt;Greedy decoding dapat terus memilih token yang secara lokal paling mungkin bahkan ketika continuation yang dihasilkan menjadi repetitif. Sampling dapat memutus pola tersebut, tetapi melakukannya dengan menambahkan randomness. Contrastive search mengambil jalur lain: untuk input dan setting yang tetap, ia tetap deterministik sambil menilai likely next-token candidate terhadap representation-level repetition penalty.&lt;/p&gt;&#xA;&lt;p&gt;Metode ini menggabungkan dua sinyal yang menjelaskan properti candidate berbeda. Language-model probability mengutamakan token yang cocok dengan prefix saat ini. Degeneration penalty menurunkan nilai candidate yang new hidden representation-nya terlalu mirip dengan representasi yang sudah ada dalam generated context.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Kuantisasi KV Cache untuk Mengurangi Memory Inferensi Long-Context</title>
      <link>https://nalar.dev/id/kuantisasi-kv-cache-untuk-mengurangi-memory-inferensi-long-context/</link>
      <pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kuantisasi-kv-cache-untuk-mengurangi-memory-inferensi-long-context/</guid>
      <description>&lt;p&gt;Inferensi transformer autoregresif menggunakan kembali attention key dan value dari token sebelumnya agar setiap token baru tidak perlu menghitung ulang seluruh prefix. Penggunaan ulang ini membentuk KV cache, yang kebutuhan memory-nya bertambah seiring jumlah token yang disimpan. Pada context yang panjang atau request concurrency yang tinggi, cache dapat menjadi bagian besar dari memory inferensi.&lt;/p&gt;&#xA;&lt;p&gt;Kuantisasi KV cache mengubah representasi tensor yang disimpan tersebut. Key dan value ditulis dalam format precision lebih rendah bersama scale atau metadata lain yang diperlukan untuk rekonstruksi. Attention kemudian memakai value yang direkonstruksi atau kernel yang dapat menangani representasi terkuantisasi secara langsung.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
