<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Large Language Models on Nalar</title>
    <link>https://nalar.dev/id/tags/large-language-models/</link>
    <description>Recent content in Large Language Models on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Wed, 16 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/large-language-models/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Kendalikan Repetisi dengan Contrastive Search Decoding</title>
      <link>https://nalar.dev/id/kendalikan-repetisi-dengan-contrastive-search-decoding/</link>
      <pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kendalikan-repetisi-dengan-contrastive-search-decoding/</guid>
      <description>&lt;p&gt;Greedy decoding dapat terus memilih token yang secara lokal paling mungkin bahkan ketika continuation yang dihasilkan menjadi repetitif. Sampling dapat memutus pola tersebut, tetapi melakukannya dengan menambahkan randomness. Contrastive search mengambil jalur lain: untuk input dan setting yang tetap, ia tetap deterministik sambil menilai likely next-token candidate terhadap representation-level repetition penalty.&lt;/p&gt;&#xA;&lt;p&gt;Metode ini menggabungkan dua sinyal yang menjelaskan properti candidate berbeda. Language-model probability mengutamakan token yang cocok dengan prefix saat ini. Degeneration penalty menurunkan nilai candidate yang new hidden representation-nya terlalu mirip dengan representasi yang sudah ada dalam generated context.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Kuantisasi KV Cache untuk Mengurangi Memory Inferensi Long-Context</title>
      <link>https://nalar.dev/id/kuantisasi-kv-cache-untuk-mengurangi-memory-inferensi-long-context/</link>
      <pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kuantisasi-kv-cache-untuk-mengurangi-memory-inferensi-long-context/</guid>
      <description>&lt;p&gt;Inferensi transformer autoregresif menggunakan kembali attention key dan value dari token sebelumnya agar setiap token baru tidak perlu menghitung ulang seluruh prefix. Penggunaan ulang ini membentuk KV cache, yang kebutuhan memory-nya bertambah seiring jumlah token yang disimpan. Pada context yang panjang atau request concurrency yang tinggi, cache dapat menjadi bagian besar dari memory inferensi.&lt;/p&gt;&#xA;&lt;p&gt;Kuantisasi KV cache mengubah representasi tensor yang disimpan tersebut. Key dan value ditulis dalam format precision lebih rendah bersama scale atau metadata lain yang diperlukan untuk rekonstruksi. Attention kemudian memakai value yang direkonstruksi atau kernel yang dapat menangani representasi terkuantisasi secara langsung.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Perluas Context RoPE dengan Positional Interpolation</title>
      <link>https://nalar.dev/id/perluas-context-rope-dengan-positional-interpolation/</link>
      <pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/perluas-context-rope-dengan-positional-interpolation/</guid>
      <description>&lt;p&gt;Transformer yang memakai rotary position embeddings dapat menerima tensor lebih panjang daripada sequence length yang digunakan saat training, tetapi kemampuan menerima shape tersebut tidak membuktikan bahwa position signal tetap berguna pada jarak itu. Rotary angle pada posisi yang belum pernah dilihat dapat menempatkan attention computation di luar positional regime yang ditemui model selama optimization.&lt;/p&gt;&#xA;&lt;p&gt;Positional interpolation mengubah input ke rotary position embeddings, bukan sekadar menaikkan batas sequence length. Untuk target context yang lebih panjang daripada original training context, position index dikompresi sehingga extended sequence dipetakan ke positional range sebelumnya. Model kemudian perlu beradaptasi terhadap positional spacing yang lebih rapat alih-alih melakukan extrapolation langsung ke index yang lebih besar.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
