<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Softmax on Nalar</title>
    <link>https://nalar.dev/id/tags/softmax/</link>
    <description>Recent content in Softmax on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Wed, 23 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/softmax/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Bias Logit Aditif Mengubah Odds Token Sebelum Sampling</title>
      <link>https://nalar.dev/id/bias-logit-aditif-mengubah-odds-token-sebelum-sampling/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/bias-logit-aditif-mengubah-odds-token-sebelum-sampling/</guid>
      <description>&lt;p&gt;Decoder dapat menaikkan atau menekan peluang sebuah token tanpa mengubah bobot model. Tambahkan konstanta pada logit token sebelum softmax, lalu probabilitasnya berubah relatif terhadap token lain dalam vocabulary. Operasinya sederhana, tetapi dampaknya bergantung pada posisi bias di pipeline decoding dan transformasi yang berjalan sesudahnya.&lt;/p&gt;&#xA;&lt;p&gt;Karena itu, bias logit aditif berguna sebagai kontrol inferensi, bukan sebagai constraint semantik umum. Bias mengubah skor yang dipakai decoder. Bias tidak menulis ulang representasi internal model dan tidak menjamin sebuah konsep hilang dari teks yang dihasilkan.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Skala Logit Attention Menjaga Dot Product dalam Rentang Softmax yang Stabil</title>
      <link>https://nalar.dev/id/skala-logit-attention-menjaga-dot-product-dalam-rentang-softmax-yang-stabil/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/skala-logit-attention-menjaga-dot-product-dalam-rentang-softmax-yang-stabil/</guid>
      <description>&lt;p&gt;Dot product antara sebuah query dan key cenderung memiliki magnitudo yang makin besar ketika dimensinya bertambah. Pada scaled dot-product attention, skor tersebut dibagi dengan akar kuadrat dimensi key sebelum softmax. Faktor ini bukan sekadar normalisasi kosmetik. Ia mengendalikan skala yang masuk ke softmax berdasarkan asumsi statistik tertentu tentang komponen query dan key.&lt;/p&gt;&#xA;&lt;p&gt;Bentuk yang umum adalah&lt;/p&gt;&#xA;&lt;div&#xA;  x-data=&#34;{ code: $el.querySelector(&#39;code&#39;).innerText, copied: false }&#34;&#xA;  class=&#34;code-block group relative my-6 overflow-hidden rounded-xl border border-line bg-surface-muted dark:border-night-line dark:bg-night-surface&#34;&gt;&#xA;  &lt;button&#xA;    type=&#34;button&#34;&#xA;    @click=&#34;navigator.clipboard.writeText(code); copied = true; setTimeout(() =&gt; copied = false, 1600)&#34;&#xA;    class=&#34;absolute right-3 top-3 z-10 rounded-lg border border-line-strong bg-surface px-2 py-1 font-mono text-[0.8rem] text-muted opacity-0 transition group-hover:opacity-100 hover:bg-ink hover:text-white dark:border-night-line dark:bg-night dark:text-night-muted dark:hover:bg-white dark:hover:text-ink&#34;&gt;&#xA;    &lt;span x-text=&#34;copied ? &#39;Copied&#39; : &#39;Copy&#39;&#34;&gt;&lt;/span&gt;&#xA;  &lt;/button&gt;&#xA;  &#xA;  &lt;div class=&#34;overflow-x-auto p-4 text-sm leading-6 [&amp;_pre]:!m-0 [&amp;_pre]:!bg-transparent [&amp;_pre]:!p-0 [&amp;_code]:font-mono&#34;&gt;&#xA;    &lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;background-color:#fff;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&#xA;  &lt;/div&gt;&#xA;&lt;/div&gt;&#xA;&lt;p&gt;dengan &lt;code&gt;d_k&lt;/code&gt; sebagai dimensi query-key untuk satu attention head. Faktor skala memengaruhi distribusi probabilitas attention meski faktor itu sendiri tidak mengubah urutan logit.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Temperature Scaling Mengubah Ketajaman Softmax Tanpa Mengubah Urutan Logit</title>
      <link>https://nalar.dev/id/temperature-scaling-mengubah-ketajaman-softmax-tanpa-mengubah-urutan-logit/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/temperature-scaling-mengubah-ketajaman-softmax-tanpa-mengubah-urutan-logit/</guid>
      <description>&lt;p&gt;Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif &lt;code&gt;T&lt;/code&gt;, logit dibagi dengan &lt;code&gt;T&lt;/code&gt; sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda.&lt;/p&gt;&#xA;&lt;p&gt;Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
