<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Training on Nalar</title>
    <link>https://nalar.dev/id/tags/training/</link>
    <description>Recent content in Training on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 17 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/training/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Membatasi Update Gradien dengan Global Norm Clipping</title>
      <link>https://nalar.dev/id/membatasi-update-gradien-dengan-global-norm-clipping/</link>
      <pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/membatasi-update-gradien-dengan-global-norm-clipping/</guid>
      <description>&lt;p&gt;Satu langkah optimisasi dapat menghasilkan gradien dengan besar gabungan yang jauh melebihi langkah-langkah di sekitarnya. Jika gradien itu langsung diberikan kepada optimizer, update parameter yang dihasilkan dapat memindahkan model ke wilayah space parameter yang sangat berbeda. Global norm clipping membatasi besar gradien sebelum optimizer memakainya.&lt;/p&gt;&#xA;&lt;p&gt;Mekanismenya sederhana, tetapi perilakunya mudah disalahartikan. Mekanisme ini tidak membatasi setiap elemen gradien secara terpisah dan tidak menjamin norm update parameter yang tetap untuk optimizer adaptif. Mekanisme ini menskalakan ulang seluruh vektor gradien ketika norm yang dipilih melewati ambang.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Teacher Forcing Menciptakan Kesenjangan Distribusi Prefix</title>
      <link>https://nalar.dev/id/teacher-forcing-menciptakan-kesenjangan-distribusi-prefix/</link>
      <pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/teacher-forcing-menciptakan-kesenjangan-distribusi-prefix/</guid>
      <description>&lt;p&gt;Model autoregresif memprediksi token berikutnya dari sebuah prefix. Dalam training dengan teacher forcing, prefix tersebut biasanya berasal dari sequence referensi. Saat generasi, prefix berisi token yang dikeluarkan model sendiri. Satu kesalahan prediksi karena itu dapat mengubah konteks yang digunakan untuk seluruh prediksi berikutnya.&lt;/p&gt;&#xA;&lt;p&gt;Perbedaan ini sering disebut exposure bias. Detail engineering yang lebih berguna adalah bahwa training dan generasi dapat menyajikan distribusi prefix yang berbeda kepada predictor kondisional yang sama. Validasi token-level pada prefix referensi yang bersih tidak sepenuhnya menggambarkan perilaku ketika model memasuki prefix yang jarang muncul selama training.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
