<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Training Model on Nalar</title>
    <link>https://nalar.dev/id/tags/training-model/</link>
    <description>Recent content in Training Model on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 17 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/training-model/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Batasi Pergeseran Parameter dengan Elastic Weight Consolidation</title>
      <link>https://nalar.dev/id/batasi-pergeseran-parameter-dengan-elastic-weight-consolidation/</link>
      <pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/batasi-pergeseran-parameter-dengan-elastic-weight-consolidation/</guid>
      <description>&lt;p&gt;Fine-tuning neural network pada task baru dapat menggeser parameter dari nilai yang mendukung task sebelumnya. Objective baru tidak memiliki alasan inheren untuk mempertahankan perilaku lama ketika data task sebelumnya tidak ikut dalam update. Elastic weight consolidation, atau EWC, menambahkan constraint di parameter space untuk mengurangi pergeseran tersebut.&lt;/p&gt;&#xA;&lt;p&gt;Constraint ini selektif, bukan seragam. Parameter yang diperkirakan lebih berpengaruh bagi task sebelumnya menerima penalti lebih besar ketika bergerak, sedangkan parameter dengan importance lebih rendah dapat berubah lebih bebas. EWC karena itu bukan sekadar weight decay menuju nol.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Isolasi Attention Antar-Sequence Training yang Dipack</title>
      <link>https://nalar.dev/id/isolasi-attention-antar-sequence-training-yang-dipack/</link>
      <pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/isolasi-attention-antar-sequence-training-yang-dipack/</guid>
      <description>&lt;p&gt;Padding dapat menghabiskan sebagian besar batch training ketika panjang sequence bervariasi. Sequence packing mengurangi pemborosan ini dengan menempatkan beberapa sampel pendek ke dalam satu blok token. Secara aritmetika ini menarik: lebih banyak token non-padding dapat dimuat ke tensor dengan panjang tetap yang sama.&lt;/p&gt;&#xA;&lt;p&gt;Packing juga mengubah struktur yang dilihat attention. Causal mask standar hanya mencegah token memperhatikan posisi setelahnya. Mask tersebut tidak mengetahui bahwa dua span yang bersebelahan berasal dari sampel berbeda. Tanpa batas tambahan, token pada span kedua dapat memperhatikan token dari span pertama.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Memperhitungkan Label Smoothing pada Confidence Classifier</title>
      <link>https://nalar.dev/id/memperhitungkan-label-smoothing-pada-confidence-classifier/</link>
      <pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/memperhitungkan-label-smoothing-pada-confidence-classifier/</guid>
      <description>&lt;p&gt;Classifier yang dilatih dengan target one-hot mendapat dorongan untuk memindahkan massa probabilitas ke kelas berlabel. Cross-entropy terus menurun saat model memberi kelas tersebut probabilitas yang semakin mendekati satu, bahkan setelah kelas prediksi sudah benar. Label smoothing mengubah tekanan ini dengan memberikan sedikit massa target kepada kelas lain.&lt;/p&gt;&#xA;&lt;p&gt;Perubahan tersebut mudah dianggap sebagai detail kecil pada loss function. Namun dampaknya tidak kecil ketika aplikasi menggunakan nilai probabilitas model. Target yang dilunakkan mengubah optimum yang didorong oleh objektif training, sehingga skor confidence dari model dengan smoothing tidak seharusnya ditafsirkan seolah berasal dari objektif yang sama dengan training one-hot biasa.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
