<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Pelatihan Model on Nalar</title>
    <link>https://nalar.dev/id/tags/pelatihan-model/</link>
    <description>Recent content in Pelatihan Model on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 17 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/pelatihan-model/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Seimbangkan Routing Token pada Model Sparse Mixture-of-Experts</title>
      <link>https://nalar.dev/id/seimbangkan-routing-token-pada-model-sparse-mixture-of-experts/</link>
      <pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/seimbangkan-routing-token-pada-model-sparse-mixture-of-experts/</guid>
      <description>&lt;p&gt;Layer sparse mixture-of-experts dapat memiliki banyak jaringan expert sambil hanya mengevaluasi sebagian kecil untuk setiap token. Router memungkinkan sparsitas ini: router memberi skor pada expert, memilih sejumlah kecil expert, lalu mengirim setiap token melalui jalur komputasi yang dipilih.&lt;/p&gt;&#xA;&lt;p&gt;Pemilihan tersebut bukan sekadar detail optimisasi. Jika banyak token terkonsentrasi pada sedikit expert, sebagian device dapat menerima jauh lebih banyak pekerjaan daripada yang lain, batas kapasitas dapat membuang atau mengalihkan assignment, dan expert yang menerima sedikit traffic memperoleh lebih sedikit gradient dari task. Karena itu, keseimbangan router memengaruhi komputasi sekaligus fungsi yang direpresentasikan model.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Kelompokkan Panjang Sequence untuk Mengurangi Padding yang Terbuang</title>
      <link>https://nalar.dev/id/kelompokkan-panjang-sequence-untuk-mengurangi-padding-yang-terbuang/</link>
      <pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/kelompokkan-panjang-sequence-untuk-mengurangi-padding-yang-terbuang/</guid>
      <description>&lt;p&gt;Batch berpadding dibentuk oleh sequence terpanjang, bukan panjang rata-ratanya. Jika sebuah batch berisi jumlah token &lt;code&gt;120&lt;/code&gt;, &lt;code&gt;124&lt;/code&gt;, &lt;code&gt;131&lt;/code&gt;, dan &lt;code&gt;900&lt;/code&gt;, setiap sequence dapat direpresentasikan dengan panjang &lt;code&gt;900&lt;/code&gt;. Sebagian besar posisi pada tiga baris pertama kemudian berisi padding, bukan token input.&lt;/p&gt;&#xA;&lt;p&gt;Length bucketing mengubah komposisi batch tanpa mengubah model. Contoh dengan jumlah token serupa ditempatkan berdekatan sebelum batch dibentuk. Panjang maksimum dalam setiap batch menjadi lebih dekat dengan panjang anggotanya, sehingga jumlah posisi padding yang diproses oleh operasi yang masih memakai bentuk batch persegi panjang berkurang.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Akumulasi Gradien di Beberapa Microbatch</title>
      <link>https://nalar.dev/id/akumulasi-gradien-di-beberapa-microbatch/</link>
      <pubDate>Mon, 14 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/akumulasi-gradien-di-beberapa-microbatch/</guid>
      <description>&lt;p&gt;Sebuah batch pelatihan dapat melampaui kapasitas memori accelerator meskipun parameter model dan state optimizer masih muat dengan nyaman. Aktivasi dari forward pass sering mengambil porsi besar dari sisa penggunaan memori, dan biayanya bertambah seiring jumlah contoh yang diproses bersama.&lt;/p&gt;&#xA;&lt;p&gt;Gradient accumulation membagi batch logis yang lebih besar menjadi beberapa microbatch. Setiap microbatch menjalankan forward dan backward pass sendiri, tetapi optimizer menunggu sampai beberapa backward pass berkontribusi ke gradien parameter. Pola ini mengurangi memori aktivasi yang diperlukan untuk satu pass tanpa memaksa pembaruan optimizer setelah setiap microbatch.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Direct Preference Optimization untuk Alignment LLM</title>
      <link>https://nalar.dev/id/direct-preference-optimization-untuk-alignment-llm/</link>
      <pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/direct-preference-optimization-untuk-alignment-llm/</guid>
      <description>&lt;p&gt;Supervised fine-tuning dapat membuat model bahasa meniru jawaban yang baik, tetapi banyak persoalan alignment lebih mudah dinyatakan sebagai perbandingan: dari dua respons untuk prompt yang sama, respons mana yang lebih baik?&lt;/p&gt;&#xA;&lt;p&gt;Dataset preferensi menangkap sinyal itu sebagai tripel yang berisi prompt, respons pilihan, dan respons yang ditolak. Tantangannya adalah mengubah perbandingan tersebut menjadi pembaruan model tanpa memperlakukan preferensi subjektif sebagai target next-token biasa.&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;Direct Preference Optimization (DPO)&lt;/strong&gt; menawarkan satu pendekatan praktis. DPO melatih policy model agar meningkatkan preferensi relatif terhadap respons pilihan dibanding respons yang ditolak, sambil mengukur perubahan itu terhadap model referensi yang tetap. Berbeda dari pipeline reinforcement learning from human feedback yang umum, DPO standar tidak memerlukan pelatihan reward model terpisah lalu menjalankan optimizer reinforcement learning.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
