<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Direct Preference Optimization on Nalar</title>
    <link>https://nalar.dev/id/tags/direct-preference-optimization/</link>
    <description>Recent content in Direct Preference Optimization on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Sat, 12 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/direct-preference-optimization/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Selaraskan LLM dengan Direct Preference Optimization</title>
      <link>https://nalar.dev/id/selaraskan-llm-dengan-direct-preference-optimization/</link>
      <pubDate>Sat, 12 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/selaraskan-llm-dengan-direct-preference-optimization/</guid>
      <description>&lt;h1 id=&#34;selaraskan-llm-dengan-direct-preference-optimization&#34;&gt;Selaraskan LLM dengan Direct Preference Optimization&lt;/h1&gt;&#xA;&lt;p&gt;Supervised fine-tuning bekerja baik ketika Anda dapat menyediakan respons target untuk setiap prompt. Pendekatan ini menjadi kurang alami ketika sinyalnya bersifat komparatif: satu jawaban lebih disukai daripada jawaban lain, tetapi keduanya bukan target sempurna untuk disalin. &lt;strong&gt;Direct Preference Optimization (DPO)&lt;/strong&gt; mengubah pasangan preferensi tersebut menjadi objektif pelatihan untuk model bahasa tanpa memerlukan reward model yang dilatih terpisah atau tahap reinforcement learning secara online.&lt;/p&gt;&#xA;&lt;p&gt;Kesederhanaan ini membuat DPO menarik untuk gaya respons, kepatuhan terhadap instruksi, dan tugas lain ketika penilaian berpasangan lebih mudah dikumpulkan daripada completion ideal. Metode ini tetap memiliki batasan penting. Perilakunya bergantung pada data preferensi, kebijakan referensi yang tetap, dan kekuatan regularisasi yang mengendalikan seberapa agresif kebijakan hasil tuning menjauh dari referensi tersebut.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
