<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Alignment LLM on Nalar</title>
    <link>https://nalar.dev/id/tags/alignment-llm/</link>
    <description>Recent content in Alignment LLM on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Sun, 06 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/alignment-llm/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Direct Preference Optimization untuk Alignment LLM</title>
      <link>https://nalar.dev/id/direct-preference-optimization-untuk-alignment-llm/</link>
      <pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/direct-preference-optimization-untuk-alignment-llm/</guid>
      <description>&lt;p&gt;Supervised fine-tuning dapat membuat model bahasa meniru jawaban yang baik, tetapi banyak persoalan alignment lebih mudah dinyatakan sebagai perbandingan: dari dua respons untuk prompt yang sama, respons mana yang lebih baik?&lt;/p&gt;&#xA;&lt;p&gt;Dataset preferensi menangkap sinyal itu sebagai tripel yang berisi prompt, respons pilihan, dan respons yang ditolak. Tantangannya adalah mengubah perbandingan tersebut menjadi pembaruan model tanpa memperlakukan preferensi subjektif sebagai target next-token biasa.&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;Direct Preference Optimization (DPO)&lt;/strong&gt; menawarkan satu pendekatan praktis. DPO melatih policy model agar meningkatkan preferensi relatif terhadap respons pilihan dibanding respons yang ditolak, sambil mengukur perubahan itu terhadap model referensi yang tetap. Berbeda dari pipeline reinforcement learning from human feedback yang umum, DPO standar tidak memerlukan pelatihan reward model terpisah lalu menjalankan optimizer reinforcement learning.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
