<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Language Models on Nalar</title>
    <link>https://nalar.dev/id/tags/language-models/</link>
    <description>Recent content in Language Models on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 24 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/language-models/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Prediksi Multi-Token Menambahkan Loss Token Masa Depan Paralel pada Trunk Model Bersama</title>
      <link>https://nalar.dev/id/prediksi-multi-token-menambahkan-loss-token-masa-depan-paralel-pada-trunk-model-bersama/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/prediksi-multi-token-menambahkan-loss-token-masa-depan-paralel-pada-trunk-model-bersama/</guid>
      <description>&lt;p&gt;Model bahasa next-token biasanya menerapkan satu objektif prediksi pada posisi &lt;code&gt;t&lt;/code&gt;: representasi hidden pada posisi tersebut dipakai untuk memberi skor pada token &lt;code&gt;x_(t+1)&lt;/code&gt;. Prediksi multi-token mengubah batas training itu. Satu trunk model menghasilkan representasi bersama, lalu beberapa output head memprediksi sejumlah token sesudah posisi tersebut.&lt;/p&gt;&#xA;&lt;p&gt;Mekanisme ini menambahkan supervisi pada beberapa offset masa depan tanpa memerlukan trunk transformer terpisah untuk setiap offset. Jadi, perubahan utamanya berada pada objektif training dan prediction head, bukan jaminan bahwa generasi autoregresif biasa dapat mengeluarkan beberapa token tanpa pemeriksaan dalam satu langkah eksak.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
