<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Sparse Models on Nalar</title>
    <link>https://nalar.dev/id/tags/sparse-models/</link>
    <description>Recent content in Sparse Models on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Thu, 24 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/sparse-models/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Kapasitas Expert Mengubah Routing MoE yang Timpang Menjadi Token Overflow</title>
      <link>https://nalar.dev/id/id/kapasitas-expert-mengubah-routing-moe-yang-timpang-menjadi-token-overflow/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/id/kapasitas-expert-mengubah-routing-moe-yang-timpang-menjadi-token-overflow/</guid>
      <description>&lt;p&gt;Layer Mixture-of-Experts yang sparse dapat mengarahkan banyak token ke expert yang sama walaupun setiap expert memiliki kapasitas nominal identik. Router membuat pilihan berdasarkan token, sedangkan eksekusi terdistribusi lazimnya menyediakan slot token yang terbatas untuk setiap expert. Ketika dua mekanisme itu tidak selaras, jumlah assignment dapat melampaui buffer eksekusi expert.&lt;/p&gt;&#xA;&lt;p&gt;Batas tersebut bukan sifat bawaan seluruh arsitektur MoE. Batas itu muncul pada desain routing dengan kapasitas terbatas, termasuk formulasi routing pada Switch Transformers. Pada sistem semacam ini, kapasitas expert mengubah distribusi routing yang timpang menjadi kondisi operasional: sebagian assignment masuk ke slot yang tersedia, sedangkan sisanya harus mengikuti kebijakan overflow yang eksplisit.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
