<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>GQA on Nalar</title>
    <link>https://nalar.dev/id/tags/gqa/</link>
    <description>Recent content in GQA on Nalar</description>
    <generator>Hugo</generator>
    <language>id-id</language>
    <lastBuildDate>Wed, 23 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nalar.dev/id/tags/gqa/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Grouped-Query Attention Berbagi KV Head di Antara Grup Query</title>
      <link>https://nalar.dev/id/grouped-query-attention-berbagi-kv-head-di-antara-grup-query/</link>
      <pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://nalar.dev/id/grouped-query-attention-berbagi-kv-head-di-antara-grup-query/</guid>
      <description>&lt;p&gt;Grouped-query attention (GQA) mengubah satu rasio struktural di dalam layer attention: jumlah query head dapat lebih besar daripada jumlah key dan value head. Beberapa query head memakai key dan value head hasil proyeksi yang sama. Komputasi pada sisi query tetap terpisah per head, sedangkan state KV dibagi di dalam setiap grup.&lt;/p&gt;&#xA;&lt;p&gt;Asimetri ini berpengaruh langsung pada decoding autoregresif karena key dan value dari token sebelumnya disimpan di cache. Semakin sedikit KV head yang berbeda, semakin sedikit pula state KV per token yang perlu dipertahankan untuk langkah decoding berikutnya.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
