Transformer berbasis RoPE mengaitkan posisi token dengan rotasi yang sudutnya bergantung pada indeks posisi dan frekuensi per dimensi. Saat sequence melewati rentang konteks yang dipakai dalam pelatihan, rotasi tersebut memakai indeks posisi di luar rezim yang pernah dihadapi model. Position Interpolation mengubah batas itu dengan menskalakan indeks yang diperpanjang kembali ke rentang asli sebelum transformasi rotary diterapkan.

Untuk batas konteks asli L dan target konteks L' > L, pemetaan linear yang disederhanakan adalah:

p_scaled = p * L / L'

Mekanisme ini tidak menambah slot memori pada attention dan tidak membuat attention lebih murah. Yang berubah adalah koordinat posisi yang diberikan ke RoPE, sehingga sequence token yang lebih panjang menempati kumpulan posisi yang lebih rapat.

RoPE mengubah posisi menjadi fase

Pada setiap pasangan dimensi rotary, RoPE menerapkan rotasi dua dimensi dengan sudut yang proporsional terhadap posisi token. Secara skematis:

angle_i(p) = p * θ_i

p adalah indeks posisi dan θ_i adalah frekuensi untuk pasangan dimensi tersebut. Query dan key dirotasi sebelum dot product dihitung. Skor attention yang dihasilkan dipengaruhi selisih fase relatif, yang membawa informasi posisi relatif melalui konstruksi rotary.

Jika model dilatih hanya pada posisi sampai batas konteks tertentu, penggunaan langsung pada indeks yang jauh lebih besar merupakan ekstrapolasi fase posisi. Arsitektur tetap dapat menghitung rotasi tersebut, tetapi kemampuan menghitung secara matematis tidak membuktikan bahwa perilaku attention model tetap terkalibrasi pada rentang itu.

Position Interpolation memetakan posisi target p ke koordinat yang lebih kecil. Dengan faktor skala s = L / L', fase menjadi:

angle_i(p) = (s * p) * θ_i

Pada batas target, koordinat hasil skala tetap berada kira-kira di dalam rentang posisi asli.

Pemampatan mengubah jarak fase relatif

Menskalakan indeks absolut juga menskalakan selisih posisi antartoken. Untuk dua posisi token p dan q:

Δp_scaled = s * (p - q)

Ini adalah konsekuensi utama interpolasi. Dua token yang berjarak satu posisi dalam geometri sequence target menjadi berjarak kurang dari satu unit posisi asli pada koordinat yang diberikan ke RoPE saat s < 1.

Model tidak menerima geometri posisi lama dengan ruang tambahan yang ditempel di ujung. Seluruh sequence yang diperpanjang dimampatkan. Selisih fase relatif menjadi lebih kecil dibanding RoPE tanpa skala pada jarak token yang sama.

Perbedaan ini penting pada implementasi. Parameter konteks tidak dapat sekadar dinaikkan sambil membiarkan transformasi posisi tetap sama lalu disebut Position Interpolation. Operasi scaling merupakan bagian dari perilaku posisi efektif model.

Tetap di dalam rentang tidak mempertahankan distribusi asli

Interpolasi menghindari indeks posisi yang lebih besar, tetapi menghasilkan koordinat posisi yang lebih rapat. Koordinat efektif tersebut dapat berupa pecahan walaupun indeks token tetap berupa bilangan bulat.

Model dengan RoPE biasa dilatih pada hubungan tertentu antara jarak token dan selisih fase. Setelah interpolasi, rentang sintaksis atau semantik yang sama dapat menghasilkan perpindahan rotary yang lebih kecil. Model harus beroperasi dengan jarak baru tersebut.

Karena itu, ekstensi konteks dan adaptasi model perlu dipisahkan dari konfigurasi serving. Mengubah panjang sequence maksimum dapat membuat tensor dan cache menampung lebih banyak token, tetapi tindakan tersebut tidak dengan sendirinya menyesuaikan perilaku attention terhadap koordinat rotary yang dimampatkan.

Karya Position Interpolation asli menerapkan fine-tuning setelah pemetaan posisi diubah. Detail ini bersifat material: interpolasi mendefinisikan sistem koordinat baru, sedangkan adaptasi memaparkan model pada sistem tersebut. Deployment yang hanya mengubah batas panjang konteks tidak setara dengan metode yang dideskripsikan.

Faktor skala terikat pada target konteks

Faktor linear menyatakan rasio ekstensi tertentu. Ekstensi dari L ke 2L menghasilkan kepadatan koordinat yang berbeda dari ekstensi ke 4L. Checkpoint yang diadaptasi untuk satu rezim scaling membawa asumsi tentang pemetaan posisi yang digunakan saat adaptasi.

Sebagian stack serving menyediakan konfigurasi RoPE scaling secara terpisah dari file model. Fleksibilitas ini menciptakan batas implementasi: konfigurasi runtime harus sesuai dengan skema posisi yang diharapkan checkpoint. Nilai skala yang valid secara sintaks tetap dapat menghasilkan perilaku model yang berbeda.

Hal ini juga mempersulit perbandingan sistem konteks panjang. Dua model dapat menawarkan jumlah token maksimum yang sama sambil memakai metode rotary scaling, data adaptasi, atau implementasi attention yang berbeda. Batas konteks yang sama tidak berarti geometri posisi atau perilaku di dekat batas tersebut juga sama.

Ukuran KV cache tetap bertambah bersama token yang dipertahankan

Position Interpolation mengubah positional encoding, bukan jumlah riwayat yang disimpan oleh full attention standar. Selama decoding autoregresif, KV cache konvensional tetap menyimpan state key dan value untuk token sebelumnya sesuai arsitektur model dan implementasi serving.

Ekstensi konteks yang dapat dipakai karena itu dapat meningkatkan kebutuhan cache karena lebih banyak state token dapat tetap resident. Rumus interpolasi tidak mengurangi kebutuhan penyimpanan tersebut. Teknik seperti grouped-query attention, kuantisasi cache, eviction, atau paged allocation menangani bagian lain dari persoalan serving.

Biaya komputasi attention juga merupakan persoalan terpisah. Jika model menggunakan full causal attention, pemampatan posisi tidak mengubahnya menjadi sparse, local, atau linear attention. Ekstensi konteks dapat memunculkan batas memori dan komputasi yang sebelumnya kurang terlihat pada panjang sequence asli.

Evaluasi perlu mencakup posisi dan panjang

Pemeriksaan konteks panjang yang hanya memastikan alokasi berhasil belum cukup. Model dapat menerima sequence panjang tanpa menggunakan informasi jauh secara konsisten.

Evaluasi sebaiknya menempatkan informasi relevan pada posisi dan jarak yang bervariasi karena transformasi posisi bekerja di seluruh sequence. Pengujian yang terkonsentrasi hanya di awal atau akhir dapat melewatkan perubahan perilaku pada rentang relatif lain. Perilaku konteks pendek juga tetap relevan karena interpolasi mengubah jarak fase token di dalam sequence yang diperpanjang.

Metrik tugas perlu dipisahkan dari metrik runtime. Generasi yang berhasil, cache yang tetap resident, dan latensi yang dapat diterima menunjukkan kelayakan serving. Retrieval dari konteks jauh, konsistensi lintas posisi, atau akurasi spesifik tugas mengukur perilaku model. Keduanya tidak saling menggantikan.

Batas Position Interpolation tetap sempit

Mekanismenya spesifik: skalakan indeks posisi RoPE agar sequence yang diperpanjang dipetakan ke rentang posisi asli, lalu gunakan koordinat yang dimampatkan itu dalam rotary attention. Mekanisme ini tidak menciptakan kapasitas attention tambahan, tidak mengurangi pertumbuhan KV cache, dan tidak menjamin sebuah checkpoint dapat menerima rasio ekstensi sembarang.

Batas tersebut berguna pada deployment. Panjang konteks, pemetaan posisi, adaptasi checkpoint, kapasitas cache, dan evaluasi merupakan permukaan konfigurasi yang berbeda. Pemisahan ini membantu menentukan apakah kegagalan konteks panjang berasal dari perilaku posisi, adaptasi model, tekanan memori, atau lapisan serving, alih-alih mengaitkan seluruh kegagalan pada satu pengaturan context window.