Dua kandidat embedding dapat memiliki kecocokan semantik yang berbeda tetapi memperoleh skor cosine dalam interval yang sempit. Implementasi fungsi similarity belum tentu bermasalah. Pemampatan tersebut dapat berasal dari geometri ruang embedding: vektor cenderung menempati arah tertentu alih-alih tersebar merata pada dimensi yang tersedia. Konsentrasi arah ini umum disebut anisotropi.
Anisotropi berpengaruh pada retrieval karena cosine similarity mengukur alignment sudut. Ketika banyak vektor memiliki komponen bersama yang cukup besar, pasangan yang tidak berkaitan dapat memiliki baseline alignment yang lebih tinggi. Pasangan relevan masih dapat memperoleh skor lebih tinggi, tetapi jarak skor yang tersedia antara kandidat relevan dan tidak relevan dapat menyempit.
Arah bersama menggeser distribusi skor
Secara skematis, embedding dapat digambarkan sebagai komponen bersama ditambah variasi spesifik item:
x = c + r_x
y = c + r_yDi sini c adalah arah yang muncul pada banyak vektor, sedangkan r_x dan r_y memuat variasi spesifik tiap item. Dekomposisi ini bersifat deskriptif dan bukan jaminan mengenai model embedding tertentu.
Jika komponen bersama memberi kontribusi besar pada arah vektor, dot product memuat suku dari c · c selain suku spesifik item. Setelah normalisasi L2, cosine similarity tetap mencerminkan arah yang dihasilkan. Normalisasi menetapkan panjang vektor; normalisasi tidak menghapus komponen arah yang sama.
Perbedaan tersebut relevan dalam implementasi. Sistem dapat menormalisasi setiap vektor dengan benar tetapi tetap menghasilkan cosine similarity yang terkonsentrasi dalam rentang positif yang relatif sempit. Menganggap normalisasi sebagai koreksi lengkap atas geometri representasi dapat menutupi sumber pemampatan skor yang sebenarnya.
Rentang skor sempit mengubah perilaku threshold
Sebuah threshold cosine hanya bermakna relatif terhadap distribusi skor dari model embedding, korpus, pipeline preprocessing, dan populasi query tertentu. Nilai seperti 0.8 bukan batas semantik universal.
Misalkan hasil relevan cenderung berada pada satu rentang skor dan hasil tidak relevan pada rentang lain. Jika anisotropi menaikkan baseline bersama dan memampatkan kedua rentang, nilai numeriknya dapat menjadi lebih dekat walaupun ranking masih cukup berguna. Threshold yang disalin dari model atau korpus lain kemudian dapat menerima terlalu banyak kandidat atau menolak kandidat yang valid.
Target diagnosis bukan sekadar rata-rata skor cosine. Bandingkan distribusi skor pasangan yang diketahui relevan dan tidak relevan, lalu periksa tumpang tindihnya. Bandingkan juga pasangan acak atau tidak cocok dengan pasangan query-kandidat. Jika pasangan yang tidak berkaitan sudah memiliki similarity positif yang cukup besar, besarnya skor absolut membawa informasi lebih sedikit dibanding ruang dengan baseline alignment yang lebih rendah.
Metrik ranking dan metrik threshold memperlihatkan konsekuensi yang berbeda. Sistem retrieval dapat mempertahankan urutan yang berguna tetapi memiliki pemisahan buruk untuk threshold penerimaan tetap. Sebaliknya, transformasi yang memperlebar skor secara numerik belum tentu berguna jika merusak urutan relevansi.
Mean centering mengubah sistem koordinat
Salah satu transformasi geometri yang mungkin dilakukan adalah mengurangi estimasi vektor mean:
x_centered = x - μdengan μ diestimasi dari set referensi. Operasi ini menghilangkan momen pertama dari distribusi referensi tersebut. Hasilnya tidak menjamin ruang menjadi isotropik karena covariance masih dapat memiliki arah dominan.
Set referensi juga menentukan hasil. Mean yang diestimasi dari satu korpus atau distribusi traffic belum tentu mewakili distribusi lain. Jika data produksi bergeser, transformasi dapat tidak lagi selaras dengan vektor yang diproses. Embedding query dan dokumen juga harus tetap kompatibel di bawah transformasi yang digunakan untuk menghitung similarity.
Transformasi yang lebih agresif dapat menskalakan ulang arah berdasarkan struktur covariance atau menekan komponen dominan. Operasi semacam itu mengubah geometri yang dihasilkan model embedding. Konsentrasi arah dapat berkurang menurut ukuran tertentu, tetapi dimensi yang membawa sinyal relevan untuk tugas juga dapat ikut berkurang. Keseragaman geometri bukan tujuan retrieval itu sendiri.
Anisotropi dan hubness adalah observasi berbeda
Anisotropi menggambarkan konsentrasi arah dalam distribusi vektor. Hubness menggambarkan kandidat yang muncul dengan frekuensi tidak biasa dalam daftar nearest-neighbor. Keduanya dapat muncul bersamaan, dan geometri representasi dapat berkontribusi pada keduanya, tetapi salah satunya tidak membuktikan yang lain.
Pemisahan ini mencegah diagnosis yang keliru. Distribusi cosine yang sempit tidak membuktikan bahwa sejumlah kecil kandidat mendominasi retrieval. Sebaliknya, nearest neighbor yang berulang tidak langsung menunjukkan satu arah global sebagai penyebab. Analisis distribusi skor dan analisis frekuensi neighbor mengukur sifat berbeda dan sebaiknya tetap dipisahkan saat evaluasi.
Approximate nearest-neighbor indexing juga merupakan lapisan yang berbeda. Indeks dapat menimbulkan recall error dibanding exact search, tetapi tidak membentuk distribusi embedding dasarnya. Membandingkan sampel exact search yang ukurannya terkendali dengan retrieval produksi membantu memisahkan approximation index dari geometri representasi.
Diagnosis geometri memerlukan label tugas
Anisotropi dapat diukur tanpa label relevansi, tetapi penentuan dampaknya memerlukan kriteria pada level tugas. Histogram cosine berpasangan, vektor mean, arah utama, dan ringkasan covariance dapat menunjukkan konsentrasi. Tidak satu pun pengukuran tersebut secara mandiri membuktikan bahwa kualitas retrieval buruk.
Untuk aplikasi retrieval, pengujian yang berguna menghubungkan geometri dengan keputusan. Bandingkan distribusi skor relevan dan tidak relevan, kualitas ranking, pola error threshold, serta frekuensi kemunculan kandidat sebelum dan sesudah transformasi. Pertahankan model embedding, potongan korpus, dan query evaluasi tetap terkontrol jika memungkinkan agar perubahan geometri tidak tercampur dengan perubahan data.
Batas implementasinya jelas: anisotropi merupakan sifat distribusi representasi, sedangkan kualitas retrieval merupakan sifat gabungan representasi, data, aturan similarity, indexing, dan tujuan aplikasi. Distribusi geometri yang lebih lebar atau lebih seragam hanya berguna jika perubahan tersebut memperbaiki keputusan yang harus dibuat oleh sistem retrieval.