Sebuah indeks embedding dapat mengembalikan beberapa item yang sama untuk banyak query yang tidak berkaitan. Skor similarity-nya mungkin tampak biasa, dan algoritma nearest-neighbor bisa saja bekerja dengan benar. Distorsi tersebut dapat berasal dari geometri representasi itu sendiri: beberapa vektor menjadi neighbor bagi jumlah vektor lain yang tidak lazim banyaknya. Efek ini umum disebut hubness.
Hubness penting karena retrieval nearest-neighbor biasanya ditafsirkan secara lokal. Sebuah query meminta vektor tersimpan yang paling dekat dengannya, tetapi indeks biasanya tidak menunjukkan seberapa sering setiap kandidat juga muncul dekat dengan query lain. Kandidat yang berulang kali menempati daftar neighbor dapat memperoleh peluang retrieval lebih besar daripada yang layak berdasarkan relevansi semantiknya.
Frekuensi neighbor menunjukkan sifat yang berbeda dari similarity
Cosine similarity atau metrik jarak menggambarkan hubungan antara sebuah query dan kandidat. Hubness adalah sifat kandidat pada sekumpulan query atau titik.
Misalkan sebuah set evaluasi berisi query q1 ... qm. Untuk setiap query, ambil k kandidat terdekat. Untuk kandidat x, hitung kemunculannya:
N_k(x) = jumlah daftar neighbor query yang memuat xNilai N_k(x) yang besar tidak dengan sendirinya membuktikan bahwa x bermasalah. Konsep yang memang umum dapat relevan untuk banyak query. Hitungan tersebut menjadi berguna saat dibandingkan dengan intent query, penilaian relevansi, metadata, atau distribusi hitungan di seluruh korpus.
Perbedaan ini mencegah kesalahan diagnosis yang umum. Hanya melihat nilai similarity tinggi dapat melewatkan kandidat yang cukup mirip dengan banyak jenis query. Skor individualnya mungkin tidak ekstrem, tetapi kemunculannya yang berulang tetap dapat membentuk ulang hasil retrieval.
Geometri berdimensi tinggi dapat membentuk hub
Relasi nearest-neighbor dalam ruang berdimensi tinggi tidak berperilaku seperti titik yang tersebar seragam pada bidang berdimensi rendah. Jarak dapat terkonsentrasi, dan variasi posisi sebuah vektor terhadap distribusi data dapat memengaruhi seberapa sering vektor itu menjadi neighbor.
Perilaku tepatnya bergantung pada distribusi embedding, dimensionalitas, fungsi similarity, normalisasi, dan korpus. Karena itu, hubness tidak seharusnya dianggap sebagai sifat otomatis dari setiap sistem embedding. Hubness adalah pola retrieval yang dapat diukur pada vektor dan query yang relevan bagi aplikasi.
Normalisasi juga mengubah geometri yang dicari. Dengan vektor yang dinormalisasi L2, cosine similarity dan squared Euclidean distance menghasilkan peringkat yang sama karena:
||a - b||² = 2 - 2(a · b)ketika ||a|| = ||b|| = 1. Normalisasi dapat menghilangkan magnitudo vektor dari pemeringkatan, tetapi tidak menjamin frekuensi neighbor menjadi seragam.
Approximate search dan hubness adalah persoalan terpisah
Indeks approximate nearest-neighbor dapat melewatkan sebagian neighbor eksak karena menukar perbandingan menyeluruh dengan biaya pencarian yang lebih rendah. Hubness berbeda. Sebuah vektor dapat menjadi hub bahkan pada pencarian eksak, sebab efek tersebut dapat sudah ada dalam geometri representasi sebelum indeks approximate dibuat.
Pemisahan ini penting saat diagnosis. Jika kandidat yang berulang tetap umum dalam evaluasi exact-search berskala kecil, mengubah kedalaman graph search, jumlah probe, atau parameter khusus indeks lainnya tidak dapat menghilangkan pola frekuensi neighbor yang mendasarinya. Pengaturan indeks dapat mengubah neighbor yang dikembalikan, tetapi itu tidak sama dengan memperbaiki representasi.
Perbandingan yang berguna mempertahankan vektor embedding dan metrik yang sama, lalu membandingkan hasil exact top-k dengan indeks produksi. Perbedaan besar menunjukkan adanya komponen aproksimasi. Pola kandidat berulang yang serupa pada kedua hasil lebih mengarah pada vektor, komposisi korpus, atau distribusi query.
Ukur hub terhadap trafik yang relevan
Menghitung neighbor pada setiap vektor tersimpan menjawab pertanyaan yang berbeda dari menghitungnya pada embedding query nyata. Yang pertama menggambarkan geometri korpus. Yang kedua menggambarkan eksposur retrieval untuk distribusi query tertentu.
Untuk diagnosis yang berorientasi aplikasi, hitung N_k pada set query representatif dan periksa ekor atas distribusi frekuensi kandidat. Padukan dengan data relevansi jika tersedia. Kandidat yang sering muncul dan sering relevan bukan failure mode yang sama dengan kandidat yang sering muncul pada intent yang tidak berkaitan.
Duplikasi korpus juga dapat meningkatkan pengulangan. Dokumen yang hampir duplikat dapat membentuk wilayah padat dan menempati beberapa posisi dalam satu hasil. Dari perspektif pengguna, kondisi itu dapat menyerupai masalah hubness meski penyebabnya lebih langsung berupa kualitas data. Memeriksa grup duplikat dan identifier sumber sebelum mengubah pipeline embedding membantu memisahkan kasus-kasus ini.
Mitigasi mengubah objektif retrieval
Metode yang mengurangi pengaruh hub umumnya menambahkan informasi di luar similarity mentah antara query dan kandidat. Sistem dapat menyesuaikan skor memakai statistik neighborhood, menghapus atau menggabungkan item duplikat yang bermasalah, mengganti representasi, atau melakukan reranking dengan sinyal yang mencerminkan relevansi spesifik terhadap query.
Setiap opsi mengubah komponen berbeda. Deduplication mengubah korpus. Model embedding baru mengubah geometri. Reranker mengubah urutan setelah candidate generation. Normalisasi skor berdasarkan statistik neighborhood mengubah cara similarity lokal ditafsirkan relatif terhadap ruang di sekitarnya.
Karena itu evaluasi offline tetap diperlukan. Mengurangi nilai maksimum N_k bukan objektif yang cukup karena sebagian kandidat berfrekuensi tinggi mungkin memang valid. Kualitas retrieval tetap perlu dievaluasi terhadap kriteria relevansi aplikasi, dengan pengukuran frekuensi hub sebagai alat diagnosis, bukan metrik pengganti.
Hubness paling berguna sebagai penjelasan untuk observasi tertentu: kandidat berulang di banyak daftar neighbor meski selaras secara lemah dengan intent query. Mengukur pengulangan tersebut secara terpisah dari similarity dan aproksimasi indeks memberi batas yang lebih jelas antara geometri representasi, komposisi korpus, dan implementasi pencarian.