Langsung ke konten

Arsip

Pencarian Vektor

5 artikel
Kecerdasan Buatan 24 Sep 2026 4 min read

Anisotropi Embedding Memampatkan Rentang Cosine Similarity

Dua kandidat embedding dapat memiliki kecocokan semantik yang berbeda tetapi memperoleh skor cosine dalam interval yang sempit. Implementasi fungsi similarity belum tentu bermasalah. Pemampatan tersebut dapat berasal dari geometri ruang embedding: vektor cenderung menempati arah tertentu alih-alih tersebar merata pada dimensi yang tersedia. Konsentrasi arah ini umum disebut anisotropi. Anisotropi berpengaruh pada retrieval karena cosine similarity mengukur alignment sudut. Ketika banyak vektor memiliki komponen bersama yang cukup besar, pasangan yang tidak berkaitan dapat memiliki baseline alignment yang lebih tinggi. Pasangan relevan masih dapat memperoleh skor lebih tinggi, tetapi jarak skor yang tersedia antara kandidat relevan dan tidak relevan dapat menyempit.

Kecerdasan Buatan 23 Sep 2026 4 min read

Normalisasi L2 Mengubah Dot Product Embedding Menjadi Cosine Similarity

Dua vektor embedding dapat mengarah hampir sama tetapi memiliki magnitudo yang sangat berbeda. Dot product mentah merespons kedua sifat tersebut. Normalisasi L2 menghapus komponen magnitudo, sehingga operasi dot product yang sama berubah menjadi perbandingan arah. Perubahan ini bukan sekadar penyesuaian numerik. Objektif retrieval ikut berubah ketika norm vektor membawa informasi atau berbeda antar-item. Dot product memuat komponen magnitudo Untuk vektor nonzero (x) dan (y), [ x \cdot y = |x|_2 |y|_2 \cos(\theta), ]

Kecerdasan Buatan 22 Sep 2026 6 min read

Cosine Similarity Mengabaikan Magnitudo Embedding

Dua vektor embedding dapat mengarah ke arah yang sama meski memiliki norm yang sangat berbeda. Cosine similarity memberi keduanya skor arah yang sama. Raw dot product tidak demikian. Perbedaan ini menjadi batas implementasi ketika sistem retrieval mengganti metrik index, menormalisasi vektor saat ingestion, atau mencampur embedding dari pipeline yang berbeda. Persoalannya bukan menentukan satu metrik yang unggul untuk semua kasus. Yang perlu ditetapkan adalah apakah magnitudo vektor membawa informasi yang memang hendak dipertahankan oleh kontrak scoring. Setelah vektor dinormalisasi menjadi unit length, informasi magnitudo tersebut tidak lagi ikut dalam perhitungan similarity.

Kecerdasan Buatan 16 Sep 2026 5 min read

Kuantisasi Embedding Tanpa Menyamarkan Error Retrieval

Kuantisasi embedding mengganti nilai vektor berpresisi lebih tinggi dengan representasi yang lebih kecil. Pengurangan penyimpanan mudah diukur. Dampaknya terhadap retrieval tidak sesederhana itu: error numerik kecil bisa tidak berpengaruh untuk satu query, tetapi mengubah urutan kandidat untuk query lain ketika beberapa skor kemiripan berdekatan. Karena itu, kuantisasi merupakan persoalan peringkat, bukan sekadar pilihan format penyimpanan. Pertanyaan yang relevan adalah bagaimana representasi terkompresi mengubah perbandingan yang digunakan untuk memilih tetangga terdekat.

Kecerdasan Buatan 15 Sep 2026 4 min read

Memperhitungkan Hubness dalam Retrieval Embedding

Sebuah indeks embedding dapat mengembalikan beberapa item yang sama untuk banyak query yang tidak berkaitan. Skor similarity-nya mungkin tampak biasa, dan algoritma nearest-neighbor bisa saja bekerja dengan benar. Distorsi tersebut dapat berasal dari geometri representasi itu sendiri: beberapa vektor menjadi neighbor bagi jumlah vektor lain yang tidak lazim banyaknya. Efek ini umum disebut hubness. Hubness penting karena retrieval nearest-neighbor biasanya ditafsirkan secara lokal. Sebuah query meminta vektor tersimpan yang paling dekat dengannya, tetapi indeks biasanya tidak menunjukkan seberapa sering setiap kandidat juga muncul dekat dengan query lain. Kandidat yang berulang kali menempati daftar neighbor dapat memperoleh peluang retrieval lebih besar daripada yang layak berdasarkan relevansi semantiknya.