Kuantisasi embedding mengganti nilai vektor berpresisi lebih tinggi dengan representasi yang lebih kecil. Pengurangan penyimpanan mudah diukur. Dampaknya terhadap retrieval tidak sesederhana itu: error numerik kecil bisa tidak berpengaruh untuk satu query, tetapi mengubah urutan kandidat untuk query lain ketika beberapa skor kemiripan berdekatan.

Karena itu, kuantisasi merupakan persoalan peringkat, bukan sekadar pilihan format penyimpanan. Pertanyaan yang relevan adalah bagaimana representasi terkompresi mengubah perbandingan yang digunakan untuk memilih tetangga terdekat.

Kuantisasi mengganggu vektor sebelum mengganggu peringkat

Pertimbangkan embedding tersimpan x dan rekonstruksi hasil kuantisasinya x_hat. Kuantisasi memperkenalkan vektor error:

e = x_hat - x

Untuk query q, skor inner product berubah dari q · x menjadi q · x_hat. Maka error skornya adalah:

q · e

Besarnya e saja tidak menentukan apakah hasil retrieval berubah. Arah error relatif terhadap query juga berpengaruh, begitu pula margin skor antara kandidat yang berdekatan. Jika dua kandidat memiliki skor presisi penuh yang hampir sama, perturbasi kecil dapat membalik urutannya. Sebaliknya, perturbasi yang lebih besar dapat tidak mengubah query yang mudah ketika kandidat relevan memiliki margin lebar.

Ini juga alasan untuk tidak memperlakukan reconstruction error sebagai metrik retrieval yang lengkap. Mean squared error pada komponen vektor menggambarkan fidelitas numerik, sedangkan retrieval bergantung pada urutan berdasarkan fungsi kemiripan yang digunakan aplikasi.

Quantizer menentukan informasi yang dibuang

Scalar quantizer memetakan masing-masing komponen vektor ke kumpulan nilai representabel yang lebih kecil. Skema uniform sederhana dapat menggunakan scale dan kode integer per komponen, lalu merekonstruksi aproksimasi saat scoring. Pemetaan yang tepat, clipping range, granularitas scale, dan lebar integer menentukan error yang dihasilkan.

Representasi biner melakukan kompresi lebih agresif dengan mempertahankan informasi yang jauh lebih sedikit per dimensi. Operasi scoring dan interpretasi geometrinya dapat berbeda dari metrik floating-point asli, sehingga tidak semestinya dianggap sebagai numeric cast yang transparan.

Product quantization menggunakan pendekatan lain. Vektor dibagi menjadi subvektor dan setiap subvektor direpresentasikan oleh entri dari codebook. Similarity atau distance kemudian dapat diperkirakan dari kode ringkas dan lookup table. Ukuran codebook, pembagian subvektor, dan data yang digunakan untuk membentuk codebook memengaruhi aproksimasi.

Semua metode ini mengurangi biaya representasi, tetapi membuang informasi dengan struktur berbeda. Satu label seperti “quantized embeddings” tidak cukup untuk memprediksi perilaku peringkat.

Normalisasi dan pilihan metrik tetap terkait dengan kompresi

Cosine retrieval sering diimplementasikan dengan menormalisasi vektor lalu menggunakan inner product. Kuantisasi dapat mengganggu norm vektor, sehingga titik tempat normalisasi dilakukan menjadi penting.

Jika unit vector dikuantisasi lalu direkonstruksi, vektor hasil rekonstruksi tidak dijamin tetap memiliki norm satu. Menormalisasi ulang vektor rekonstruksi kembali mengubah koordinatnya. Jika normalisasi ulang dilewati, inner product tidak lagi persis sama dengan cosine similarity dari vektor rekonstruksi kecuali norm-nya tetap satu.

Sistem juga dapat memakai aturan scoring terkuantisasi yang dirancang untuk representasinya. Kuncinya adalah mengevaluasi jalur yang sama dengan yang digunakan saat serving. Mengukur satu metrik pada vektor presisi penuh lalu menerapkan operasi lain pada kode terkompresi menciptakan celah antara hasil offline dan fungsi peringkat sebenarnya.

Approximate indexing dapat menyamarkan error kuantisasi

Kuantisasi dan approximate nearest-neighbor search memperkenalkan sumber ketidaksesuaian yang berbeda terhadap exhaustive full-precision retrieval. Menggabungkan keduanya dalam satu perbandingan membuat diagnosis lebih sulit.

Evaluasi yang berguna memisahkan tiga kumpulan hasil: exhaustive full-precision search, exhaustive atau pencarian terkontrol lain dengan representasi terkuantisasi, dan production approximate index. Perbandingan pertama mengisolasi perubahan akibat kompresi. Perbandingan kedua menambahkan aproksimasi indeks yang digunakan saat serving.

Pemisahan ini penting ketika tuning indeks. Menambah search effort dapat memulihkan kandidat yang terlewat oleh approximate traversal, tetapi tidak dapat mengembalikan perbedaan yang sudah hilang dari representasi terkuantisasi. Sebaliknya, menaikkan presisi vektor tidak memperbaiki kandidat yang dilewati karena pencarian indeks berhenti terlalu awal.

Candidate generation dapat memakai presisi lebih rendah daripada final scoring

Pipeline retrieval tidak harus menggunakan satu representasi untuk setiap tahap. Vektor ringkas dapat menghasilkan candidate set, sedangkan vektor presisi penuh yang tetap disimpan dapat melakukan rescore terhadap set yang lebih kecil sebelum hasil teratas dipilih.

Susunan ini mengubah batas kegagalan. Reranking dapat memperbaiki kesalahan urutan di antara kandidat yang lolos dari pencarian terkompresi, tetapi tidak dapat memulihkan item yang sudah dihilangkan oleh candidate generation terkuantisasi. Karena itu, candidate-set recall menjadi pengukuran utama ketika full-precision rescoring mengikuti quantized retrieval.

Ukuran candidate set mengendalikan sebagian batas ini. Set yang lebih besar memberi rescoring lebih banyak peluang untuk memulihkan urutan yang diinginkan, dengan biaya tambahan read dan comparison. Titik operasi yang berguna bergantung pada corpus, distribusi query, latency budget, dan kriteria relevansi, bukan hanya compression ratio.

Evaluasi stabilitas peringkat pada query yang representatif

Kuantisasi sebaiknya dievaluasi terhadap perilaku retrieval yang penting bagi aplikasi. Kesesuaian persis dengan hasil teratas presisi penuh berguna sebagai diagnostik, tetapi tidak identik dengan kualitas relevansi. Peringkat terkuantisasi dapat berbeda dari peringkat presisi penuh tanpa mengubah relevansi aplikasi, dan peringkat presisi penuh tidak otomatis menjadi relevance oracle.

Pengukuran yang berguna dapat mencakup candidate recall relatif terhadap exhaustive search, overlap antara top-k set, perubahan rank untuk item relevan yang telah dinilai, dan metrik relevansi yang sudah digunakan aplikasi. Pisahkan hasil berdasarkan tipe query ketika margin skor atau distribusi embedding berbeda antarsegmen traffic.

Pertahankan quantizer yang sama selama perbandingan indeks. Mengubah presisi vektor, codebook, dan parameter pencarian secara bersamaan dapat meningkatkan metrik agregat tanpa menunjukkan perubahan mana yang menjadi penyebabnya.

Kuantisasi embedding paling dapat diprediksi ketika kompresi diperlakukan sebagai bagian dari fungsi retrieval. Penghematan storage menjelaskan biaya representasi; pengukuran peringkat menjelaskan apa yang masih dipertahankan representasi tersebut. Memisahkan kedua pertanyaan ini memungkinkan pemilihan presisi berdasarkan error retrieval yang dapat diamati, bukan hanya jumlah byte.