Satu embedding memadatkan seluruh query atau document menjadi satu vector sebelum similarity dihitung. Representasi ini praktis untuk approximate nearest-neighbor search, tetapi setiap sinyal tingkat token harus berhasil bertahan melewati tahap kompresi tersebut. Late interaction retrieval mempertahankan properti independent encoding sambil menunda sebagian perbandingan query-document hingga search time.

Perubahan utamanya ada pada representasi. Alih-alih menyimpan satu vector per document, model late interaction dapat mempertahankan sekumpulan contextual token vector. Query juga direpresentasikan dengan beberapa vector. Relevance kemudian dihitung dari interaksi antara dua himpunan tersebut, bukan dari satu global dot product.

Pendekatan ini menciptakan posisi tengah antara single-vector retrieval dan cross-encoder scoring: representasi document dapat dihitung sebelumnya, sementara token query tetap dapat dicocokkan dengan token document secara individual.

Independent encoding membuat document dapat digunakan ulang

Cross-encoder memproses query dan document bersama-sama. Attention layer-nya dapat memodelkan interaksi rinci di antara keduanya, tetapi hasil komputasinya bergantung pada kedua input. Sebuah document tidak dapat diencode sepenuhnya sekali lalu digunakan ulang untuk query arbitrer di masa depan.

Late interaction memisahkan contextual encoding yang mahal. Document encoder menghasilkan vector tingkat token tanpa melihat query yang nantinya datang, sehingga vector-vector tersebut dapat dihitung sebelum request masuk. Query encoder melakukan hal yang sama untuk query yang datang.

Hanya tahap interaction yang bergantung pada pasangan query-document. Dalam formulasi ColBERT, tahap ini sengaja dibuat cukup sederhana untuk berjalan di atas document vector yang sudah dihitung sebelumnya.

Pemisahan ini penting secara operasional. Ia memindahkan transformer encoding terhadap corpus keluar dari request path, tetapi tidak mereduksi setiap document menjadi satu titik di embedding space.

MaxSim mempertahankan kecocokan token terkuat

Skor late interaction yang umum menggunakan operasi maximum similarity untuk setiap query vector. Untuk query vector q_i dan document vector d_j, skornya secara konseptual dapat ditulis sebagai

score(Q, D) = sum_i max_j similarity(q_i, d_j)

Setiap representasi token query mencari representasi token document dengan kecocokan terkuat. Nilai maksimum tersebut kemudian dijumlahkan untuk seluruh query.

Operasi ini memiliki konsekuensi spesifik: token query yang berbeda dapat memilih posisi document yang berbeda. Sebuah document tidak memerlukan satu global vector yang sekaligus merepresentasikan setiap aspek query.

Contextual encoding tetap penting sebelum perbandingan ini. Token vector mencerminkan teks di sekitarnya, sehingga surface token yang identik dapat memperoleh representasi berbeda pada konteks berbeda. Interaksinya bersifat token-granular, tetapi bukan sekadar lexical matching.

MaxSim juga membuang informasi. Untuk setiap query vector, seluruh document similarity selain nilai maksimum hilang dari final sum. Sejumlah kecocokan sedang yang berulang tidak terakumulasi dengan cara yang sama seperti penjumlahan semua pasangan token. Karena itu aggregation rule mendefinisikan sinyal relevance tertentu, bukan ukuran semantic relatedness yang umum.

Multi-vector index menukar storage dengan detail interaksi

Mempertahankan beberapa vector per document meningkatkan volume index dibanding single-vector dense retrieval. Jika sebuah document menghasilkan puluhan atau ratusan token vector, menyimpan setiap vector dalam full precision dapat mendominasi retrieval footprint.

Compression dan pruning dapat mengurangi biaya itu, tetapi keduanya mengubah masalah engineering. Index kini harus mendukung candidate discovery di banyak document vector lalu memulihkan document-level score dari kecocokan tingkat token.

Ini tidak sama dengan menaruh satu document embedding di standard vector index. Pencarian naif terhadap setiap token vector yang tersimpan dapat mengembalikan banyak hit dari document yang sama dan melakukan banyak pekerjaan sebelum final document ranking tersedia.

Karena itu, sistem late interaction praktis menggabungkan vector indexing, compression, pruning, atau staged scoring. Retrieval plan persisnya bersifat implementation-specific, sementara architectural invariant-nya tetap sama: contextual vector sisi document tersedia sebelum query datang, dan fine-grained interaction terjadi kemudian.

Jumlah token memengaruhi storage dan biaya scoring

Panjang document memiliki dampak sistem langsung pada representasi multi-vector. Semakin banyak token document yang dipertahankan, semakin banyak vector yang harus disimpan dan semakin banyak kemungkinan kecocokan yang perlu dipertimbangkan. Panjang query juga mengubah jumlah term MaxSim dalam skor.

Token filtering dapat mengurangi footprint ini, tetapi membuang vector bukan operasi netral. Token yang dibuang tidak lagi dapat memberikan kecocokan terkuat untuk query vector mana pun. Nilai pruning karena itu bergantung pada representasi token mana yang membawa retrieval signal untuk query di masa depan.

Chunking menambahkan boundary lain. Jika document panjang dipecah sebelum encoding, contextual token vector hanya dikondisikan oleh konteks chunk masing-masing. Retrieval kemudian meranking chunk atau mengagregasikannya kembali menjadi document sesuai desain aplikasi.

Pilihan ini memengaruhi semantik representasi sekaligus ukuran index. Chunk yang lebih kecil dapat mengisolasi passage yang relevan, sedangkan chunk yang lebih besar memberi konteks lebih luas pada setiap token representation. Tidak satu pun efek tersebut otomatis berasal dari late interaction itu sendiri.

Similarity normalization adalah bagian dari definisi model

Interaction score bergantung pada geometry yang dihasilkan encoder dan pada similarity function yang diharapkan saat retrieval. Dot product dan cosine similarity hanya ekuivalen ketika vector yang dibandingkan memiliki normalisasi yang diperlukan.

Implementasi tidak seharusnya menambahkan vector normalization hanya karena search library default ke cosine distance. Jika trained model mengharapkan normalized token vector, normalisasi itu adalah bagian dari representation pipeline. Jika model mengharapkan scoring convention lain, mengganti konvensi tersebut mengubah ranking.

Hal yang sama berlaku untuk quantization. Mengompresi document vector dapat mengubah individual similarity, dan MaxSim dapat memperbesar perubahan ranking di sekitar maximum boundary. Perturbasi kecil yang menukar dua token match teratas mengubah nilai mana yang berkontribusi terhadap skor.

Karena itu index compression seharusnya dievaluasi berdasarkan retrieval behavior, bukan hanya average vector reconstruction error.

Late interaction dan reranking berada pada request path yang berbeda

Cross-encoder reranker biasanya menerima candidate set terbatas dari tahap retrieval sebelumnya. Ia dapat menghabiskan komputasi besar pada setiap pasangan query-document karena jumlah candidate sudah dikurangi.

Late interaction juga dapat dipakai sebagai reranker, tetapi independent document encoding membuka opsi lain: representasi yang sama dapat ikut langsung dalam corpus retrieval melalui index yang dirancang untuk struktur multi-vector.

Perbedaan ini memengaruhi perhitungan latency. Sistem late interaction yang hanya dipakai setelah first-stage retrieval membayar query encoding ditambah scoring atas candidate set terbatas. End-to-end late interaction retriever juga membayar candidate discovery dan index traversal di seluruh corpus.

Membandingkan hanya final scoring operator akan menyembunyikan workload yang berbeda ini. Pengukuran perlu mencakup seluruh retrieval path yang digantikan.

Evaluasi membutuhkan ranking metric dan index metric

Model multi-vector dapat meningkatkan relevance pada test set sambil menambah storage atau latency yang tidak sesuai target serving. Sebaliknya, compression agresif dapat membuat index praktis tetapi mengubah cukup banyak token similarity hingga ranking quality turun.

Karena itu evaluasi yang berguna harus mencakup kedua sisi desain: retrieval metric pada cutoff yang dibutuhkan, ukuran index, query latency, penggunaan memori, dan biaya candidate scoring. Ukuran corpus, distribusi panjang document, panjang query, hardware, dan pengaturan index perlu tetap terlihat dalam perbandingan.

Single-vector retrieval tetap menarik ketika storage ringkas dan approximate search yang sederhana menjadi kebutuhan utama. Cross-encoder tetap menarik ketika candidate set kecil memungkinkan full pairwise modeling. Late interaction berada di antara keduanya dengan mempertahankan perbandingan tingkat token tanpa mengharuskan transformer encoding document untuk setiap query.

Posisi ini sekaligus menjadi constraint utamanya. Fine-grained matching dapat dipertahankan karena sistem menyimpan dan mencari lebih banyak representation state. Vector tambahan bukan overhead kebetulan; itulah mekanisme yang menjaga evidence tingkat token tetap tersedia setelah document encoding dipisahkan dari query.