Classifier biasanya mengembalikan label untuk setiap input, bahkan ketika distribusi skornya hampir seimbang atau input berada jauh dari data yang familiar. Selective classification mengubah antarmuka tersebut: sistem dapat mengembalikan prediksi atau abstain. Aturan penerimaan kemudian menentukan berapa banyak input yang menerima prediksi dan seberapa sering prediksi yang diterima itu salah.

Ini tidak sama dengan membuat classifier secara intrinsik lebih akurat. Abstention memindahkan sebagian kasus keluar dari himpunan keputusan otomatis. Nilainya bergantung pada kemampuan selection score mengurutkan kasus sulit dengan cukup baik sehingga input yang ditolak memuat porsi error yang lebih besar.

Selector berada di samping predictor

Misalkan classifier menghasilkan prediksi f(x) dan selection function g(x) menentukan apakah prediksi tersebut diterima. Selector sederhana berbasis scalar score dapat ditulis sebagai

g(x) = 1 if score(x) >= threshold
       0 otherwise

Ketika g(x) = 0, sistem melakukan abstain. Score dapat berupa probabilitas kelas terbesar, margin antara dua class score terbesar, ukuran disagreement pada ensemble, atau kuantitas lain yang tersedia saat inference.

Selector dan predictor memiliki peran berbeda. f(x) memilih kelas. g(x) menentukan apakah sistem bersedia mengekspos pilihan tersebut sebagai prediksi yang diterima.

Pemisahan ini penting dalam implementasi. Mengganti label yang tidak pasti dengan nilai khusus "unknown" tanpa mencatat bahwa nilai tersebut berasal dari selection policy dapat mencampurkan abstention dengan kelas yang benar-benar ada. Evaluasi downstream kemudian tidak dapat membedakan classification error dari non-decision yang disengaja.

Coverage dan selective risk menggambarkan operating point

Coverage adalah fraksi input yang diterima selector:

coverage = accepted inputs / all inputs

Selective risk mengukur loss pada subset yang diterima. Dengan zero-one classification loss, nilainya adalah tingkat error di antara prediksi yang diterima:

selective risk = incorrect accepted predictions / accepted predictions

Sebuah threshold karena itu mendefinisikan operating point, bukan satu angka kualitas model. Menurunkan threshold umumnya menerima lebih banyak contoh sehingga coverage meningkat. Apakah selective risk ikut meningkat bergantung pada seberapa baik score mengurutkan prediksi yang benar dan salah.

Kasus ekstrem memperjelas batasnya. Menerima setiap input menghasilkan coverage penuh dan membuat selective risk sama dengan tingkat error biasa classifier. Menerima hampir tidak ada input dapat menghasilkan tingkat error teramati yang rendah sekaligus membuat sistem tidak berguna untuk otomatisasi. Evaluasi yang berguna mempertahankan kedua kuantitas tersebut tetap terlihat.

Hubungan pada berbagai threshold sering direpresentasikan sebagai risk-coverage curve. Kurva ini menunjukkan apakah error tetap terkendali ketika kasus yang semakin tidak pasti secara bertahap masuk ke himpunan yang diterima.

Confidence score memerlukan ranking yang berguna, bukan sekadar nilai yang masuk akal

Selector berbasis probabilitas kelas maksimum sering disebut sebagai confidence threshold. Nilai numeriknya dapat mengundang interpretasi yang lebih kuat daripada yang didukung mekanismenya.

Misalkan dua prediksi memiliki probabilitas maksimum 0.91 dan 0.72. Untuk selective classification, pertanyaan utamanya adalah apakah kasus pertama lebih mungkin benar daripada kasus kedua pada populasi yang relevan. Selector terutama memerlukan score yang mengurutkan kasus secara berguna di sekitar operating region yang dipilih.

Probability calibration berkaitan dengan hal ini tetapi berbeda. Calibration membahas kesesuaian antara predicted probability dan frekuensi yang diamati. Sebuah score dapat memiliki probability calibration yang tidak sempurna tetapi tetap mengurutkan error dengan cukup baik untuk mendukung abstention. Sebaliknya, score yang terkalibrasi secara global tetap dapat memiliki pemisahan lemah antara kasus benar dan salah di sekitar threshold tertentu.

Jika aplikasi memperlakukan 0.90 sebagai pernyataan probabilitas literal, calibration perlu dievaluasi secara terpisah. Jika nilai tersebut hanya dipakai untuk mengurutkan kasus yang akan ditolak, perilaku ranking di sekitar rentang coverage yang dituju menjadi perhatian yang lebih langsung.

Pemilihan threshold terikat pada validation distribution

Memilih threshold pada contoh yang sama dengan yang dipakai untuk melaporkan selective risk akhir membuat operating point yang dilaporkan terlalu optimistis. Threshold merupakan keputusan model selection meskipun bobot classifier tetap.

Setup yang lebih bersih memakai held-out validation data untuk memilih threshold berdasarkan objective yang dinyatakan, lalu mengukur policy yang dihasilkan pada evaluation data terpisah. Sebagai contoh, sistem dapat mencari coverage teramati tertinggi di antara candidate threshold yang validation error-nya tetap di bawah batas tertentu.

Aturan empiris tersebut tidak otomatis menjadi statistical guarantee untuk traffic mendatang. Tingkat yang diukur bergantung pada ukuran sampel dan seberapa mirip input mendatang dengan data yang dipakai untuk memilih serta menilai selector.

Threshold juga terikat pada model penghasil score. Update model dapat mengubah distribusi score meskipun top-1 accuracy hampir tidak berubah. Memakai kembali threshold numerik lama setelah mengubah bobot, preprocessing, definisi label, atau perhitungan score dapat menggeser coverage tanpa terlihat.

Memperlakukan konfigurasi selector sebagai state model yang memiliki versi membuat ketergantungan tersebut eksplisit.

Distribution shift dapat merusak urutan rejection

Selective classification bekerja baik hanya ketika selection score tetap informatif terhadap error pada populasi deployment.

Pertimbangkan classifier yang memberi probabilitas maksimum tinggi pada input familiar dan nilai lebih rendah pada input ambigu. Sebuah threshold dapat menolak banyak kasus sulit pada in-distribution validation data. Di bawah distribution shift, classifier justru dapat menghasilkan score tinggi untuk input yang salah dengan keyakinan tinggi. Coverage dapat tetap tinggi sementara selective risk memburuk.

Abstention karena itu tidak otomatis menjadi out-of-distribution detector. Maximum probability, entropy, margin, dan uncertainty proxy lain masing-masing mencerminkan properti output model; tidak ada yang berubah menjadi universal shift detector hanya karena dipakai sebagai rejection score.

Evaluasi sebaiknya mempertahankan slice yang relevan ketika error memiliki struktur. Aggregate risk pada coverage 80 persen dapat menyembunyikan subgroup yang prediksi diterimanya memiliki tingkat error jauh lebih tinggi. Selector dapat mengurutkan kasus secara berbeda antar kelas, bahasa, perangkat, sumber dokumen, atau partisi operasional lain.

Satu global threshold merupakan pilihan policy dengan asumsi distribusional yang melekat padanya.

Membandingkan selector memerlukan coverage yang sama

Membandingkan dua selector pada tingkat coverage berbeda mencampurkan volume rejection dengan kualitas rejection. Selector yang menolak separuh input memiliki lebih banyak kesempatan untuk membuang error daripada selector yang hanya menolak lima persen.

Perbandingan langsung menetapkan coverage yang sama lalu mengukur selective risk, atau menetapkan tingkat risk yang dapat diterima lalu membandingkan coverage yang dicapai. Risk-coverage curve penuh memperlihatkan hubungan tersebut pada banyak operating point.

Ringkasan area dapat praktis, tetapi merangkum perilaku pada threshold yang mungkin tidak pernah digunakan. Jika aplikasi beroperasi di sekitar coverage tinggi, perbedaan pada wilayah tersebut dapat lebih relevan daripada rata-rata seluruh kurva.

Base predictor juga perlu tetap dikendalikan ketika tujuannya membandingkan selection score. Mengubah classifier dan selector sekaligus membuat sumber perbedaan menjadi tidak jelas.

Abstention memerlukan downstream state yang eksplisit

Endpoint model yang dapat abstain memiliki setidaknya tiga hasil yang berbeda secara semantik: prediksi diterima, prediksi ditolak, dan kegagalan sistem. Ketiganya tidak seharusnya digabung menjadi satu nilai null.

Response yang diterima dapat memuat predicted class dan selection score. Response yang ditolak dapat membawa status abstention terstruktur dan metadata policy yang cukup untuk mengidentifikasi versi selector. Transport error, timeout, dan input malformed berada pada jalur kegagalan yang berbeda.

Pemisahan tersebut mendukung metric yang akurat. Coverage seharusnya menghitung policy abstention, bukan infrastructure failure. Selective risk hanya mencakup prediksi yang diterima sesuai policy yang dinyatakan. Review queue kemudian dapat mengukur apa yang terjadi pada kasus yang ditolak tanpa mencemari metric classifier.

Selective classification paling berguna ketika abstention diperlakukan sebagai bagian dari prediction contract, bukan sebagai threshold tersembunyi di dalam application code. Threshold, definisi score, validation population, dan target operating region bersama-sama mendefinisikan perilakunya. Menjaga bagian-bagian tersebut tetap terlihat membuat hasil risk-coverage dapat diinterpretasikan ketika classifier atau traffic-nya berubah.