Classifier biasanya mengembalikan satu label atau sebuah vektor skor kelas. Kedua output itu tidak secara langsung menyatakan berapa banyak label yang sebaiknya tetap dianggap masuk akal ketika sistem membutuhkan tingkat error yang terkendali. Split conformal prediction menambahkan lapisan kalibrasi yang mengubah skor tersebut menjadi prediction set.

Properti yang berguna bukan bahwa setiap set individual memiliki probabilitas tetap untuk memuat label yang benar. Di bawah asumsi exchangeability standar, metode split conformal menargetkan coverage marginal pada contoh baru. Perbedaan ini menentukan cara implementasi sekaligus interpretasinya.

Kalibrasi mengubah skor menjadi threshold

Anggap sebuah classifier menghasilkan probabilitas p(y | x) pada himpunan label berhingga. Skor nonconformity sederhana untuk contoh dengan label benar y adalah:

s(x, y) = 1 - p(y | x)

Nilai besar menunjukkan bahwa classifier memberikan probabilitas rendah pada label yang diamati. Setelah base classifier dibekukan, hitung skor ini pada calibration set terpisah yang berisi n contoh berlabel.

Untuk target miscoverage rate alpha, konstruksi split conformal yang umum memakai empirical quantile pada rank:

ceil((n + 1) * (1 - alpha))

dengan rank dibatasi maksimal n bila diperlukan. Misalkan threshold kalibrasi yang dihasilkan adalah q. Untuk input baru x, masukkan label y ketika:

s(x, y) <= q

Dengan skor di atas, aturan ini setara dengan mempertahankan kelas yang predicted probability-nya setidaknya 1 - q.

Koreksi finite-sample yang melibatkan n + 1 merupakan bagian dari konstruksi coverage. Menggantinya dengan percentile arbitrer dapat mengubah jaminan formal, terutama ketika calibration set kecil.

Jaminannya bersifat marginal, bukan per input

Pernyataan split conformal standar berlaku pada pasangan test baru dan calibration sample acak di bawah exchangeability. Dalam bentuk sederhana, set C(X) yang dihasilkan memenuhi:

P(Y in C(X)) >= 1 - alpha

dengan tunduk pada konstruksi conformal dan asumsi-asumsinya.

Probabilitas ini dirata-ratakan atas input. Ini tidak berarti setiap wilayah input space memiliki coverage 1 - alpha, dan juga tidak memberikan probabilitas tersebut kepada setiap prediction set yang terealisasi.

Misalkan sistem menargetkan 90% marginal coverage. Satu segmen input dapat memiliki coverage di bawah tingkat itu sementara segmen lain mengompensasinya dengan coverage yang lebih tinggi. Aggregate coverage masih dapat memenuhi target. Aplikasi yang membutuhkan jaminan dalam kelas atau kelompok operasional tertentu memerlukan konstruksi yang memang dirancang untuk kondisi tersebut, bukan interpretasi yang ditambahkan setelah kalibrasi.

Batas ini mudah terlewat ketika prediction set ditampilkan sebagai estimasi ketidakpastian. Set berisi tiga label bukan, dengan sendirinya, pernyataan bahwa label yang benar memiliki probabilitas kondisional tertentu untuk berada di antara ketiga label itu.

Exchangeability menanggung beban statistik

Split conformal prediction sering disebut distribution-free karena tidak memerlukan bentuk parametrik untuk distribusi data. Namun, metode ini tetap bergantung pada asumsi simetri. Contoh kalibrasi dan contoh mendatang harus exchangeable agar hasil finite-sample marginal coverage yang biasa berlaku.

Sampling independent and identically distributed adalah setting yang umum dan memadai, tetapi exchangeability merupakan kondisi yang lebih langsung digunakan oleh argumen conformal.

Deployment drift dapat memutus hubungan praktis antara kalibrasi dan input mendatang. Jika calibration set berisi satu distribusi traffic dan production kemudian menerima distribusi lain, rank skor nonconformity baru di antara skor kalibrasi tidak lagi memiliki simetri yang sama.

Lapisan conformal tidak mendeteksi pergeseran ini. Ia tetap menerapkan threshold yang tersimpan. Karena itu, monitoring coverage perlu ditempatkan bersama monitoring set size ketika populasi input dapat berubah.

Desain skor mengubah ukuran set

Coverage tidak menentukan seberapa informatif set yang dihasilkan. Dua konstruksi conformal yang valid dapat menargetkan marginal coverage yang sama tetapi menghasilkan average set size yang berbeda.

Skor 1 - p(y | x) sederhana, tetapi memperlakukan setiap candidate label melalui probabilitas individualnya. Skor klasifikasi lain memakai cumulative probability mass atau randomized adjustment untuk menghasilkan perilaku set yang berbeda. Pilihan ini mengubah label mana yang masuk ke set pada calibration threshold tertentu.

Base classifier juga berpengaruh. Jika classifier memberi skor tinggi pada kelas benar dan skor rendah pada alternatif, calibration score cenderung mendukung set yang lebih kecil. Jika beberapa kelas menerima skor serupa, memenuhi target coverage yang sama dapat membutuhkan set lebih besar.

Conformal calibration tidak memperbaiki diskriminasi kelas. Ia membungkus score function dengan threshold yang dipilih untuk mengendalikan kriteria coverage. Ranking yang lebih baik dapat membuat set lebih ringkas, tetapi compactness dan coverage tetap merupakan properti terpisah.

Calibration split memiliki peran tersendiri

Calibration set bukan validation data biasa setelah skornya dipakai untuk menentukan conformal threshold. Memilih varian model, score function, atau hyperparameter setelah melihat performa conformal pada set yang sama dapat membuat prosedur akhir bergantung pada data yang dalam argumen coverage diperlakukan sebagai calibration observation.

Split yang bersih menempatkan model fitting dan selection di tahap sebelumnya, lalu membekukan pilihan tersebut sebelum conformal calibration. Final test set dapat tetap tidak disentuh untuk melaporkan empirical coverage dan perilaku set size.

Biayanya adalah penggunaan data. Menahan contoh untuk kalibrasi menyisakan lebih sedikit contoh untuk fitting base model. Namun, calibration example yang lebih banyak memberikan resolusi quantile lebih halus dan mengurangi diskretisasi akibat n yang kecil.

Resolusi tersebut terlihat langsung pada rumus rank. Threshold hanya dapat berpindah di antara calibration score yang diamati, sehingga calibration sample kecil hanya mendukung kumpulan operating point yang terbatas.

Set kosong dan set besar adalah output yang bermakna

Bergantung pada skor dan threshold, conformal classifier dapat mengembalikan satu label, beberapa label, semua label, atau pada konstruksi tertentu set kosong. Application code sebaiknya memperlakukan cardinality set sebagai bagian dari kontrak output, bukan mengasumsikan satu prediction.

Set besar sering menunjukkan bahwa score function tidak dapat memisahkan label yang masuk akal dengan cukup kuat pada tingkat coverage yang diminta. Kondisi ini juga dapat muncul ketika alpha kecil, karena coverage yang lebih ketat umumnya memerlukan threshold yang menerima lebih banyak label.

Set kosong memiliki arti berbeda: tidak ada kandidat yang lolos calibrated inclusion rule. Apakah set kosong mungkin muncul bergantung pada konstruksi skor dan konvensi tambahan yang diterapkan implementasi.

Memaksa setiap output berisi tepat satu label mengubah prosedur prediction-set. Interface single-label yang dihasilkan mungkin nyaman secara operasional, tetapi perilaku error-nya tidak lagi ditetapkan hanya oleh hasil conformal coverage untuk set asli.

Coverage dan set size perlu dievaluasi bersama

Empirical coverage pada data yang tidak disentuh mengukur seberapa sering label benar muncul dalam set yang dikembalikan. Set size menggambarkan seberapa banyak ambiguitas yang diekspos sistem saat mencapai coverage tersebut.

Hanya melaporkan coverage dapat menyembunyikan solusi trivial tetapi tidak berguna yang mengembalikan hampir semua label. Hanya melaporkan set size dapat menyembunyikan undercoverage. Keduanya bersama-sama memberikan gambaran operating point yang lebih jelas.

Diagnostic yang berguna juga dapat melakukan stratifikasi kedua ukuran berdasarkan kelas atau segmen input yang relevan. Slice tersebut tidak mengubah marginal guarantee menjadi conditional guarantee, tetapi dapat mengungkap konsentrasi error atau set yang sangat besar yang tersembunyi oleh nilai aggregate.

Ketika membandingkan varian conformal, target coverage, calibration protocol, base model, dan evaluation population perlu dinyatakan secara eksplisit. Set yang lebih kecil hanya berguna jika kriteria coverage terkait tetap terpenuhi dalam setup perbandingan.

Recalibration terikat pada scoring pipeline

Conformal threshold yang tersimpan merupakan bagian dari scoring pipeline persis yang digunakan untuk menghasilkan calibration score. Mengganti classifier checkpoint, mengubah preprocessing, memodifikasi definisi label, atau mengubah nonconformity score dapat mengubah distribusi skor.

Mempertahankan threshold lama setelah perubahan tersebut tidak setara dengan mengalibrasi pipeline baru. Sistem baru membutuhkan calibration score yang dihasilkan oleh komponen-komponennya sendiri yang sudah dibekukan.

Hal ini membuat conformal state kecil tetapi spesifik secara semantik: threshold mungkin hanya satu angka, tetapi validitasnya bergantung pada model, definisi skor, calibration population, target error rate, dan data-splitting protocol yang menghasilkannya.

Bagi developer, batas ini merupakan nilai implementasi utama split conformal prediction. Metode ini menciptakan interface yang jelas antara model score dan output set yang coverage-nya dikendalikan, sambil menjaga asumsi di balik kontrol tersebut tetap cukup terlihat untuk diuji dan dimonitor.