Bangun Prediction Set dengan Conformal Prediction
Classifier biasanya mengembalikan satu label bahkan ketika beberapa label sama-sama masuk akal. Ini nyaman untuk interface software, tetapi dapat menyembunyikan ketidakpastian tepat pada kondisi ketika kesalahan mahal. Document router mungkin ragu antara billing dan account, tetapi argmax tetap mengeluarkan salah satunya.
Conformal prediction menawarkan interface lain: kembalikan sekumpulan label dengan ukuran yang menyesuaikan bukti. Input yang mudah dapat menghasilkan satu label. Input ambigu dapat menghasilkan beberapa label. Di bawah asumsi tertentu, prosedur ini juga memberikan finite-sample coverage guarantee.
Artikel ini mengembangkan konsep tersebut dari contoh classifier kecil, menunjukkan bagaimana kalibrasi menghasilkan threshold, serta menjelaskan asumsi dan trade-off yang penting pada sistem AI production.
Mulai dengan set, bukan satu jawaban
Misalkan classifier memberikan probabilitas berikut untuk sebuah support request:
billing 0.62
account 0.31
technical 0.07Keputusan top-one biasa mengembalikan:
billingOutput itu membuang fakta bahwa account masih memiliki dukungan model yang cukup besar. Interface prediction-set dapat mengembalikan:
{billing, account}Untuk request yang lebih jelas, sistem yang sama mungkin hanya mengembalikan:
{billing}Tujuannya bukan memasukkan setiap label yang sedikit mungkin benar. Prediction set yang berguna menyeimbangkan dua properti:
- coverage: label benar seharusnya muncul di dalam set pada long-run rate yang diminta;
- efficiency: set sebaiknya cukup kecil agar tetap berguna.
Set yang berisi semua label memiliki coverage sangat baik tetapi tidak memiliki nilai diskriminatif. Conformal prediction menyediakan cara disiplin untuk memilih threshold alih-alih menentukannya berdasarkan intuisi.
Calibration data mengubah skor menjadi threshold
Workflow split-conformal paling sederhana menggunakan tiga bagian:
training data -> fit classifier
calibration data -> pilih conformal threshold
test input -> bangun prediction setCalibration example tidak boleh sama dengan contoh yang digunakan untuk fit model. Perannya adalah mengukur perilaku model score pada kasus berlabel baru yang diambil dalam kondisi yang sama dengan kondisi evaluasi yang diharapkan.
Untuk klasifikasi, definisikan nonconformity score. Nilai yang lebih besar berarti candidate label terlihat kurang cocok dengan input. Pilihan sederhana untuk probabilistic classifier adalah:
s(x, y) = 1 - p(y | x)Jika model memberikan probabilitas 0.82 kepada label benar, nonconformity score-nya adalah:
1 - 0.82 = 0.18Jika label benar menerima probabilitas 0.25, skornya adalah:
1 - 0.25 = 0.75Untuk setiap calibration example (x_i, y_i), hitung skor label benarnya. Skor-skor ini membentuk empirical reference distribution.
Hitung finite-sample quantile dengan cermat
Anggap terdapat n calibration score dan target miscoverage rate adalah alpha. Split-conformal threshold standar menggunakan order statistic pada rank:
k = ceil((n + 1) * (1 - alpha))Urutkan calibration score dari yang terkecil hingga terbesar dan ambil nilai pada rank k dengan one-based indexing. Jika k > n, tidak ada finite calibration order statistic yang dapat memenuhi target tersebut melalui aturan dasar ini; menggunakan infinite threshold, sehingga memasukkan semua label, merupakan fallback konservatif.
Pertimbangkan sembilan calibration score:
0.08, 0.11, 0.14, 0.18, 0.22, 0.27, 0.31, 0.39, 0.52Untuk target coverage 90%:
n = 9
alpha = 0.10
k = ceil((9 + 1) * 0.90)
= 9Threshold-nya adalah:
q = 0.52Koreksi (n + 1) penting. Mengambil empirical 90th percentile biasa tanpa finite-sample adjustment conformal dapat menghasilkan threshold berbeda dan menghilangkan jaminan yang dimaksud.
Calibration set kecil juga membuat tingkat coverage menjadi kasar. Dengan sedikit contoh, order statistic yang tersedia membatasi seberapa presisi rate yang diinginkan dapat direpresentasikan. Calibration data yang lebih banyak biasanya memberi resolusi threshold lebih halus dan estimasi perilaku skor yang lebih stabil.
Bangun prediction set untuk input baru
Untuk input baru x, beri skor pada setiap candidate label dan masukkan label yang nonconformity score-nya tidak melebihi threshold:
C(x) = {y : s(x, y) <= q}Dengan s(x, y) = 1 - p(y | x) dan q = 0.52, inclusion setara dengan:
p(y | x) >= 0.48Misalkan request baru memiliki:
billing 0.55
account 0.40
technical 0.05Nonconformity score-nya adalah:
billing 0.45
account 0.60
technical 0.95Hanya billing yang dimasukkan karena hanya 0.45 <= 0.52.
Dengan threshold, score function, atau profil probabilitas berbeda, set dapat berisi beberapa label. Poin pentingnya adalah cutoff berasal dari held-out calibration score, bukan dari menganggap raw model probability sebagai calibrated confidence secara intrinsik.
Skor sederhana ini berguna sebagai ilustrasi, tetapi bukan satu-satunya conformal classification score. Konstruksi skor lain dapat menghasilkan set yang lebih efisien, terutama pada multiclass task ketika probability mass tersebar pada banyak label.
Jaminan berlaku pada marginal coverage
Pernyataan utama split-conformal mudah dibesar-besarkan.
Di bawah exchangeability calibration example dan future example, prosedur dirancang agar prediction set memuat future true label dengan probabilitas setidaknya 1 - alpha untuk konstruksi finite-sample standar. Batas atas coverage bergantung pada score tie dan apakah randomization digunakan.
Untuk target 90%, ini adalah klaim marginal coverage. Artinya bukan setiap subgroup, label, tingkat kesulitan, atau prediction individual mendapat coverage 90%.
Bayangkan dua segmen traffic:
common requests: 95% coverage
rare requests: 60% coverageAggregate-nya masih dapat memenuhi target 90% jika rare request hanya merupakan bagian kecil. Overall guarantee tidak mencegah disparitas tersebut.
Perbedaan ini memiliki konsekuensi engineering langsung. Jika coverage untuk bahasa, customer tier, medical cohort, device type, atau rare class tertentu penting, ukur slice tersebut secara eksplisit. Beberapa varian conformal menargetkan properti yang lebih kuat atau group-conditional, tetapi properti itu membutuhkan struktur tambahan dan tidak boleh disimpulkan dari marginal coverage biasa.
Exchangeability adalah asumsi utama
Conformal guarantee tidak berasal dari classifier yang benar atau probabilitasnya yang terkalibrasi. Jaminan berasal dari perilaku rank nonconformity score di bawah asumsi exchangeability.
Secara informal, calibration dan future example harus cukup sebanding sehingga urutannya dapat diperlakukan secara simetris. Independent and identically distributed sampling adalah setting memadai yang umum, walaupun exchangeability merupakan kondisi yang lebih langsung.
Asumsi ini dapat gagal pada situasi production yang familiar:
calibration: support traffic tahun lalu
production: traffic peluncuran produk baruJika jenis request baru mengubah score distribution, conformal threshold lama mungkin tidak lagi menghasilkan coverage yang dimaksud.
Risiko lain meliputi geographic shift, penggantian sensor, perubahan policy, class-prior change, perubahan upstream retrieval, dan model update. Threshold yang dikalibrasi untuk satu versi model tidak boleh diasumsikan valid setelah model tersebut diganti.
Perlakukan model, score function, preprocessing, dan calibration set sebagai satu unit yang diberi versi. Jika komponen berubah dengan cara yang dapat mengubah skor, recalibration adalah default yang aman.
Set size adalah sinyal operasional, bukan jaminan kebenaran
Prediction-set size sering bereaksi terhadap ambiguitas. Kasus yang jelas dapat menghasilkan satu label sedangkan kasus sulit menghasilkan tiga. Ini membuat set size berguna untuk routing decision.
Contohnya:
size 1 -> automatic route
size 2 -> terapkan secondary rule
size 3+ -> minta human reviewInterface ini praktis, tetapi set size tidak boleh ditafsirkan sebagai skala ketidakpastian universal. Singleton set tetap dapat salah. Set besar dapat muncul akibat threshold konservatif, pemisahan model yang lemah, distribution shift, atau score function yang tidak efisien untuk task tersebut.
Pantau coverage dan statistik set size. Ringkasan yang berguna mencakup mean set size, proporsi singleton set, proporsi empty set jika konstruksi memungkinkannya, serta set size berdasarkan data slice penting.
Base model yang lebih baik dapat menghasilkan set lebih kecil
Conformal prediction membungkus base model; ia tidak memperbaiki representasi yang buruk atau informasi yang hilang.
Misalkan dua classifier sama-sama memakai conformal wrapper dengan target marginal coverage yang sama. Satu classifier memisahkan label benar dari alternatif secara tajam. Yang lain menyebarkan probabilitas secara luas pada banyak kelas. Yang pertama sering dapat mencapai target dengan set lebih kecil karena score distribution-nya membedakan kandidat benar dengan lebih efektif.
Ini memberikan pemisahan tanggung jawab yang berguna:
base model quality -> seberapa informatif skor
conformal calibration -> bagaimana threshold memetakan skor ke coverageMeningkatkan base model dapat meningkatkan set efficiency sementara prosedur conformal mengendalikan target coverage di bawah asumsi-asumsinya.
Jangan membandingkan metode conformal hanya berdasarkan coverage jika semuanya disetel pada target yang sama. Bandingkan set size dan task-specific utility pada tingkat coverage tersebut.
Hindari tuning pada calibration split
Calibration set memiliki satu tugas sempit: mengubah scoring procedure yang sudah tetap menjadi threshold. Menggunakannya berulang kali untuk memilih model architecture, hyperparameter, score definition, atau business rule membocorkan keputusan selection ke data yang dimaksudkan untuk kalibrasi.
Workflow yang lebih bersih adalah:
training split -> fit parameter
validation split -> pilih model dan desain skor
calibration split -> hitung final threshold
test split -> estimasi perilaku akhirTidak setiap project membutuhkan empat file fisik, tetapi peran statistiknya sebaiknya tetap terpisah. Jika data sedikit, resampling atau cross-conformal approach dapat menggunakan data lebih efisien dengan biaya procedural complexity tambahan.
Hindari pula melaporkan calibration-set coverage sebagai bukti performa deployment. Final evaluation sebaiknya memakai contoh yang belum disentuh dan mewakili operating distribution yang diharapkan.
Tangani tie dan detail implementasi secara eksplisit
Implementasi conformal membutuhkan aturan eksplisit untuk tie pada threshold. Menggunakan <= q alih-alih < q dapat memengaruhi finite-sample behavior ketika banyak skor identik.
Output model diskret dapat menciptakan banyak tie. Quantized probability, rounded score, dan classifier dengan confidence value berulang membuat kondisi ini lebih mungkin. Randomized conformal procedure dapat menangani tie lebih ketat pada beberapa setting, tetapi deterministic conservative inclusion sering lebih mudah dioperasikan ketika set yang sedikit lebih besar dapat diterima.
Detail numerik juga penting. Jika skor dihitung dari logit atau probability, gunakan preprocessing dan numerical path yang sama saat calibration dan serving. Calibration job dengan satu normalization rule dan production code dengan rule lain tidak lagi menerapkan score function yang sama.
Simpan metadata yang cukup untuk mereproduksi threshold:
model version
score definition
calibration dataset version
alpha
threshold
label vocabulary
preprocessing versionRecord tersebut membuat coverage regression jauh lebih mudah diselidiki.
Pilih target coverage berdasarkan biaya keputusan
Target seperti 90%, 95%, atau 99% tidak otomatis tepat. Target coverage yang lebih tinggi biasanya memerlukan prediction set yang lebih permisif, sehingga set size cenderung meningkat.
Trade-off yang tepat bergantung pada apa yang terjadi setelah set dihasilkan. Kehilangan label benar pada automated medical triage workflow memiliki biaya berbeda dari mengembalikan satu kategori ekstra pada internal content-tagging tool.
Evaluasi beberapa target pada held-out data:
target coverage | observed coverage | mean set size | downstream costKemudian pilih titik yang sesuai dengan aplikasi. Jika downstream operator tidak dapat bertindak pada set berisi sepuluh label, target coverage yang secara nominal kuat dapat menghasilkan sistem yang tidak dapat digunakan.
Classifier top-one yang lebih sederhana juga dapat lebih cocok ketika kesalahan murah, pengguna sudah dapat menoleransi koreksi, dan set-valued output menambah kompleksitas interface tanpa mengubah keputusan.
Monitor coverage setelah deployment
Coverage baru dapat diukur setelah true label tersedia. Jika production label terlambat, siapkan proses untuk menggabungkan prediction dengan outcome yang datang kemudian dan menghitung rolling metric.
Pantau setidaknya:
- empirical marginal coverage;
- set-size distribution;
- coverage untuk label atau slice kritis;
- score distribution relatif terhadap calibration distribution;
- tingkat input yang memicu fallback handling.
Penurunan coverage merupakan bukti bahwa kondisi deployment tidak lagi cocok dengan asumsi atau bahwa komponen pipeline berubah. Recalibration dapat memperbaiki threshold drift ketika model masih sesuai, tetapi tidak dapat mengompensasi setiap bentuk distribution shift yang parah.
Pisahkan operational monitoring dari formal guarantee. Dashboard tidak menciptakan validitas; dashboard memberi tahu apakah perilaku yang diamati masih konsisten dengan kondisi ketika metode dikalibrasi.
Gunakan conformal prediction sebagai interface contract
Conformal prediction paling berguna ketika aplikasi dapat bertindak pada sebuah set alih-alih menuntut satu jawaban dengan segala cara. Base model menyediakan bukti relatif, calibration set mengubah bukti tersebut menjadi threshold, dan prediction set yang dihasilkan mengekspos ketidakpastian dalam bentuk yang dapat dipakai downstream software.
Mulailah dengan classifier tetap dan nonconformity score sederhana. Sisihkan calibration data baru, hitung finite-sample threshold, lalu ukur coverage dan set size pada test data yang belum disentuh. Setelah itu, uji slice dan distribution shift yang penting bagi produk.
Kontrak praktisnya presisi: target coverage berlaku di bawah asumsi metode, sedangkan set efficiency sangat bergantung pada base model dan desain skor. Memisahkan kedua konsep ini membuat conformal prediction jauh lebih mudah digunakan secara bertanggung jawab.