Classifier dapat mengurutkan kelas dengan benar tetapi menghasilkan probabilitas yang terlalu tajam atau terlalu datar. Temperature scaling menangani mismatch tersebut dengan transformasi yang sengaja dibatasi: bagi setiap logit pada satu contoh dengan satu skalar positif sebelum softmax.
Untuk logit z_k dan temperature T > 0, probabilitas terkalibrasi adalah
p_k(T) = exp(z_k / T) / sum_j exp(z_j / T)Skalar tersebut biasanya di-fit pada data held-out setelah parameter model dibuat tetap. Pemisahan ini penting karena temperature scaling mengubah confidence yang dilaporkan, bukan representasi atau decision boundary yang dihasilkan selama training.
Temperature positif mempertahankan kelas pemenang
Pembagian dengan skalar positif yang sama mempertahankan urutan secara ketat. Jika z_a > z_b, maka z_a / T > z_b / T. Kelas dengan logit terbesar tetap menjadi kelas dengan scaled logit terbesar.
Karena softmax juga mempertahankan urutan tersebut, prediksi top-1 tidak berubah. Akurasi pada contoh yang sama akibatnya tetap sama, selain detail implementasi seperti exact tie yang memang sudah ada.
Yang berubah adalah jarak antarnilai yang diterima softmax. Temperature di atas satu memperkecil perbedaan logit dan menghasilkan distribusi yang lebih datar. Temperature di bawah satu memperbesar perbedaan dan menghasilkan distribusi yang lebih tajam.
Sifat ini membuat temperature scaling berguna ketika ranking sudah memadai tetapi confidence secara sistematis tidak selaras dengan correctness yang diamati. Metode ini tidak dapat memperbaiki contoh yang sejak awal diberi kelas yang salah.
Skalar hasil fit terikat pada rezim data tertentu
Proses fit yang umum meminimalkan negative log-likelihood pada validation set dengan model tetap. Hanya T yang dioptimalkan. Skalar yang dihasilkan merangkum koreksi kalibrasi untuk kondisi gabungan yang direpresentasikan data validasi tersebut.
Koreksi itu bukan properti model yang invariant. Perubahan class balance, acquisition pipeline, kualitas input, atau populasi operasi dapat mengubah hubungan antara confidence dan correctness. Temperature yang di-fit pada satu rezim dapat menjadi tidak sesuai pada rezim lain meskipun weight model identik.
Validation split karena itu sebaiknya berbeda dari data yang digunakan untuk melatih parameter model. Menggunakan kembali contoh training cenderung mengukur confidence pada kondisi yang sudah dioptimalkan oleh model, sehingga nilai estimasi kalibrasinya berkurang.
Metrik kalibrasi menjawab pertanyaan berbeda dari akurasi
Akurasi menanyakan apakah kelas yang dipilih benar. Kalibrasi menanyakan apakah probabilitas yang dinyatakan sesuai dengan frekuensi empiris.
Sebagai contoh, di antara prediksi yang dilaporkan dengan confidence sekitar 0.8, sistem terkalibrasi seharusnya benar dengan frekuensi kurang lebih sebesar itu pada distribusi yang dievaluasi. Pernyataan ini bersifat agregat dan bergantung pada distribusi; bukan berarti satu prediksi tertentu memiliki peluang benar 80 persen yang dapat diukur secara objektif.
Negative log-likelihood praktis untuk proses fit karena differentiable dan sensitif terhadap probabilitas yang diberikan. Metrik seperti expected calibration error dapat memberi ringkasan tambahan, tetapi nilainya bergantung pada pilihan seperti binning. Reliability diagram memperlihatkan struktur yang lebih kaya daripada satu skalar dengan membandingkan confidence dan akurasi teramati pada beberapa rentang.
Metrik kalibrasi tidak menggantikan task metric. Model dapat terkalibrasi dengan baik tetapi tidak akurat, atau akurat tetapi memiliki kalibrasi buruk.
Satu skalar tidak dapat mengekspresikan distorsi spesifik kelas
Global temperature scaling menerapkan koreksi yang sama pada setiap kelas dan contoh. Kesederhanaan itu membatasi jumlah parameter sekaligus daya ekspresinya.
Misalkan satu kelas terus-menerus terlalu percaya diri sementara kelas lain kurang percaya diri. Satu T tidak dapat mengoreksi kedua efek secara independen. Keterbatasan serupa muncul ketika distorsi confidence sangat bergantung pada subgroup input atau konteks operasi.
Transformasi yang lebih fleksibel dapat memodelkan pola tersebut, tetapi menambah parameter dan dapat overfit pada calibration set kecil. Nilai utama scalar temperature scaling justru berasal dari koreksi terbatas yang tetap mempertahankan ranking kelas.
Untuk sistem yang bergantung pada threshold per kelas, selective prediction, atau risiko spesifik subgroup, kalibrasi agregat perlu dilengkapi pengukuran pada granularitas yang benar-benar digunakan oleh decision policy.
Probabilitas terkalibrasi tidak membuat threshold berlaku selamanya
Kode downstream sering mengubah probabilitas menjadi tindakan: terima di atas threshold, tunda di bawahnya, atau arahkan kasus tidak pasti ke proses lain. Kalibrasi dapat membuat threshold lebih mudah diinterpretasikan pada distribusi validasi, tetapi tidak membekukan semantiknya.
Saat data produksi bergeser, base rate dan conditional error profile dapat ikut berubah. Monitoring karena itu perlu mengaitkan distribusi confidence, error rate, dan pengukuran kalibrasi pada time window serta populasi yang sama.
Temperature scaling paling tepat diperlakukan sebagai koreksi post-hoc kecil dengan scope eksplisit. Metode ini mempertahankan urutan classifier, menyesuaikan konsentrasi softmax, dan dapat memperbaiki pelaporan probabilistik ketika rezim validasi sesuai dengan deployment. Batasannya juga jelas: metode ini mengalibrasi ulang confidence; metode ini tidak menciptakan informasi prediktif yang sebelumnya tidak ada.