Classifier dengan target one-hot diminta menempatkan seluruh probabilitas target pada satu kelas. Cross-entropy sendiri tidak mewajibkan representasi target seperti itu. Label smoothing mengubah distribusi target sebelum loss dihitung, sehingga model menerima gradien yang berbeda meskipun logit dan probabilitas prediksinya tidak berubah.

Perbedaan ini penting karena label smoothing bukan aturan decoding dan tidak mengubah inference secara langsung. Mekanisme ini mengubah objective saat training. Parameter model yang dihasilkan dapat berbeda karena optimizer mengikuti gradien yang dihitung terhadap target yang telah dilunakkan.

Distribusi target berubah sebelum loss dihitung

Untuk K kelas, anggap target awal bagi kelas y berbentuk one-hot:

q_i = 1 if i = y
q_i = 0 otherwise

Salah satu konvensi smoothing yang umum dengan parameter epsilon adalah:

q'_i = (1 - epsilon) q_i + epsilon / K

Dengan rumus ini, kelas target memperoleh probabilitas

1 - epsilon + epsilon / K

sedangkan setiap kelas lain memperoleh

epsilon / K

Jumlah seluruh probabilitas tetap satu. Library atau paper lain dapat memakai konvensi yang membagikan massa smoothing hanya ke kelas non-target. Karena itu, definisi epsilon perlu diperiksa sebelum dua konfigurasi dibandingkan.

Cross-entropy selanjutnya dihitung menggunakan q', bukan q:

L = -sum_i q'_i log(p_i)

Di sini p adalah distribusi probabilitas model, yang biasanya berasal dari softmax pada classifier multiclass single-label.

Target yang dilunakkan mengubah gradien logit

Untuk softmax yang diikuti cross-entropy, turunan terhadap logit z_i memiliki bentuk:

dL/dz_i = p_i - q'_i

Pada target one-hot, suku untuk kelas target adalah p_y - 1, sedangkan setiap suku non-target adalah p_i. Dengan konvensi smoothing di atas, suku kelas target menjadi

p_y - (1 - epsilon + epsilon / K)

dan suku non-target menjadi

p_i - epsilon / K

Perubahannya bersifat langsung: objective tidak lagi meminta probabilitas kelas target mendekati satu sementara semua kelas lain mendekati nol. Ketika probabilitas non-target turun di bawah massa target yang dialokasikan kepadanya, kontribusi gradiennya berubah tanda. Gradien kelas target juga mencapai nol pada probabilitas di bawah satu.

Hal ini tidak menetapkan probabilitas output tertentu saat inference. Parameter dipakai bersama oleh banyak sampel, optimisasi berlangsung terbatas, dan model harus memenuhi banyak target secara bersamaan. Persamaan tersebut menjelaskan objective dan gradien per contoh, bukan jaminan atas prediksi akhir.

Smoothing tidak setara dengan menurunkan temperature softmax

Kedua operasi dapat menghasilkan vektor probabilitas yang tampak kurang terkonsentrasi, tetapi keduanya bekerja pada titik yang berbeda.

Label smoothing memodifikasi target training. Distribusi model p tetap dihitung dari logit sesuai jalur model dan loss yang dikonfigurasi. Temperature scaling mengubah logit atau pemetaan softmax, umumnya sebagai softmax(z / T), dan dapat diterapkan saat inference tanpa mengubah parameter model.

Karena mekanismenya berbeda, menyamakan entropy dari dua vektor probabilitas tidak membuat kedua operasi dapat saling menggantikan. Label smoothing mengubah target gradien selama optimisasi; temperature mengubah pemetaan logit menjadi probabilitas pada titik tempat operasi itu diterapkan.

Konvensi smoothing mengubah arti konfigurasi

Misalkan K = 4 dan epsilon = 0.2. Dengan konvensi yang membagikan massa ke seluruh kelas:

kelas target:       0.85
setiap kelas lain:  0.05

Kelas target mempertahankan 0.8 dari komponen one-hot dan menerima tambahan 0.05 dari komponen uniform.

Konvensi lain dapat mempertahankan 1 - epsilon = 0.8 untuk target lalu membagikan 0.2 hanya kepada tiga kelas non-target:

kelas target:       0.8
setiap kelas lain:  0.066666...

Keduanya disebut label smoothing dalam praktik, tetapi nilai epsilon yang sama tidak merepresentasikan distribusi target yang sama. Reproduksi konfigurasi training membutuhkan rumus atau semantik implementasi, bukan sekadar nama parameter.

Class weighting dan smoothing bergabung sesuai implementasi

Class weight dan label smoothing memengaruhi bagian objective yang berbeda. Smoothing mengubah massa target antar-kelas. Class weighting mengubah kontribusi yang diberikan kepada kelas atau contoh sesuai definisi loss.

Jika keduanya diaktifkan, ekspresi akhirnya bergantung pada semantik weighted cross-entropy di framework yang digunakan. Gradien gabungan tidak aman disimpulkan hanya dari nama kedua fitur tersebut. Sebuah weighted loss dapat menerapkan bobot pada suku-suku dalam distribusi target yang telah dilunakkan, bukan sekadar mengalikan scalar loss akhir dengan bobot kelas dari hard target awal.

Pada sistem yang memerlukan perilaku optimisasi presisi, definisi loss merupakan bagian dari spesifikasi model. Konstruksi target, aturan reduction, label yang diabaikan, class weight, dan konvensi smoothing perlu dipandang sebagai satu objective, bukan opsi kosmetik yang berdiri sendiri.

Smoothing mengubah arti confidence saat training

Dengan target one-hot keras, penurunan cross-entropy pada sampel yang diklasifikasikan dengan benar terus memberi tekanan menuju probabilitas target sebesar satu. Dengan target yang dilunakkan, tekanan itu berubah karena target sendiri memiliki massa bukan nol di luar kelas berlabel.

Properti ini kadang diringkas sebagai pengurangan overconfidence, tetapi pernyataan yang presisi lebih sempit: objective training berhenti memakai distribusi one-hot sebagai target. Apakah model hasil training terkalibrasi dengan baik pada distribusi deployment merupakan pertanyaan empiris terpisah dan tidak dapat disimpulkan hanya dari penggunaan smoothing.

Batas implementasinya jelas. Label smoothing berada pada konstruksi target dan perhitungan loss. Parameternya hanya memiliki arti yang stabil jika rumus target diketahui, sedangkan dampaknya pada probabilitas saat deployment perlu dievaluasi terpisah dari aljabar yang mendefinisikan objective training.