Decoder dapat mempertahankan peringkat seluruh token sebelum dan sesudah temperature scaling, tetapi menghasilkan probabilitas yang berbeda cukup jauh. Mekanismenya spesifik: untuk temperature positif T, logit dibagi dengan T sebelum softmax. Pembagian dengan skalar positif yang sama mempertahankan urutan, sedangkan softmax mengubah jarak logit yang baru menjadi distribusi probabilitas yang berbeda.

Pemisahan ini relevan pada sistem inferensi karena temperature tidak memilih token dengan sendirinya. Dampak yang terlihat bergantung pada tahap setelah softmax yang sudah diskalakan: sampling langsung, filter top-k, filter top-p, pemilihan greedy, atau aturan decoding lain.

Temperature positif mempertahankan peringkat logit

Misalkan model menghasilkan logit z_i untuk item kosakata i. Temperature scaling membentuk

p_i(T) = exp(z_i / T) / sum_j exp(z_j / T)

untuk T > 0.

Jika z_a > z_b, maka z_a / T > z_b / T. Fungsi eksponensial meningkat secara ketat, sementara denominator softmax digunakan bersama oleh semua token. Akibatnya, p_a(T) > p_b(T) untuk setiap T positif dan berhingga.

Dengan definisi ini, temperature tidak dapat menukar urutan logit yang nilainya berbeda. Logit yang sama tetap memiliki peringkat yang sama. Ini merupakan sifat matematis dari penskalaan positif yang seragam, bukan pernyataan mengenai seluruh pipeline decoding. Sistem yang menerapkan penalty, mask, bias, truncation, atau pemroses logit lain per token dapat mengubah urutan sebelum atau sesudah operasi temperature, bergantung pada implementasinya.

Rasio probabilitas menunjukkan perubahan yang terjadi

Rasio antara probabilitas dua token menghilangkan denominator softmax:

p_a(T) / p_b(T) = exp((z_a - z_b) / T)

Ekspresi ini memisahkan dampak temperature. Untuk selisih logit positif yang tetap, T yang lebih kecil memperbesar rasio probabilitas, sedangkan T yang lebih besar menggeser rasio mendekati 1.

Ambil logit 3 dan 1. Selisihnya 2:

T = 0.5  -> ratio = exp(4)
T = 1.0  -> ratio = exp(2)
T = 2.0  -> ratio = exp(1)

Token dengan logit lebih tinggi tetap berada di atas pada ketiga kasus. Yang berubah adalah massa relatif yang diterimanya dibanding token dengan logit lebih rendah.

Sudut pandang berpasangan ini juga menghindari ambiguitas frasa seperti “lebih acak.” Temperature mengubah distribusi kategorikal yang diberikan kepada sampler. Token hasil tetap merupakan pengambilan acak hanya ketika prosedur decoding berikutnya benar-benar melakukan sampling dari distribusi tersebut.

Greedy decoding dapat membuat temperature tidak berpengaruh pada pilihan

Greedy decoding murni memilih token dengan skor terbesar. Jika temperature adalah satu-satunya transformasi dan T positif serta berhingga, argmax tidak berubah karena peringkat logit tidak berubah.

Artinya, perubahan temperature saja tidak mengubah token terpilih pada decoder greedy yang ideal. Beberapa implementasi tetap menyediakan parameter temperature ketika mode greedy melewati proses sampling, sehingga keberadaan konfigurasi pada API bukan bukti bahwa temperature ikut menentukan token.

Pernyataan tersebut juga memiliki batas. Perilaku numerik pada nilai ekstrem, perlakuan khusus untuk T = 0, dan urutan pemroses logit lain merupakan detail implementasi. Banyak library memperlakukan temperature nol sebagai permintaan decoding deterministik alih-alih benar-benar melakukan pembagian dengan nol. Konvensi itu adalah keputusan API, bukan bagian dari rumus softmax di atas.

Top-k dan top-p merespons secara berbeda

Top-k mempertahankan sejumlah tetap kandidat dengan peringkat tertinggi. Karena temperature scaling positif mempertahankan peringkat, penerapan top-k setelah temperature tidak mengubah identitas k token teratas, dengan asumsi tidak ada transformasi skor lain di antaranya. Probabilitas yang dinormalisasi di dalam set tersebut tetap dapat berubah.

Top-p berbeda karena batasnya ditentukan oleh massa probabilitas kumulatif, bukan jumlah peringkat yang tetap. Distribusi yang lebih tajam dapat mencapai ambang probabilitas dengan lebih sedikit token; distribusi yang lebih datar dapat memerlukan lebih banyak token. Jumlah kandidat yang tepat bergantung pada logit, nilai ambang, dan detail implementasi seperti posisi filtering terhadap tahap normalisasi tertentu.

Karena itu, temperature dapat mengubah set kandidat top-p tanpa pernah mengubah peringkat logit. Ini memisahkan dampak peringkat dari dampak massa: top-k terutama dibatasi oleh peringkat, sedangkan top-p dibatasi oleh massa probabilitas.

Kasus batas memperjelas mekanismenya

Saat T mendekati nol dari sisi positif, perbedaan antarlogit yang telah diskalakan membesar. Massa probabilitas terkonsentrasi pada entri dengan logit maksimum. Jika hanya ada satu maksimum, probabilitasnya mendekati 1. Jika beberapa maksimum memiliki nilai yang persis sama, massa pada limit dibagi di antara entri yang sama tersebut; temperature scaling sendiri tidak memilih salah satunya.

Saat T membesar tanpa batas, setiap logit berhingga yang dibagi T mendekati nol. Pada set kandidat berhingga yang tidak terkena mask, distribusi softmax mendekati probabilitas seragam di antara kandidat tersebut.

Keduanya merupakan limit matematis. Decoder produksi bekerja dengan presisi numerik berhingga, dapat melakukan mask pada sebagian kosakata, serta dapat membatasi atau menolak rentang parameter tertentu. Limit tersebut menjelaskan transformasinya, bukan jaminan API untuk nilai parameter ekstrem.

Temperature tidak memperbaiki semantik skor model

Softmax yang lebih datar atau lebih tajam tidak menambahkan informasi ke logit. Operasi ini menerapkan transformasi satu parameter pada selisih relatif antarlogit. Jika model memberi skor tinggi pada token yang tidak sesuai, temperature tidak mengidentifikasi token itu sebagai tidak sesuai; temperature hanya mengubah seberapa kuat perbedaan skor memengaruhi probabilitas hasil.

Batas yang sama berlaku ketika probabilitas token ditafsirkan sebagai confidence. Logit generasi adalah skor kondisional atas kosakata token berikutnya berdasarkan model dan konteks saat ini. Penyesuaian temperature mengubah probabilitas tersebut secara mekanis. Operasi itu sendiri tidak menetapkan kalibrasi terhadap definisi kebenaran eksternal.

Pada sistem serving, temperature lebih tepat diperlakukan sebagai satu tahap dalam kontrak decoding. Dampak matematisnya ditentukan oleh penskalaan skalar positif sebelum softmax, sedangkan perilaku generasi yang terlihat juga bergantung pada mask, penalty, aturan truncation, sampling, random state, serta urutan penerapannya oleh runtime. Dua endpoint dengan nilai temperature yang sama tidak harus berperilaku identik jika bagian lain dari kontrak tersebut berbeda.