Satu kamera RGB merekam koordinat gambar dan warna, bukan jarak fisik dari lensa ke setiap permukaan yang terlihat. Model kedalaman monokular memperkirakan struktur kedalaman yang hilang dari bukti visual yang dipelajari selama training. Perbedaan ini penting saat menggunakan MiDaS atau DPT: peta kedalaman yang terlihat meyakinkan tidak otomatis berarti nilai setiap piksel adalah jarak dalam meter.

MiDaS adalah proyek open-source untuk estimasi kedalaman relatif monokular yang robust. DPT, atau Dense Prediction Transformer, merupakan arsitektur untuk dense prediction yang juga digunakan sebagai backbone pada sejumlah model MiDaS. Keduanya membuat estimasi kedalaman dengan satu kamera menjadi praktis, tetapi tidak menghilangkan ambiguitas geometris yang melekat pada satu gambar RGB tanpa constraint tambahan.

Peta kedalaman belum tentu peta jarak

Model depth menghasilkan satu nilai untuk setiap lokasi pada gambar:

gambar RGB
   |
   v
depth model
   |
   v
prediksi depth yang rapat

Pada sensor metrik seperti stereo rig yang sudah dikalibrasi, kamera time-of-flight, atau LiDAR, hasil pengukuran dapat dihubungkan ke satuan fisik melalui geometri yang diketahui atau waktu propagasi sinyal.

Estimasi monokular relatif menyelesaikan masalah yang berbeda. Model berusaha mempertahankan urutan dan hubungan kedalaman dalam scene: satu permukaan lebih dekat, permukaan lain lebih jauh, dan batas pada prediksi seharusnya mengikuti struktur scene.

Peta relatif sederhana dapat terlihat seperti ini:

objek dekat       -> 0.82
objek tengah      -> 0.46
latar belakang    -> 0.18

Angka tersebut dapat menyimpan hubungan kedalaman yang berguna tanpa berarti 0,82 m, 0,46 m, dan 0,18 m. Menganggap output mentah model sebagai meter berarti memberikan satuan pada sistem yang belum pernah dikalibrasi terhadap meter.

Ambiguitas skala pada satu kamera

Batas ini berasal dari geometri proyektif, bukan karena ukuran model kurang besar.

Bayangkan sebuah objek kecil difoto dari jarak dekat. Versi objek yang secara fisik lebih besar tetapi ditempatkan lebih jauh dapat menghasilkan ukuran proyeksi yang mirip. Dengan hanya satu gambar, kamera tidak memperoleh observasi geometris kedua yang dapat menentukan skala secara unik.

Perspektif tetap memberikan banyak petunjuk:

  • ukuran objek yang tampak;
  • occlusion;
  • gradien tekstur;
  • konvergensi perspektif;
  • shading;
  • bentuk objek yang familiar.

Model terlatih dapat menggabungkan petunjuk tersebut untuk memperkirakan struktur scene yang masuk akal. Namun, prediksi yang masuk akal secara visual tidak sama dengan pengukuran jarak fisik.

Karena itu, model monokular dapat memisahkan foreground dan background dengan baik tetapi tetap tidak memiliki skala metrik global yang dapat dipercaya.

Output yang diberikan MiDaS

MiDaS dirancang untuk estimasi relative depth monokular yang robust pada beragam dataset. Repository resminya secara eksplisit membedakan output ini dari metric depth dan menunjuk pendekatan seperti ZoeDepth ketika estimasi metrik dibutuhkan.

Alur inferensi dasarnya adalah:

satu gambar RGB
      |
      v
    MiDaS
      |
      v
peta depth relatif

MiDaS berguna ketika aplikasi membutuhkan geometri scene tanpa menuntut jarak fisik yang presisi pada setiap piksel. Contohnya mencakup efek gambar berbasis depth, penalaran foreground/background, visualisasi 3D, dan penyediaan petunjuk geometris untuk tahap perception berikutnya.

Aturan implementasinya sederhana: jangan memberikan satuan seperti meter pada prediksi mentah sebelum ada proses tambahan yang menetapkan skalanya.

Posisi DPT dalam sistem

DPT merupakan singkatan dari Dense Prediction Transformer. Arsitektur ini menggunakan backbone vision transformer dan menggabungkan representasi menjadi prediksi beresolusi penuh untuk dense task seperti estimasi kedalaman monokular dan semantic segmentation.

Karena itu, DPT dan MiDaS bukan dua nama yang dapat dipertukarkan untuk hal yang sama:

DPT
  -> arsitektur dense prediction

MiDaS
  -> proyek/keluarga model relative depth monokular
  -> mencakup varian model berbasis DPT

Sebagai contoh, MiDaS menyediakan varian seperti dpt_large_384 dan dpt_hybrid_384. Memilih salah satunya mengubah arsitektur model serta trade-off kualitas dan performa; pilihan tersebut tidak dengan sendirinya mengubah relative depth menjadi jarak metrik.

Mendapatkan skala metrik membutuhkan constraint tambahan

Jika aplikasi membutuhkan sentimeter atau meter, informasi independen harus mengikat prediksi ke dunia fisik.

Salah satu pilihan adalah jarak referensi yang sudah diketahui. Misalnya, scene yang stabil memiliki titik referensi dengan jarak sebenarnya yang diketahui. Prosedur kalibrasi dapat memperkirakan pemetaan antara prediksi model dan depth fisik. Bentuk pemetaan yang tepat bergantung pada representasi output model dan tidak aman jika diasumsikan selalu berupa pengali linear universal.

Secara konseptual:

prediksi relatif + referensi metrik
               |
               v
        kalibrasi skala
               |
               v
       estimasi depth metrik

Pendekatan ini dapat bekerja pada instalasi terbatas ketika posisi kamera, optik, kelas scene, dan geometri referensi tetap stabil. Keandalannya jauh lebih rendah jika kamera berpindah ke lingkungan yang tidak terkontrol.

Pilihan kedua adalah menambahkan geometri. Pada pasangan stereo yang telah dikalibrasi, disparity berhubungan dengan depth melalui:

Z = fB / d

dengan:

  • Z sebagai depth;
  • f sebagai focal length dalam unit gambar yang kompatibel;
  • B sebagai baseline fisik antara kedua kamera;
  • d sebagai disparity.

Baseline yang diketahui menyediakan skala fisik yang tidak dimiliki satu gambar tanpa constraint.

Pilihan ketiga adalah sensor depth aktif seperti time-of-flight atau LiDAR. Sistem tersebut mengukur range melalui proses sensing fisik, bukan hanya mengandalkan petunjuk visual yang dipelajari model.

Metric depth model adalah pilihan desain yang berbeda

Sebagian neural model memang dilatih secara khusus untuk memprediksi metric depth. Pilihan ini dapat tepat ketika proyek membutuhkan perkiraan jarak fisik dari satu kamera RGB.

Perbedaannya tetap penting. Model metric monocular memperkirakan jarak dari statistik visual yang dipelajari; model tersebut tidak mengubah kamera menjadi active range sensor. Akurasi dapat bergeser karena camera intrinsics, jenis scene, rentang depth, pencahayaan, dan domain yang berbeda dari data training.

Repository MiDaS menyebut ZoeDepth sebagai pendekatan yang menggabungkan fitur relative depth dengan komponen metric depth. Tujuannya berbeda dari sekadar menafsirkan prediksi relatif mentah MiDaS sebagai meter.

Untuk ranging yang safety-critical, collision avoidance, atau pengukuran dengan batas error ketat, arsitektur sensing sebaiknya dipilih dengan memulai dari toleransi error yang dibutuhkan. Peta depth yang konsisten secara visual belum cukup menjadi bukti akurasi metrik.

Kalibrasi kamera tetap penting

Walaupun inferensi depth dilakukan oleh learned model, geometri kamera tetap memengaruhi gambar yang diterima model. Focal length, field of view, distortion, cropping, dan resizing mengubah hubungan antara scene fisik dan koordinat gambar.

Kalibrasi tradisional memperkirakan intrinsic parameters seperti:

fx, fy   focal lengths
cx, cy   principal point
k1...    lens distortion coefficients

Parameter tersebut penting untuk rekonstruksi stereo berbasis geometri dan berguna ketika predicted depth diproyeksikan menjadi koordinat 3D.

Dengan metric depth Z dan pinhole intrinsics yang sudah dikalibrasi, piksel (u, v) dapat di-back-project kira-kira sebagai:

X = (u - cx) * Z / fx
Y = (v - cy) * Z / fy
Z = Z

Jika Z hanya relatif, rekonstruksi 3D yang dihasilkan juga mewarisi skala yang tidak diketahui tersebut.

Memilih metode sensing

Metode yang tepat mengikuti kebutuhan aplikasi.

Gunakan monocular relative depth ketika targetnya adalah struktur scene dan satu kamera RGB biasa merupakan constraint yang tidak dapat diubah. MiDaS cocok untuk kelas masalah ini, sedangkan varian berbasis DPT menyediakan beberapa pilihan arsitektur dan performa.

Gunakan calibrated stereo ketika geometri metrik penting dan dua kamera dapat dipasang dengan baseline yang diketahui. Stereo juga memiliki failure mode sendiri, termasuk area minim tekstur, pola berulang, occlusion, dan kondisi pencahayaan sulit, tetapi skalanya berasal dari geometri fisik kamera.

Gunakan time-of-flight atau LiDAR ketika direct range sensing sepadan dengan tambahan hardware, daya, biaya, dan constraint lingkungan.

Gunakan metric monocular model ketika perkiraan jarak dari satu kamera RGB diperlukan dan domain deployment dapat dikarakterisasi serta divalidasi. Error model harus diukur terhadap ground-truth distance dari lingkungan operasi yang sebenarnya.

Implementasi open-source

Repository resmi MiDaS tersedia di:

https://github.com/isl-org/MiDaS

Repository DPT asli tersedia di:

https://github.com/isl-org/DPT

Kedua repository memublikasikan source code dengan MIT License. Repository MiDaS juga menyediakan dukungan inferensi dari kamera dan beberapa konfigurasi model berbasis DPT.

Untuk keputusan implementasi, bedakan lisensi source code repository dari ketentuan terpisah yang mungkin berlaku pada dependency eksternal, dataset, atau aset yang didistribusikan secara independen.

Batas teknis yang perlu dipertahankan

MiDaS dan DPT memungkinkan struktur kedalaman yang berguna diperoleh dari satu frame RGB tanpa hardware depth khusus. Namun, outputnya tetap harus ditafsirkan sesuai masalah yang diselesaikan model.

Prediksi relative depth menjawab pertanyaan seperti permukaan mana yang lebih dekat dan bagaimana kedalaman scene berubah di seluruh gambar. Sistem ranging metrik harus memiliki mekanisme tambahan untuk menetapkan skala fisik. Skala tersebut dapat berasal dari geometri yang dikalibrasi, referensi yang diketahui, active sensor, atau model yang memang dilatih dan divalidasi untuk metric depth.

Memisahkan dua jenis output ini mencegah kesalahan implementasi yang umum: mengubah prediksi AI yang terlihat masuk akal menjadi pengukuran fisik hanya dengan memberikan satuan pada angkanya.