GFPGAN vs GPEN: pilih enhancer wajah yang mana?
Keduanya model pemulihan wajah yang berjalan setelah swap, bukan model swap itu sendiri. Pilihan yang tepat bergantung pada seberapa besar wajah di layar, seberapa buruk kualitas sumbernya, dan apakah Anda mengekspor file atau menonton pratinjau live.

Jawaban singkat: GPEN-512 adalah default yang masuk akal untuk gambar dan video yang diekspor. GPEN-256 pilihan ringan untuk pratinjau live dan mesin lambat. GFPGAN memulihkan paling banyak pada wajah beresolusi rendah atau rusak berat, dengan risiko terlihat lebih halus dan kurang alami. Mematikannya tetap benar ketika wajah kecil di frame dan footage sudah bersih.
Face swap dan face enhancer adalah dua model yang mengerjakan dua tugas berbeda, dan kekeliruan memahami ini adalah sumber sebagian besar kekecewaan.
Yang tidak bisa diperbaiki enhancement
Enhancement berjalan pada area wajah setelah swap. Ia tidak bisa memperbaiki wajah sumber yang salah dipetakan ke orang yang salah, alignment yang meleset, atau tracking yang meloncat antar frame. Pada footage tidak stabil, enhancement berat justru membuat ketidakstabilan lebih terlihat karena tiap frame dipertajam sendiri-sendiri. Perbaiki pemetaan dan alignment lebih dulu — lihat panduan banyak wajah.
1. Apa yang sebenarnya dikerjakan enhancer
Model swap di Deep Face Cam adalah INSwapper 128, yang menghasilkan wajah berukuran 128×128 piksel. Potongan itu lalu di-warp kembali ke frame target. Pada shot lebar dengan wajah kecil, 128 piksel sudah lebih dari cukup. Pada close-up 1080p atau 4K, tidak — wajah hasil swap sedang diperbesar, dan itu terlihat sebagai kehilangan tekstur kulit.
Tugas enhancer adalah memulihkan area wajah itu sesudahnya. Ia memotong dan menyelaraskan wajah, menjalankan model restorasi, lalu menempelkan hasilnya kembali ke frame dengan tepi yang dilembutkan agar batasnya tidak terlihat. GFPGAN dan GPEN adalah dua model restorasi berbeda untuk langkah tersebut.
2. Empat pilihan di dalam aplikasi
Deep Face Cam menampilkan enhancer sebagai satu pilihan tunggal di Advanced options, bukan tumpukan toggle. Anda memilih salah satu:
| Pengaturan | Model | Ukuran unduhan | Diposisikan untuk |
|---|---|---|---|
| Off | — | — | Paling cepat. Mempertahankan hasil swap mentah tanpa perbaikan tambahan. |
| Fast repair | GPEN-BFR-256 | ± 76 MB | Perbaikan ringan untuk pratinjau live atau perangkat kelas bawah. |
| HD repair | GPEN-BFR-512 | ± 284 MB | Detail wajah lebih baik untuk video dan gambar, dengan biaya FPS lebih besar. |
| Strong repair | GFPGAN (1024) | ± 366 MB | Perbaikan terkuat untuk wajah buram atau beresolusi rendah; bisa tampak lebih halus dan kurang alami. |
Angka pada nama model adalah resolusi kerjanya — ukuran potongan wajah yang diproses. Itulah inti perbandingannya. GPEN-256 memulihkan wajah 256 piksel; GPEN-512 memulihkan 512 piksel sehingga punya empat kali luas piksel untuk dikerjakan; model GFPGAN di sini menyasar 1024. Resolusi kerja lebih besar berarti detail yang bisa dipulihkan lebih banyak dan komputasi per wajah lebih berat.
Tidak satu pun model ini disertakan di dalam repositori sumber. Semuanya diunduh sesuai kebutuhan ke direktori model milik Anda setelah konfirmasi, dan diverifikasi terhadap checksum SHA-256 yang dipublikasikan sebelum dipakai. Kalau berencana bekerja offline, unduh dulu enhancer yang akan dipakai sebelum memutus jaringan.
Ukuran model, resolusi kerja, dan ruang disk
| Pengaturan | Berkas model | Resolusi kerja | Luas piksel | Terhadap GPEN-256 | Unduhan |
|---|---|---|---|---|---|
| Off | — | — | — | — | — |
| Fast repair | GPEN-BFR-256.onnx | 256 × 256 | 65,536 px | 1× | 76 MB |
| HD repair | GPEN-BFR-512.onnx | 512 × 512 | 262,144 px | 4× | 284 MB |
| Strong repair | gfpgan-1024.onnx | 1024 × 1024 | 1,048,576 px | 16× | 366 MB |
Sebagai pembanding: model swap menghasilkan wajah 128 × 128, yaitu 16.384 piksel. HD repair membangun ulang wajah itu pada 16 kali luas piksel tersebut, dan Strong repair pada 64 kali. Inilah alasan enhancement lebih penting pada close-up daripada shot lebar.
| Kelompok unduhan | Berkas | Ukuran |
|---|---|---|
| Wajib untuk berjalan | inswapper_128.onnx + buffalo_l.zip | 843 MB |
| Varian swap opsional | inswapper_128_fp16.onnx | 278 MB |
| Ketiga enhancer | GPEN-256 + GPEN-512 + GFPGAN | 726 MB |
| Semuanya | 6 | ≈ 1.85 GB |
Ukuran diambil dari nilai yang dipublikasikan di manifest model; setiap berkas diverifikasi checksum setelah diunduh dan disimpan di direktori model pengguna. Di Apple silicon, berkas cache CoreML dibuat sebagai tambahan.
3. Cara memilih berdasarkan situasi
Pertanyaan yang berguna bukan “model mana yang terbaik”, melainkan “berapa piksel yang ditempati wajah, dan seberapa buruk footage sumbernya”. Dua jawaban itu yang memilihkan modelnya.
| Situasi | Mulai dari | Alasan |
|---|---|---|
| Foto potret, wajah memenuhi frame | HD repair (GPEN-512) | Resolusi kerja cukup untuk wajah besar tanpa risiko terlalu halus seperti model terkuat. |
| Video talking-head 1080p | HD repair (GPEN-512) | Keseimbangan terbaik antara detail dan biaya per frame. |
| Shot lebar, wajah kecil | Off atau Fast repair | Ukuran patch swap sudah mendekati ukuran wajah di layar; enhancement sebagian besar hanya menambah waktu. |
| Footage lama, terkompresi, resolusi rendah | Strong repair (GFPGAN) | Restorasi paling agresif, dan itulah yang dibutuhkan input rusak berat. |
| Pratinjau webcam live | Fast repair (GPEN-256), bila tersedia | Model terkecil, latensi terendah; lihat syarat runtime di bawah. |
| Adegan banyak orang | Off dulu, baru naikkan | Enhancement berjalan per wajah, jadi biayanya berlipat mengikuti jumlah wajah. |
4. Kompromi yang tidak tertulis di layar pengaturan
Detail versus identitas. Model restorasi merekonstruksi detail wajah yang masuk akal. Makin kuat restorasinya, makin besar pengaruh “bagaimana seharusnya wajah terlihat” menurut model. Pada input rusak berat itu justru yang diinginkan. Pada wajah yang sudah lumayan, itu bisa diam-diam menggeser tekstur kulit dan mikro-ekspresi — hasilnya lebih bersih dan sedikit kurang mirip orangnya. Strong repair paling berisiko di sini.
Terlalu halus. Keluhan paling umum tentang restorasi agresif adalah tampilan seperti lilin: tekstur kulit hilang, kerutan rata. Kalau hasilnya terlihat “terlalu bersih” dibanding sekitarnya, turunkan satu tingkat model, jangan menutupinya dengan sharpening.
Ketimpangan wajah dan latar. Enhancement hanya diterapkan pada area wajah. Pada footage berkualitas rendah, wajah yang dipulihkan kuat di tengah adegan yang berbintik justru terbaca palsu. Nilailah seluruh frame, jangan wajah yang di-crop.
Konsistensi antar frame. Pada video, tiap frame dipulihkan sendiri-sendiri. Perbedaan kecil antar frame bisa muncul sebagai kerlip di kulit atau batas wajah — paling terlihat justru pada frame yang memang sudah sulit: motion blur, perubahan cahaya, wajah menyamping.
Biaya per wajah, bukan per frame. Enhancement berjalan sekali untuk tiap wajah terdeteksi. Empat wajah dalam satu frame berarti empat pass enhancement di atas empat swap. Ini alasan terbesar render banyak orang jauh lebih lama dari perkiraan.
5. Pratinjau live punya syarat runtime yang tegas
Ini detail praktis yang paling sering mengejutkan. Di Deep Face Cam, perbaikan wajah saat live aktif ketika runtime memakai CUDA atau DirectML. Saat aplikasi berjalan di execution provider lain, pipeline live hanya menjalankan face swapper, dan aplikasi menyatakannya di panel opsi.
Pembuatan gambar dan video tidak terpengaruh — enhancer apa pun tetap bisa dipakai untuk ekspor di runtime tersebut. Yang kehilangan tahap enhancement khusus jalur kamera live. Kalau kualitas pratinjau live adalah prioritas, syarat itu semestinya menentukan build mana yang Anda pasang. Lihat panduan tukar wajah real-time.
Urutan preferensi provider di backend adalah CUDA, lalu ROCm, CoreML, DirectML, kemudian CPU. Di Apple silicon aplikasi memakai CoreML provider dari ONNX Runtime, jalur yang bagus untuk ekspor tetapi tidak memenuhi syarat enhancer live di atas.
6. Cara mengujinya sendiri dalam sepuluh menit
Perbandingan model hanya bermakna pada footage dan perangkat keras Anda sendiri. Uji yang bisa diulang itu singkat:
- Ambil satu klip close-up, satu shot lebar, dan satu yang kualitasnya jelas buruk.
- Ekspor tiap klip empat kali — Off, Fast, HD, Strong — tanpa mengubah apa pun yang lain.
- Bandingkan pada zoom 100% di frame penuh, bukan pada wajah yang di-crop.
- Catat waktu render tiap pass, plus spesifikasi mesin dan execution provider.
- Untuk live, aktifkan Show FPS dan catat frame rate dengan enhancer mati dan hidup.
- Cari secara khusus: efek terlalu halus, kerlip di batas wajah, dan ketimpangan wajah dengan latar.
Simpan tabel itu di catatan proyek. Nilainya jauh melebihi benchmark generik mana pun, karena biaya enhancement bergantung pada provider, resolusi, dan jumlah wajah di frame Anda.
FAQ
Apakah GFPGAN lebih baik daripada GPEN?
Tidak ada yang unggul secara mutlak. GFPGAN adalah restorasi terkuat dan tepat untuk wajah beresolusi rendah atau rusak berat, tetapi paling mungkin terlihat terlalu halus. GPEN-512 default seimbang untuk gambar dan video. GPEN-256 pilihan ringan saat kecepatan lebih penting daripada detail.
Apakah saya perlu enhancer sama sekali?
Tidak selalu. Swap menghasilkan patch wajah 128 piksel, jadi enhancement paling terasa ketika wajah besar di layar atau sumbernya buruk. Pada wajah kecil di footage bersih, “Off” sering lebih alami sekaligus paling cepat.
Bisakah enhancement memperbaiki face swap yang gagal?
Tidak. Ia tidak bisa memperbaiki pemetaan identitas, alignment, atau tracking yang tidak stabil, dan justru bisa membuat ketidakstabilan lebih terlihat. Perbaiki itu dulu, baru tentukan enhancement.
Kenapa render jadi jauh lebih lambat setelah enhancer diaktifkan?
Karena enhancement berjalan per wajah terdeteksi dan menambahkan satu pass restorasi penuh di atas tiap swap. Pada footage berisi banyak orang biayanya berlipat.
Di mana model enhancement disimpan?
Di direktori model milik pengguna, diunduh setelah konfirmasi eksplisit dan diverifikasi checksum. Model tidak ikut di repositori sumber, itulah sebabnya pemakaian pertama sebuah enhancer membutuhkan koneksi jaringan.
Pilih enhancer dari footage-nya, bukan dari nama modelnya
Uji Off, Fast, HD, dan Strong pada klip Anda sendiri, bandingkan frame penuh alih-alih wajah yang di-crop, dan simpan waktu render di sebelah hasilnya.