Cara tukar wajah banyak orang dalam satu video secara lokal
Video berisi beberapa orang menimbulkan dua masalah sekaligus: menentukan siapa mendapat wajah apa, lalu menjaga keputusan itu tetap stabil saat mereka berpapasan dan keluar-masuk frame.

Jawaban singkat: Aplikasi desktop lokal menangani video berisi banyak orang dengan dua cara. Satu wajah sumber dipakai untuk semua wajah yang terdeteksi, atau setiap orang dipetakan ke foto sumbernya sendiri. Cara kedua inilah yang biasanya dimaksud sebagai tukar wajah banyak orang, dan pemetaannya harus dikonfirmasi sebelum render, bukan sesudah.
Video satu wajah relatif memaafkan kesalahan: hanya ada satu wajah untuk dicari, satu identitas untuk diikuti, dan satu blending untuk diatur. Video berisi beberapa orang mengubah ketiganya. Detektor mengembalikan beberapa wajah per frame, aplikasi harus memutuskan wajah mana milik identitas mana, dan keputusan itu harus bertahan melewati oklusi, putaran kepala, dan pergantian shot.
Karena itu keluhan paling umum bukan hasil blending yang jelek, melainkan wajah yang mendarat pada orang yang salah selama beberapa frame.
Izin bertambah seiring jumlah orang
Klip berisi banyak orang membutuhkan izin dari setiap orang yang dapat dikenali, bukan hanya dari yang merekam atau yang paling menonjol. Tentukan sejak awal cara memberi label bahwa hasilnya sudah diubah, dan jangan gunakan tukar wajah untuk penyamaran, penipuan, verifikasi identitas, pelecehan, atau konten intim tanpa persetujuan. Lihat kebijakan penggunaan bertanggung jawab.
1. Dua hal berbeda yang sama-sama disebut tukar wajah banyak orang
Sebelum menyentuh pengaturan apa pun, pastikan hasil mana yang Anda inginkan. Deep Face Cam menampilkan keduanya sebagai kontrol terpisah di Advanced options → Faces, dan keduanya memang saling meniadakan.
| Kontrol | Yang sebenarnya dilakukan | Pakai ketika |
|---|---|---|
| Swap all faces | Memproses setiap wajah yang terdeteksi memakai satu wajah sumber default yang sama. | Anda ingin satu identitas diterapkan ke banyak orang sekaligus, atau sekadar uji cepat. |
| Map faces manually | Memasangkan setiap wajah target dengan wajah sumbernya sendiri. Tahap pemetaan terbuka sebelum generasi dan otomatis mematikan Swap all faces. | Dua orang atau lebih masing-masing butuh wajah berbeda — kasus banyak orang yang sesungguhnya. |
Inilah kesalahan setup paling sering: mengaktifkan “swap all faces” lalu berharap hasil per orang. Mode itu hanya punya satu wajah sumber dan menerapkannya ke semua orang. Jika orang A harus jadi wajah tertentu dan orang B wajah lain, Anda butuh pemetaan manual.
2. Siapkan satu foto sumber untuk setiap identitas
Setiap identitas yang dipetakan butuh foto sumbernya sendiri, dan semuanya harus memenuhi standar yang sama seperti swap satu wajah: tajam, pencahayaan merata, relatif menghadap depan, tanpa kacamata hitam, tanpa rambut menutupi wajah, tanpa filter kecantikan berlebihan. Foto sumber yang lemah tidak akan tersamarkan di tengah keramaian — ia justru membuat satu orang di video Anda terlihat lebih buruk daripada yang lain.
Usahakan foto-foto sumber terlihat jelas berbeda satu sama lain. Kalau dua foto sumber mirip dalam framing, crop, dan pencahayaan, kesalahan pemasangan jauh lebih sulit terlihat saat Anda meninjau hasil ekspor.
Untuk target, pilih segmen uji pendek, bukan hasil akhir. Segmen uji yang baik memuat setidaknya satu momen ketika subjek berpapasan atau saling menutupi, satu putaran wajah ke samping untuk tiap orang, dan satu pergantian shot.
3. Konfirmasi pemetaan sebelum render
Dengan pemetaan manual aktif, aplikasi menganalisis target dan membuka tahap pemetaan sebelum proses dimulai. Ini titik pemeriksaan yang paling menghemat waktu. Pastikan di sana bahwa setiap wajah target yang Anda pedulikan sudah punya sumber, dan pasangannya memang yang Anda maksud — bukan sekadar “ada wajah yang muncul di layar”.
Untuk target gambar dan video, pemetaan dibangun dari wajah yang ditemukan di media target, dan untuk video aplikasi mencatat wajah mana berada di frame mana. Karena itu pemetaan video layak dikonfirmasi pada segmen yang representatif: kualitas pemetaan hanya sebaik hasil deteksinya.
Kamera live berbeda. Tidak ada file target untuk dianalisis lebih dulu, sehingga sesi live mencocokkan wajah frame demi frame memakai embedding dan memilih kecocokan terdekat untuk setiap identitas. Itu keputusan kemiripan yang dibuat terus-menerus, dan itulah alasan pemetaan banyak orang di mode live lebih rapuh daripada file video yang sudah dipetakan. Kalau hasil per orang harus akurat, pakai alur file dan perlakukan live sebagai pratinjau. Rinciannya ada di panduan tukar wajah real-time.
4. Wajah tertukar: kenapa bisa mendarat di orang yang salah
Kegagalan yang paling sering dilaporkan adalah wajah yang mendarat pada orang salah selama beberapa frame. Ini bukan kejadian acak. Penugasan digerakkan oleh deteksi dan kemiripan, jadi ia melemah pada situasi yang bisa diprediksi:
- Berpapasan: dua subjek bertumpuk dan satu wajah tertutup sebagian, sehingga deteksi sesaat menghasilkan wajah yang lebih sedikit atau bergeser.
- Wajah menyamping: wajah yang jauh dari posisi frontal menghasilkan kecocokan lebih lemah daripada orang di sebelahnya.
- Masuk kembali: seseorang keluar frame lalu kembali; tidak ada jaminan ia mendapat penugasan yang sama seperti sebelumnya.
- Wajah mirip: usia, gaya rambut, kacamata, atau pencahayaan yang serupa mempersempit jarak antara dua identitas.
- Pergantian shot: cut mengganti seluruh adegan, dan shot baru dicocokkan dari nol.
- Jarak: wajah kecil di latar belakang punya jauh lebih sedikit detail untuk dicocokkan dibanding close-up.
Penanganan praktis, berurutan dari yang paling layak dicoba: potong klip pada batas shot dan proses tiap shot terpisah; jangan petakan wajah latar yang sebenarnya tidak perlu diganti; konfirmasi ulang pemetaan setelah ada orang yang masuk kembali; dan gunakan foto sumber yang jelas berbeda supaya kesalahan langsung terlihat.
5. Render banyak wajah lebih mahal, kira-kira per wajah
Frame dengan empat wajah terpetakan bukan pekerjaan yang sama dengan frame berisi satu wajah. Setiap pasangan sumber-target dijalankan terpisah melalui model swap lalu ditempelkan berurutan ke frame, sehingga waktu proses pada satu frame tumbuh mengikuti jumlah wajah yang ditukar di frame itu — bukan hanya mengikuti resolusi video.
Face enhancement melipatgandakan efeknya karena enhancer juga berjalan per wajah. Mengaktifkan HD repair pada adegan berisi empat orang berarti empat pass enhancement per frame di atas empat swap. Kalau render banyak wajah terasa sangat lambat, pengaturan enhancer biasanya yang pertama perlu diperiksa, bukan swap-nya.
| Faktor | Efek pada render banyak wajah | Yang perlu dilakukan |
|---|---|---|
| Jumlah wajah per frame | Beban swap tumbuh kira-kira linear terhadap wajah terpetakan. | Petakan hanya orang yang memang perlu diganti. |
| Face enhancer | Berjalan sekali per wajah, di atas swap. | Uji dulu tanpa enhancer, baru tambahkan. |
| Execution provider | CPU jalur paling lambat; backend GPU berbeda tiap platform. | Sesuaikan build dengan mesin — lihat panduan enhancer. |
| Durasi klip | Kesalahan yang ketahuan telat memakan seluruh render. | Selalu validasi pada segmen pendek dulu. |
| Frame sementara | Proses video bekerja lewat frame yang diekstrak ke disk. | Sediakan ruang kosong dan pakai folder output khusus. |
Biaya render menurut jumlah wajah
Deteksi berjalan sekali per frame. Swap dan enhancement berjalan sekali per wajah. Aritmetikanya sederhana, dan justru aritmetika inilah — bukan resolusi — yang menjelaskan sebagian besar waktu render multi-wajah.
| Wajah terpetakan di frame | Deteksi | Jumlah swap | Jumlah enhancement (bila aktif) | Inferensi model per frame | Beban swap + perbaikan |
|---|---|---|---|---|---|
| 1 | 1× | 1 | 1 | 3 | 1.0× |
| 2 | 1× | 2 | 2 | 5 | 2.0× |
| 3 | 1× | 3 | 3 | 7 | 3.0× |
| 4 | 1× | 4 | 4 | 9 | 4.0× |
| 6 | 1× | 6 | 6 | 13 | 6.0× |
Kolom terakhir hanya menghitung swap dan enhancement, karena deteksi dihitung per frame, bukan per wajah. Waktu nyata di atasnya masih bergantung pada execution provider, resolusi sumber atau capture, dan pilihan enhancer.
6. Tinjau hasil ekspor untuk penugasan, bukan hanya kualitas
Tinjauan satu wajah bertanya “apakah ini terlihat benar?”. Tinjauan banyak wajah bertanya “apakah wajah yang benar ada pada orang yang benar, di setiap shot?”. Itu dua pass berbeda dan butuh perhatian berbeda.
Periksa hasil ekspor khusus pada momen berpapasan, pada setiap pergantian shot, dan setiap kali ada orang masuk atau keluar frame. Tonton momen itu pada kecepatan normal lebih dulu — pertukaran identitas selama satu detik sering tak terlihat saat diperiksa frame demi frame, tetapi jelas saat diputar normal. Baru setelah itu nilai kualitas blending secara terpisah.
Simpan hasil ekspor uji, pemetaan yang dipakai, versi aplikasi, dan versi model di catatan proyek. Kalau nanti perlu koreksi, catatan itu mengubah tebak-tebakan menjadi pengulangan.
Kesalahan yang sering terjadi
- Memakai “swap all faces” padahal tiap orang butuh sumber berbeda.
- Merender klip penuh sebelum mengonfirmasi pemetaan pada segmen uji.
- Memetakan semua wajah terdeteksi, termasuk figuran latar yang tidak perlu diganti.
- Memakai dua foto sumber yang nyaris identik sehingga kesalahan penugasan tersamar.
- Memproses editan multi-shot sebagai satu file, bukan per shot.
- Menilai hasil frame demi frame dan melewatkan pertukaran identitas yang singkat.
- Mengambil izin dari satu orang dalam klip berisi banyak orang dan menganggapnya berlaku untuk semua.
FAQ
Bisakah menukar dua wajah berbeda dalam satu video?
Bisa. Itulah fungsi pemetaan manual: setiap wajah target dipasangkan dengan foto sumbernya sendiri, sehingga dua orang dalam satu shot bisa menerima dua wajah berbeda. Toggle “swap all faces” tidak bisa melakukannya karena hanya memakai satu sumber default.
Berapa banyak wajah yang bisa ditukar sekaligus?
Pemetaan dibangun dari wajah yang ditemukan detektor pada target Anda, jadi batas praktisnya ditentukan kualitas deteksi dan waktu proses, bukan angka tetap. Wajah kecil, jauh, atau banyak tertutup adalah yang pertama menjadi tidak andal.
Kenapa wajahnya mendarat pada orang yang salah?
Karena penugasan bergantung pada deteksi dan kemiripan, dan keduanya melemah saat berpapasan, wajah menyamping, masuk kembali ke frame, dan pergantian shot. Potong klip per shot, petakan lebih sedikit wajah, dan pakai foto sumber yang jelas berbeda.
Apakah tukar wajah banyak orang butuh GPU?
Jalur CPU bisa jalan, tetapi justru di sinilah selisihnya paling terasa, karena biayanya dikalikan jumlah wajah per frame. Sesuaikan build dan execution provider dengan perangkat keras yang benar-benar Anda punya.
Bisakah tukar wajah banyak orang di kamera live?
Sesi live bisa menangani lebih dari satu orang, tetapi mencocokkan wajah secara terus-menerus berdasarkan kemiripan, bukan dari file yang sudah dianalisis. Penugasannya lebih rapuh, jadi pakailah sebagai pratinjau.
Petakan wajahnya sebelum merender adegan ramai
Konfirmasi setiap pasangan sumber-target pada segmen pendek, simpan footage di perangkat sendiri, dan ekspor hanya setelah penugasannya bertahan melewati papasan dan cut.