Calidad y modelos

GFPGAN vs GPEN: ¿qué mejora facial deberías usar?

Ambos son modelos de restauración facial que se ejecutan después del intercambio, no modelos de intercambio. La elección depende del tamaño de la cara en pantalla, del estado del material y de si exportas un archivo o miras una vista previa en directo.

  • Actualizado el 25 de julio de 2026
  • 11 min de lectura

Respuesta rápida: GPEN-512 es el valor por defecto sensato para imágenes y vídeo exportados. GPEN-256 es la opción ligera para la vista previa en directo y equipos modestos. GFPGAN restaura más en caras muy degradadas o de baja resolución, a costa de un acabado más liso y menos natural. Desactivarlo sigue siendo correcto cuando la cara es pequeña en cuadro y el material ya está limpio.

El intercambio de caras y la mejora facial son dos modelos con dos tareas distintas, y confundirlos es el origen de la mayoría de las decepciones.

Lo que la mejora facial no puede arreglar

La mejora se aplica a la región de la cara después del intercambio. No corrige que se haya asignado el origen equivocado a la persona equivocada, ni una alineación deficiente, ni un seguimiento que salta entre fotogramas. En material inestable, una mejora agresiva suele hacer la inestabilidad más visible, porque cada fotograma se restaura por su cuenta. Arregla antes la asignación: ver la guía multicara.

1. Qué hace realmente una mejora facial aquí

El modelo de intercambio de Deep Face Cam es INSwapper 128, que produce una cara de 128×128 píxeles. Ese parche se deforma después sobre el fotograma de destino. En un plano general donde la cara ocupa poco, 128 píxeles sobran. En un primer plano a 1080p o 4K, no: la cara intercambiada se está ampliando, y eso se nota como pérdida de textura de piel.

El trabajo del enhancer es restaurar esa región después. Recorta y alinea la cara, ejecuta un modelo de restauración y devuelve el resultado al fotograma con un borde difuminado para que la unión no se vea. GFPGAN y GPEN son dos modelos distintos para ese paso.

2. Las cuatro opciones de la aplicación

Deep Face Cam presenta la mejora como una única elección en Advanced options, no como una pila de interruptores. Eliges una:

AjusteModeloDescargaPensado para
OffLo más rápido. Mantiene el resultado del intercambio sin restauración extra.
Fast repairGPEN-BFR-256≈ 76 MBRestauración ligera para vista previa en directo o equipos modestos.
HD repairGPEN-BFR-512≈ 284 MBMejor detalle facial en vídeo e imagen, con más coste de FPS.
Strong repairGFPGAN (1024)≈ 366 MBLa restauración más fuerte para caras borrosas o de baja resolución; puede quedar más lisa y menos natural.

El número del nombre es la resolución de trabajo: el tamaño del recorte facial alineado sobre el que opera el modelo. Ahí está el núcleo de la comparación. GPEN-256 restaura una cara de 256 píxeles; GPEN-512 trabaja con cuatro veces más superficie; el modelo GFPGAN incluido apunta a 1024. Más resolución de trabajo significa más detalle recuperable y más cómputo por cara.

Ninguno de estos modelos viaja dentro del repositorio. Se descargan bajo demanda a tu directorio de modelos tras confirmación y se verifican contra una suma SHA-256 publicada antes de usarse. Si vas a trabajar sin conexión, descarga antes el enhancer que pienses usar.

Tamaño de modelos, resolución de trabajo y espacio en disco

AjusteArchivo de modeloResolución de trabajoÁrea en píxelesFrente a GPEN-256Descarga
Off
Fast repairGPEN-BFR-256.onnx256 × 25665,536 px76 MB
HD repairGPEN-BFR-512.onnx512 × 512262,144 px284 MB
Strong repairgfpgan-1024.onnx1024 × 10241,048,576 px16×366 MB

Como referencia: el modelo de intercambio produce una cara de 128 × 128, es decir 16.384 píxeles. HD repair reconstruye esa cara con 16 veces esa área, y Strong repair con 64 veces. Esa es exactamente la razón por la que la mejora importa más en primeros planos que en planos generales.

Grupo de descargaArchivosTamaño
Necesario para funcionarinswapper_128.onnx + buffalo_l.zip843 MB
Variante de intercambio opcionalinswapper_128_fp16.onnx278 MB
Los tres enhancersGPEN-256 + GPEN-512 + GFPGAN726 MB
Todo6≈ 1.85 GB

Los tamaños son los valores publicados en el manifiesto de modelos; cada archivo se verifica por checksum tras descargarse y se guarda en tu directorio de modelos. En Apple silicon se escriben además archivos de caché CoreML.

3. Cómo elegir según la situación

La pregunta útil no es «cuál es el mejor modelo», sino «cuántos píxeles ocupa la cara y cómo de malo es el material». Esas dos respuestas eligen por ti.

SituaciónEmpieza porMotivo
Retrato, la cara llena el encuadreHD repair (GPEN-512)Resolución de trabajo suficiente sin el riesgo de alisado del modelo más fuerte.
Vídeo de busto parlante a 1080pHD repair (GPEN-512)El mejor equilibrio entre detalle y coste por fotograma.
Plano general con caras pequeñasOff o Fast repairEl parche del intercambio ya se acerca al tamaño en pantalla; la mejora aporta sobre todo tiempo.
Material antiguo, comprimido o de baja resoluciónStrong repair (GFPGAN)La restauración más agresiva, que es lo que pide una entrada muy degradada.
Vista previa de webcamFast repair (GPEN-256), si está disponibleModelo más pequeño y menor latencia; ver el requisito de runtime más abajo.
Plano de grupoPrimero Off, luego subeLa mejora se ejecuta por cara, así que el coste se multiplica.

4. Los compromisos que no aparecen en la pantalla de ajustes

Detalle frente a identidad. Los modelos de restauración reconstruyen detalle facial plausible. Cuanto más fuerte es la restauración, más pesa lo que el modelo considera que debe ser una cara. En una entrada muy degradada eso es justo lo que quieres. En una cara ya decente puede desplazar sutilmente la textura de la piel y la microexpresión: el resultado se ve más limpio y algo menos parecido a la persona.

Alisado excesivo. La queja más común sobre la restauración agresiva es un acabado de cera: sin textura de piel, sin barba incipiente, arrugas planchadas. Si el resultado parece «demasiado limpio» junto al entorno, baja un modelo en lugar de compensar con nitidez.

Desajuste entre cara y fondo. La mejora se aplica solo a la cara. En material de baja calidad, una cara fuertemente restaurada dentro de una escena con grano se lee como falsa aunque aislada se vea bien. Juzga el fotograma entero, nunca un recorte.

Consistencia temporal. En vídeo, cada fotograma se restaura por separado. Pequeñas diferencias entre fotogramas aparecen como parpadeo en la piel o en el borde de la cara, sobre todo en los fotogramas que ya eran difíciles.

Coste por cara, no por fotograma. La mejora se ejecuta una vez por cara detectada. Cuatro caras significan cuatro pasadas además de cuatro intercambios: la razón principal de que los renders de grupo tarden mucho más de lo esperado.

5. La vista previa en directo tiene un requisito claro

Este es el detalle práctico que más sorprende. En Deep Face Cam, la reparación facial en directo se activa cuando el runtime usa CUDA o DirectML. Con otro execution provider, la cadena en vivo ejecuta solo el intercambio, y la aplicación lo indica en el panel de opciones.

La generación de imagen y vídeo no se ve afectada: en esos runtimes puedes seguir usando cualquier enhancer para exportar. Es específicamente la ruta de cámara en vivo la que prescinde de la etapa de mejora. Si la calidad en directo es tu prioridad, ese requisito debería decidir qué build instalas. Ver la guía de tiempo real.

El orden de preferencia de proveedores en el backend es CUDA, luego ROCm, CoreML, DirectML y CPU. En Apple silicon la aplicación usa el proveedor CoreML de ONNX Runtime, buena ruta para exportar pero que no cumple la condición anterior.

6. Cómo probarlo tú mismo en diez minutos

Las comparativas de modelos solo tienen sentido sobre tu material y tu hardware. La prueba repetible es corta:

  • Elige un clip en primer plano, uno en plano general y uno de calidad visiblemente mala.
  • Exporta cada uno cuatro veces —Off, Fast, HD, Strong— sin cambiar nada más.
  • Compara al 100 % sobre el fotograma completo, no sobre la cara recortada.
  • Anota el tiempo real de render de cada pasada, junto con tu equipo y el execution provider.
  • Para directo, activa Show FPS y anota la tasa con el enhancer desactivado y activado.
  • Busca específicamente alisado excesivo, parpadeo en el borde y desajuste entre cara y fondo.

Guarda esa tabla con las notas del proyecto. Vale mucho más que cualquier benchmark genérico, porque el coste depende de tu proveedor, tu resolución y cuántas caras hay en cuadro.

Preguntas frecuentes

¿GFPGAN es mejor que GPEN?

Ninguno es mejor de forma universal. GFPGAN es la restauración más fuerte y la adecuada para caras muy degradadas, pero es la que más tiende a alisar. GPEN-512 es el equilibrio por defecto para imagen y vídeo. GPEN-256 es la opción ligera cuando importa más la velocidad.

¿Necesito una mejora facial siempre?

No. El intercambio produce un parche de 128 píxeles, así que la mejora importa sobre todo con caras grandes en pantalla o material degradado. Con caras pequeñas y material limpio, «Off» suele ser lo más natural y siempre lo más rápido.

¿La mejora puede arreglar un mal face swap?

No. No corrige la asignación de identidad, la alineación ni un seguimiento inestable, y puede hacer más visible la inestabilidad. Arregla eso primero.

¿Por qué el render se ralentizó tanto al activar el enhancer?

Porque la mejora se ejecuta por cara detectada y añade una pasada completa de restauración sobre cada intercambio. En material de grupo el coste se multiplica.

¿Dónde se guardan los modelos de mejora?

En tu directorio de modelos de usuario, descargados tras confirmación explícita y verificados por checksum. No están en el repositorio, por eso el primer uso de un enhancer necesita conexión.

Elige el enhancer por el material, no por el nombre del modelo

Prueba Off, Fast, HD y Strong sobre tu propio clip, compara fotogramas completos en vez de caras recortadas y guarda los tiempos de render junto a los resultados.

Guías relacionadas