Cara Sola No Basta: el Nuevo Estándar de Liveness KYC

Las pérdidas por deepfakes alcanzan 3.700 M$ en 2026. Por qué los controles de liveness unimodales fallan y qué exige la verificación KYC multimodal.

Emily Carter
Por Emily CarterConsultora de Estrategia de IA en Joinble
·14 min de lectura
Compartir
Cara Sola No Basta: el Nuevo Estándar de Liveness KYC
imageUsa esta imagendownloadDescargar

Gartner publicó a comienzos de 2026 una predicción que ya se ha materializado. Para mediados de 2026, el 30 por ciento de las empresas no consideraría ya fiables, por sí solas, las soluciones de verificación biométrica facial. La tecnología de reconocimiento facial no se había degradado; esa no fue la causa. Lo que ocurrió es que la IA generativa avanzó más rápido que las defensas pensadas para contenerla.

Biometric Update, en julio de 2026, dejó constancia de lo que los profesionales observan en producción desde hace meses: los deepfakes están forzando a toda la industria de verificación de identidad a ir más allá de los controles biométricos de señal única. Los datos que sostienen ese giro no dejan margen. El fraude con deepfakes acumuló pérdidas globales registradas de 3.700 millones de dólares, y el 89 por ciento de esa cifra se concentró en 2025 y 2026. En ocho meses, una sola institución financiera contabilizó más de 8.000 intentos de fraude de identidad facilitados por deepfakes. Si se suma el fraude de identidad sintética y el robo de cuentas, la criminalidad de identidad generada por IA rebasa ya los 400.000 millones de dólares en pérdidas anuales a escala global.

El liveness biométrico multimodal —la respuesta de la industria— no equivale a un retoque incremental de los sistemas KYC en uso. Replantea de raíz qué exige la garantía de identidad.

El Problema de la Señal Única

La arquitectura de la mayoría de los sistemas KYC desplegados entre 2019 y 2024 se parece: el solicitante aporta un documento oficial, graba un selfie o un vídeo breve de detección de vida, y un algoritmo de matching coteja ambos. Junto al cotejo facial corre la detección de vida —en términos técnicos, Detección de Ataques de Presentación (PAD)—, cuyo fin es confirmar que el selfie procede de una persona real y no de una imagen estática ni de un vídeo pregrabado.

Se diseñó esa arquitectura para la amenaza vigente cuando se creó. El PAD nació precisamente para detectar ataques de presentación: un defraudador que enseña una fotografía impresa o reproduce un vídeo frente a la cámara. ISO 30107-3, el estándar de certificación principal para el PAD biométrico, se elaboró alrededor de ese mismo modelo de amenaza.

Hoy el cambio es otro: los atacantes han dejado la cámara a un lado. Los ataques de inyección introducen datos biométricos sintéticos directamente en el pipeline de API de la aplicación y eluden el sensor físico. Aun cuando los ataques de presentación siguen siendo el vector más habitual, la IA generativa produce ya deepfakes capaces de rebasar el análisis facial unimodal: sustitución de rostro en tiempo real, síntesis de voz y documentos de identidad sintéticos ensamblados por menos de 15 dólares por kit.

Arquitectónicamente, una señal biométrica única aporta demasiado poca entropía para separar con fiabilidad a una persona genuina de una identidad sintética sofisticada. Falsificar un único punto de datos resulta sencillo cuando las herramientas cuestan menos que una cena.

Qué Significa Realmente el Liveness Multimodal

En una sola sesión, la verificación de liveness multimodal reúne varias señales biométricas y de comportamiento independientes. Exige dos condiciones: que falsificar esas señales a la vez resulte difícil, y que el sistema compruebe la coherencia entre ellas.

Cuatro categorías de señales componen un sistema multimodal de nivel productivo:

Tipo de señal Qué mide Resistencia al deepfake
Biometría visual Geometría facial, microexpresiones, textura cutánea Moderada — los face-swaps pueden superar esto en solitario
Biometría de voz Tono, cadencia, características espectrales Moderada — la clonación de voz es ya económica
Señales de comportamiento Patrones de escritura, dinámica táctil, tiempos de interacción Alta — difícil de sintetizar de forma convincente
Señales de dispositivo/entorno Huella del dispositivo, metadatos de red, datos de sensor Alta — requiere comprometer hardware para falsificar

El hallazgo decisivo está en la columna de resistencia. Ninguna señal aislada ofrece protección suficiente: el ecosistema de fraude por deepfake ha generado ataques convincentes contra cada una por separado. Lo que todavía no consiguen los ataques de forma convincente es una identidad sintética que, al mismo tiempo, rebase la verificación facial, la de voz, el análisis de comportamiento y los controles de coherencia del dispositivo. Cada ataque afinado para una modalidad suele dejar artefactos en las demás.

Coherencia Cruzada: la Frontera Actual de la Detección

El avance más relevante del liveness multimodal en 2026 es el análisis de coherencia cruzada entre señales. En concreto, detectar la desincronización sutil entre señales visuales y de audio que deja la generación de deepfakes.

El habla humana genera correlaciones predecibles y muy consistentes entre el movimiento de los labios, la activación de los músculos faciales y la señal de audio. Esas correlaciones se dan a escala de milisegundos:

  • La relación temporal entre la apertura labial y el inicio del fonema
  • Los patrones de movimiento muscular en mejillas y mandíbula asociados con consonantes específicas
  • Las microdeformaciones faciales producidas por los cambios de presión del aire durante el habla

Los sistemas de IA generativa que fabrican vídeo deepfake y síntesis de voz se entrenan sobre conjuntos de datos distintos, con características de latencia distintas. Al fusionarlos en un intento de fraude en tiempo real, aparecen artefactos de desincronización sutiles. Un observador humano no los percibe. Los algoritmos de coherencia cruzada sí.

En julio, Biometric Update indicó que la frontera de detección se ha desplazado precisamente ahí: verificar la coherencia cruzada entre el movimiento de labios y la señal de audio del habla. Regula Forensics puso en marcha un servicio de verificación multimodal mejorado articulado en torno a este enfoque. Qualcomm y Scam.ai publicaron detección de deepfakes en dispositivo para videollamadas en directo, apuntando a las mismas señales de desincronización.

Hay una ventaja estructural en este planteamiento. El atacante tiene que mejorar a la vez dos sistemas de IA distintos —síntesis de vídeo y síntesis de voz— y, además, conservar la sincronización cruzada entre modalidades. Superar la verificación de coherencia cruzada exige una presión de optimización bastante mayor que vencer a cualquier detector unimodal.

La Biometría de Comportamiento como Segunda Capa

Analizar cómo interactúa una persona con un dispositivo —y no su rostro ni su voz— es lo que aporta la biometría de comportamiento. Ofrece un tipo distinto de garantía de liveness, resistente a otra categoría de ataques.

Estas son las señales que captura:

  • Dinámica de pulsación de teclas: Los patrones temporales entre pulsaciones de teclas, tan distintivos individualmente como las huellas dactilares para usuarios habituales
  • Movimiento táctil y de ratón: Micromovimientos, patrones de aceleración y características de presión
  • Ritmo de interacción: El ritmo al que una persona navega por un formulario, hace pausas y relee campos
  • Patrones de latencia cognitiva: Los tiempos de respuesta consistentes con la toma de decisiones humana, no con las respuestas instantáneas de las herramientas automatizadas

Cuando un kit de fraude está afinado para inyectar datos biométricos sintéticos en APIs de verificación, deja anomalías de comportamiento recurrentes. Las herramientas automatizadas recorren formularios más rápido que un humano, generan patrones de tiempo excesivamente regulares y exhiben firmas alineadas con infraestructuras de fraude conocidas, no con conducta humana.

Se proyecta que el mercado de biometría de comportamiento llegue a los 4.260 millones de dólares en 2027, porque cubre una categoría de fraude que la biometría visual no alcanza: la identidad sintética que ya superó la verificación inicial y opera ahora dentro del sistema. El control facial acredita quién dijo estar presente en el alta. La biometría de comportamiento acredita que esa misma persona sigue manejando la cuenta.

La integración entre detección de liveness y monitoreo continuo resulta crítica en este punto. Un sistema KYC que comprueba el liveness al dar de alta y no vuelve a comprobarlo solo verifica si hubo una persona real en un instante concreto. No verifica si esa misma persona opera la cuenta ahora. Los agentes de IA de Joinble confrontan de forma continua las señales de identidad con el perfil de comportamiento fijado en el alta y marcan desviaciones para reverificación antes de que el fraude se consume, no después.

Coherencia de Señales del Dispositivo y el Entorno

La tercera capa de señales cubre aquello que, de momento, no altera ni la síntesis facial ni la clonación de voz: el contexto de dispositivo y entorno en el que ocurre la verificación.

En el dispositivo entran huellas de hardware propias de dispositivos físicos reales, patrones de consistencia de sensores, atestación del sistema operativo y rasgos de red. En el entorno, perfiles de ruido ambiente, consistencia de iluminación y patrones del entorno físico.

Quien despliega ataques de inyección trabaja desde entornos controlados: ordenadores de desarrollo con software de cámara virtual y kits de inyección de API. Esos entornos dejan firmas características:

  • Huellas de dispositivo que coinciden con infraestructuras de fraude conocidas
  • Ausencia de ruido ambiente consistente con un entorno de usuario genuino
  • Condiciones de iluminación demasiado controladas y uniformes para un entorno real
  • Metadatos de red asociados con proxies, VPNs o infraestructura de centros de datos en lugar de conexiones residenciales o móviles

Una verificación genuina, hecha por una persona real en un dispositivo móvil real y en un entorno real, genera un patrón denso de señales coherentes. Un intento de fraude afinado para suplantar datos biométricos suele ceder autenticidad del entorno a cambio de fidelidad biométrica. Esa compensación se puede detectar.

Qué Dicen los Estándares Actualmente

El marco de antisuplantación biométrica lo aporta la serie de estándares ISO 30107:

  • ISO 30107-3: Detección de ataques de presentación — el estándar de certificación principal actual, que cubre la suplantación física ante una cámara
  • ISO/IEC AWI 30107-4: En desarrollo — aborda la resistencia a ataques de inyección y los requisitos de verificación multimodal

La regulación todavía no ha alcanzado el giro multimodal. Los requisitos de "verificación de identidad fiable" del RMLBC —aplicables a partir de julio de 2027— y las Normas Técnicas de Regulación que elabora el AMLA aún no detallan requisitos multimodales de forma explícita. Para un análisis detallado de lo que esas normas técnicas exigirán a los sistemas de identidad, consulte nuestro análisis de las RTS CDD del AMLA.

En la práctica, las organizaciones que ya levantan arquitecturas multimodales se adelantan a lo que exige el regulador. Construyen según el estándar que la evidencia muestra necesario, no según el que hoy se impone. La actualización regulatoria es predecible. La trayectoria del fraude ya se ve.

De un Control de Liveness a una Arquitectura de Liveness

Tratar la "detección de liveness" como una función —una casilla en un flujo de compliance— queda corto respecto a lo que el entorno de amenazas de 2026 realmente exige.

El paso es de un control de liveness (una validación única en un instante concreto) a una arquitectura de liveness (un sistema continuo y de múltiples señales que toma cada interacción como ocasión para reconfirmar la identidad). En 2026, una arquitectura de liveness de nivel productivo incluye:

  1. Verificación de coherencia cruzada en el alta — análisis simultáneo de cara, voz y comportamiento con verificación de coherencia entre tipos de señales
  2. Atestación de dispositivo — verificación criptográfica de que los datos biométricos provienen de hardware real, no de software de cámara virtual
  3. Análisis de señales del entorno — marcado de sesiones donde el contexto es inconsistente con el comportamiento genuino del usuario
  4. Establecimiento de perfil de comportamiento — captura de patrones de interacción en el alta para comparación continua posterior
  5. Reverificación continua — monitoreo impulsado por IA que señala desviaciones de comportamiento y activa la reverificación específica cuando el riesgo escala

Para contexto sobre cómo los marketplaces de deepfake-as-a-service han puesto el fraude biométrico al alcance de cualquiera a escala comercial, los datos económicos importan: la misma infraestructura de marketplace que vende kits de identidad sintética por 15 dólares vende ahora herramientas antidetección afinadas para rebasar la verificación unimodal. Las arquitecturas multimodales suben de forma notable el coste de ataque —no de manera infinita, pero lo bastante como para desviar el fraude hacia objetivos más vulnerables.

Qué Deben Preguntar los Equipos de Compras en 2026

Los proveedores de verificación de identidad están promocionando con agresividad capacidades "multimodales", con grados muy distintos de implementación real. Estas preguntas separan las arquitecturas multimodales genuinas de las afirmaciones de marketing:

  • ¿Qué modalidades de señal verifica el sistema simultáneamente? Cara más un gesto de liveness simple no es multimodal.
  • ¿Realiza el sistema verificación de coherencia cruzada entre señales de audio y vídeo?
  • ¿Qué método de atestación de dispositivo se utiliza? ¿A nivel de hardware, del sistema operativo, o ninguno?
  • ¿Qué señales de comportamiento se analizan y con qué granularidad?
  • ¿Ha sido el sistema probado frente a herramientas de deepfake y clonación de voz de última generación? ¿Cuáles son las tasas de evasión?
  • ¿Establece el sistema un perfil de comportamiento para comparación continua tras el alta?
  • ¿Cuál es el estado del sistema respecto a ISO 30107-4?

ISO 30107-3 es un punto de partida. Certifica la protección frente a ataques de presentación: la amenaza de 2019. Ante el panorama de amenazas de 2026, pida de forma específica los resultados de las pruebas multimodales.

Para antecedentes sobre cómo los deepfakes atacan específicamente los flujos de incorporación bancaria, las tácticas documentadas allí explican por qué cada capa individual resulta insuficiente y por qué el enfoque multimodal es la única arquitectura que cubre toda la superficie de ataque.


Preguntas Frecuentes

¿Qué es la verificación de liveness biométrico multimodal?

Combina, en una única sesión de verificación, varios tipos de señales independientes: cara, voz, patrones de comportamiento y señales de dispositivo y entorno. Frente a la verificación unimodal (liveness solo facial), exige coherencia entre señales difíciles de falsificar a la vez, lo que encarece los ataques optimizados para una modalidad concreta.

¿Por qué la biometría facial ya no es suficiente para el liveness KYC?

Las herramientas de IA generativa han dejado la síntesis facial convincente al alcance por menos de 15 dólares por sesión. En 2026, Gartner confirmó que el 30 por ciento de las empresas ya no considera fiables, en solitario, las soluciones de biometría facial. Si una señal única se puede sintetizar a escala con herramientas automatizadas, deja de aportar entropía suficiente para separar con fiabilidad una identidad genuina de una sintética.

¿Qué es la verificación de coherencia cruzada entre modalidades?

Analiza si las distintas señales biométricas de una sesión de verificación resultan coherentes entre sí, con el grado de precisión que las interacciones genuinas generan de forma natural. El caso más nítido es la sincronización audio-visual: el habla humana produce relaciones temporales predecibles entre el movimiento de los labios y el audio; los sistemas deepfake —entrenados en conjuntos de datos separados de vídeo y voz— suelen fallar al replicarlas con precisión de milisegundos. Detectar esa desincronización es hoy la frontera principal en la detección de deepfakes.

¿Cómo complementa la biometría de comportamiento a la detección de liveness visual?

Captura el modo en que una persona interactúa con un dispositivo: tiempos de pulsación de teclas, dinámica táctil, ritmo de interacción y patrones de latencia cognitiva. Los kits de fraude que inyectan biometría sintética dejan anomalías de comportamiento típicas —velocidad de interacción sobrehumana, patrones excesivamente regulares— que la detección visual de liveness no alcanza. Además, la biometría de comportamiento sostiene la reverificación continua tras el alta y alarga la garantía de identidad más allá del instante de incorporación.

¿Qué añade ISO 30107-4 a los estándares PAD actuales?

ISO 30107-3, el estándar principal vigente, certifica la protección frente a ataques de presentación: suplantación física ante una cámara. ISO/IEC AWI 30107-4, todavía en desarrollo, cubre la resistencia a ataques de inyección y los requisitos de verificación multimodal. Mientras 30107-4 no se finalice y adopte, la certificación conforme a 30107-3 no acredita protección frente a ataques de inyección ni frente al espectro completo de amenazas actuales.

¿Cómo extiende el monitoreo continuo la garantía de liveness más allá del alta?

La detección de liveness tradicional acredita que una persona real estuvo presente en el alta. No acredita que esa misma persona opere la cuenta después. El monitoreo continuo compara las señales de comportamiento actuales con el perfil fijado en el alta y marca desviaciones en patrones de interacción, huellas de dispositivo o rasgos de comportamiento que indiquen que la cuenta ya no la opera el individuo verificado. Con agentes de IA, el monitoreo continuo convierte la garantía de identidad de un control puntual en una función operativa continua.

Emily CarterEmily Carter
Compartir

Artículos relacionados

Una sola señal no basta: verificación biométrica multicapa
Seguridad27 Jul, 2026

Una sola señal no basta: verificación biométrica multicapa

Los deepfakes impulsan 1 de cada 5 intentos de fraude biométrico. Regula y AU10TIX pivotaron en julio 2026 hacia verificación multimodal. Esto es lo que cambió.

App UE de verificación de edad: nuevo estándar de identidad
Compliance15 Apr, 2026

App UE de verificación de edad: nuevo estándar de identidad

La UE lanza una app de verificación de edad open source, integrada en wallets nacionales. Qué significa para plataformas y estrategia KYC.

PSD3 y PSR: El Nuevo KYC Obligatorio para Pagos en Europa
Compliance13 Jul, 2026

PSD3 y PSR: El Nuevo KYC Obligatorio para Pagos en Europa

PSD3 y PSR trasladan la responsabilidad por fraude a los PSP sin controles de identidad robustos. Todo lo que debes saber antes del cumplimiento de 2026.