Construir BlinkID Captura: mejor UX y extracción de datos
En Microblink, estamos orgullosos de considerarnos expertos en IA y documentos de identidad. Sin embargo, siempre nos esforzamos por mejorar, tanto para nuestros clientes como para los usuarios finales que interactúan con nuestros productos. Tras el emocionante lanzamiento de BlinkID, charlamos con Luka Slibar, nuestro Director de Producto de BlinkID, y Daniel Balchevingeniero de ML, acerca de cómo pensamos en la resolución de los retos únicos de la identidad digital y la captura de imágenes que impulsa nuestra suite BlinkID. Las siguientes conversaciones han sido editadas y condensadas para mayor claridad.
Resolver los retos de la identidad digital con Luka Šlibar
Llevo en Microblink desempeñando diversas funciones desde 2014. Aunque al principio me centré en el desarrollo empresarial, con el tiempo pasé a desempeñar funciones de gestión de productos para nuestras iniciativas de IA, hasta que me hice cargo de la dirección de productos para los módulos de captura y extracción de BlinkID.
A lo largo de los años, Microblink ha procesado más de 12 .000 millones de documentos de identidad diversos, y en ese tiempo, hemos desarrollado una perspectiva única sobre los matices y retos que contienen estos documentos. Los documentos de identidad varían según la geografía, la persona, y cambian regularmente de formato y disposición. Tanto si se trata de abrir una cuenta como de transferir dinero, la mayoría de las experiencias modernas y digitales de los usuarios que hoy damos por sentadas dependen de la correcta digitalización y autenticación de estos diversos documentos. Ahí es donde BlinkID entra en juego.
Cuando se trata de resolver los retos de nuestros clientes y subir el listón de la identidad digital, dividimos el proceso en tres pasos clave: captura, extracción y verificación.

La captura excepcional de documentos es fundamental para el éxito de la verificación posterior. Sean cuales sean las necesidades empresariales específicas, no hay forma de realizar una verificación de documentos de identidad precisa y fiable sin una captura y extracción de imágenes fenomenales. Dicho de otro modo, la capacidad de verificar un documento como válido o marcarlo como potencialmente fraudulento sólo es tan buena como los datos que se extraen, que sólo son tan buenos como la captura inicial. Si la experiencia de captura es torpe, confusa o propensa a errores, es probable que los usuarios la abandonen por completo.
Tradicionalmente, Microblink ha sido conocida por desarrollar y ofrecer SDK y API para automatizar los dos primeros pasos del proceso con una velocidad y precisión líderes en el sector. BlinkIDEl procesamiento en el dispositivo de ofrece una experiencia de usuario superior con información en tiempo real (por ejemplo, «mantén el documento quieto» o «retrocede»), seguridad de los datos y capacidad para admitir casos de uso sin una conexión a Internet potente.
Sin embargo, a pesar de todos los avances de la potencia de procesamiento de los teléfonos móviles, sigue siendo secundaria frente a la potencia de procesamiento de un servidor completo. Además, en muchos sectores muy regulados, como los servicios bancarios y financieros, a los que sirve nuestra tecnología, las imágenes capturadas se envían de todos modos a un servidor para su posterior procesamiento.
Aunque hemos atendido las diversas necesidades de nuestros clientes con opciones de integración flexibles y una amplia cobertura de plataformas, también vimos la oportunidad de mejorar el enfoque existente, empezando por la captura de imágenes.
MicroblinkLa experiencia de la empresa en la creación de productos altamente optimizados para dispositivos nos sitúa en una posición única para resolver este reto. Como equipo, sabemos cómo desarrollar modelos ML ligeros y una experiencia de captura de imágenes fácil de usar sin añadir un tamaño innecesario al SDK. Esto también lo convirtió en un proyecto atractivo para nuestros equipos multidisciplinares.
Nuestro SDK de captura recién lanzado se integra en las aplicaciones móviles de los clientes para permitir la fantástica experiencia de captura del usuario por la que es conocido nuestro producto estrella BlinkID, sin añadir mucho al tamaño total de la aplicación. También permite un procesamiento y extracción de imágenes más potentes del lado del servidor, lo que es esencial para nuestra visión a largo plazo de ofrecer la mejor solución global de verificación de documentos de identidad del mercado.
Permitir una captura de imágenes aún más inteligente y potenciada por ML con Daniel Balchev
Me incorporé a Microblink a finales de 2022 como uno de los 3 primeros empleados en Sofía (Bulgaria), ¡y estoy encantado de lanzar el primer producto en el que he trabajado con el equipo! Con nuestra gran cantidad de modelos ML existentes y vastos datos internos para entrenar nuevos modelos, hemos podido lanzar este SDK en sólo 5 meses.
Se necesita un pueblo para construir un producto como éste, y llegar hasta aquí fue una estrecha colaboración con múltiples ingenieros de ML, ingenieros de software multiplataforma, diseñadores de producto y nuestros PM. También hablamos con nuestros clientes y compañeros de cara al cliente para incorporar sus comentarios y asegurarnos de que estamos construyendo el producto adecuado. La versión del SDK de captura de imágenes está repleta de funciones:
- Detección automática de documentos: Nuestro SDK es capaz de detectar cuándo el documento es visible y dónde está exactamente, lo que nos permite determinar cuándo el usuario está sujetando un documento demasiado cerca o demasiado lejos de la cámara o en un ángulo demasiado cerrado, proporcionando instrucciones para guiar al usuario hacia un mejor escaneado.

- Clasificación del tipo de documento: Nuestro nuevo SDK clasifica los documentos en varias categorías que nos ayudan a determinar su relación de aspecto prevista y si los documentos son a una o dos caras. Esto es especialmente interesante porque nos permite adaptar la experiencia del usuario y el flujo de escaneado en función del documento concreto. En otras palabras, si el usuario muestra un documento de identidad, sabremos que tenemos que pedir el anverso y el reverso, en lugar de sólo el anverso en el caso de un pasaporte.

- Detección de borrosidad: detecta si el documento está borroso y espera hasta que el usuario consiga una toma mejor y más estable.
- Detección de reflejos: Si hay un resplandor cubriendo el documento, lo detectaremos e indicaremos al usuario que mueva el documento para que no se vea.
- Detección de inclinación: sabe dónde está el documento en la imagen o en el fotograma de la cámara y nos permite estimar si el documento está inclinado o no. Aunque podemos admitir documentos inclinados en el procesamiento posterior, la transformación de tales imágenes provoca inevitablemente cierta distorsión de la imagen transformada, que a menudo es indeseable al comprobar si una imagen está manipulada. No hay forma de corregir esto después de la captura, así que la única solución es proporcionar al usuario final instrucciones en tiempo real sobre cómo colocar correctamente el documento para eliminar la inclinación y garantizar la mejor captura de imagen posible.
- Oclusión de la mano: Este SDK reutiliza los modelos de detección de manos de nuestro modelo de verificación para detectar si la mano de un usuario está cubriendo una parte significativa del documento. (Lo que se considera «significativo» puede ser configurado en el ajuste por el cliente). Así nos aseguramos de no capturar imágenes en las que haya un dedo tapando una parte importante del documento, por ejemplo.

- Estimación de la nitidez: Capturamos múltiples fotogramas del documento de identidad del flujo de vídeo, filtrándolos para seleccionar el que tenga la calidad más nítida para el procesamiento posterior más preciso.
- Estimación de las condiciones de iluminación: Podemos detectar si el usuario está escaneando en una habitación oscura o si hay demasiada luz e indicarle que haga el cambio para tomar una imagen mejor.

El resultado es una información al usuario más proactiva y detallada que utiliza el ML para comprobar la calidad de la imagen y garantiza el mejor escaneado posible a la primera, reduciendo la probabilidad de que los usuarios tengan que repetir el proceso y consiguiendo una mejor extracción.
Además de la experiencia de captura y la calidad de imagen superiores que proporciona, nuestro SDK de Captura independiente no está limitado a una lista de documentos compatibles, por lo que está diseñado para funcionar con todos los carnés de identidad, permisos de conducir y pasaportes de tamaño estándar, hoy y en el futuro. Si se publica una nueva versión del documento, los clientes no tienen que cargar a sus usuarios con una actualización, sino que simplemente pueden actualizar el backend para la extracción.
¡Gracias a Luka y Daniel por charlar con nosotros!