Enfoque de aprendizaje profundo para el reconocimiento de imágenes
Aunque probablemente sea la palabra de moda del siglo, la IA sigue siendo un concepto vago en muchas mentes. En un intento de desentrañar su ambigüedad, he aquí una suave introducción que presenta dos formas en que las empresas adoptan y desarrollan la IA, y cómo decidimos hacerlo nosotros.
Fuera del reino de Westworld, la IA adopta muchas formas, tiene una larga historia y está más presente en tu vida cotidiana de lo que imaginas.
Conectamos con amigos en las redes sociales, cogemos un Uber para ir al trabajo, descubrimos nuevos programas en Netflix y obtenemos recomendaciones de restaurantes en Mapas: todo ello es una extensión digital de actividades que siempre hemos hecho. Sólo que ahora, en gran parte gracias a la IA, la forma en que interactuamos con esos servicios es más rápida, fácil e inteligente.
Aprendizaje automático, visión por ordenador, procesamiento del lenguaje natural, redes neuronales y motores de recomendación: los ingenieros de investigación llevan varias décadas desarrollándolos.
Entonces, ¿por qué parece que todo el mundo se está subiendo al carro de la IA justo ahora?
En 2012, la investigación en IA hizo un gran avance en forma de redes neuronales profundas.
Son mucho más potentes que los métodos de aprendizaje anteriores y proporcionan los mejores resultados en numerosos problemas de la vida real. Su desarrollo está respaldado por los avances en la potencia de cálculo, que permitieron ejecutar un enorme número de parámetros y el complejo proceso de aprendizaje con gran cantidad de datos.
Las redes neuronales profundas permiten potentes soluciones para la detección de objetos, el reconocimiento de imágenes y la segmentación. Para las empresas, brindan la oportunidad de crear una experiencia de usuario suprema, aumentar la eficacia y deleitar a sus clientes.
¿Cómo se construyen los productos de IA?
Cuando se trata de crear productos y servicios basados en la IA, las empresas suelen adoptar uno de estos dos enfoques. Utilizan API plug&play y modelos de aprendizaje automático o desarrollan sus propias soluciones especializadas.
Las API estándar son la primera opción para muchas empresas porque son muy asequibles y fáciles de usar. Los principales proveedores informáticos las facilitan con el objetivo de atraer a más desarrolladores para que utilicen sus plataformas. Por eso las API de Amazon Rekognition, Google Vision o Microsoft Cognitive Services son cada vez más avanzadas y potentes.
Sin embargo, estas herramientas no son perfectas. A menudo funcionan mal cuando resuelven problemas específicos de IA, y las empresas pierden la oportunidad de ofrecer una calidad y una experiencia de usuario supremas.
Muchas API permiten el reconocimiento de texto en imágenes, pero casi seguro que no están ajustadas para extraer tipos y formatos específicos, es decir, dar sentido al texto reconocido. Por ejemplo, no pueden detectar el nombre y apellidos en el DNI de alguien o reconocer un tipo concreto de problema matemático. En Microblink, nos dimos cuenta de esa carencia y dimos un paso más para ofrecer en el mercado un software de visión por ordenador significativamente mejor y especializado.
El otro enfoque de la IA que adoptan las empresas es crear soluciones propias para su aplicación especializada en un producto o servicio concreto. Este enfoque también es cada vez más fácil de poner en marcha. La razón principal es el creciente número de conjuntos de datos disponibles públicamente para entrenar modelos de aprendizaje automático. Algunos pueden funcionar incluso para problemas específicos de ML (por ejemplo, el conjunto de datos MS COCO para la detección, segmentación y subtitulación de objetos).
Además de los conjuntos de datos de fácil acceso, también hay más herramientas de código abierto que simplifican el proceso de aprendizaje. PyTorch y Tensorflow 2.0, las bibliotecas de aprendizaje automático de código abierto más populares para la investigación y la producción, son mucho más fáciles de usar de lo que eran, digamos, hace dos años.
Siento aguarte la fiesta otra vez, pero este enfoque también tiene truco. La teoría es una cosa, pero en los problemas de la vida real, puede ser difícil obtener los resultados deseados. Hay dos problemas comunes a los que hay que estar atento cuando construyas tus propias soluciones de IA:
- La discrepancia entre el conjunto de datos que se utilizó para entrenar los modelos de redes neuronales y los datos reales a los que se aplican los modelos. En particular, los modelos entrenados en conjuntos de datos disponibles públicamente rara vez son adecuados para productos altamente especializados.
- El problema de la aplicabilidad en términos de consumo de recursos, memoria y tiempo, dado que la solución final debe satisfacer los requisitos de eficacia que a menudo no existen en la fase de investigación del desarrollo de la IA.
(En términos más sencillos, los usuarios finales tienen poca comprensión y aún menos paciencia para los retos de los servicios impulsados por ML. El servicio tiene que funcionar siempre y tiene que funcionar rápido).
Tomar lo mejor de ambos mundos
En los últimos seis años, hemos llegado a ser muy conscientes de las ventajas y los retos de ambos enfoques. Hicimos de la IA el núcleo de nuestra tecnología y nos volcamos en el desarrollo de redes neuronales profundas hace varios años para abordar los siguientes problemas:
- Reconocimiento y extracción de texto en imágenes de documentos de identidad, tarjetas de crédito, recibos de comercios e incluso problemas matemáticos
- Detección y clasificación de distintos tipos de documentos
- Análisis de imágenes y otras tareas diversas.
Nos dedicamos a abordar estos retos de visión por ordenador para permitir a las empresas experiencias digitales supremas, como:
- Pago de facturas sin esfuerzo (escaneando los recibos de pago, porque ¿quién va ya al banco?)
- Fácil seguimiento de los gastos (escaneando los recibos de compra en lugar de introducir manualmente cada artículo comprado)
- Incorporación remota de usuarios (escaneando documentos de identidad o tarjetas de crédito)
- Dominar las matemáticas con facilidad (utilizando una app para escanear, resolver y aprender conceptos matemáticos)
Utilizamos un enfoque integrado que combina lo mejor de las dos perspectivas mencionadas, y nuestro éxito confirma que vamos por buen camino. Nuestra tecnología tiene un alcance global, ahorrando tiempo y facilitando las tareas cotidianas a más de 100 millones de usuarios finales en todo el mundo. Photomath, hoy una empresa independiente de Microblink, es la aplicación nº 1 para aprender matemáticas, tiene más de 120 millones de descargas y recientemente se ha integrado en Snapchat. BlinkReceipt Photomath, nuestro producto para escanear recibos de comercios, se ha utilizado hasta ahora para escanear más de 180 millones de recibos de comercios. BlinkCard nuestro último producto, es el software de escaneado más rápido y preciso para varios tipos de tarjetas de crédito y bancarias.
Si esto ha despertado tu curiosidad, ¡genial! Hemos esparcido algo más de sabiduría en otro post: Nuestra guía de 5 pasos para el desarrollo de la IA.