Los sistemas de inteligencia artificial presentan dificultades para reconocer objetos a partir de su forma general cuando algunas partes de la imagen están distorsionadas. Un estudio publicado en iScience puso a prueba más de 200 redes neuronales profundas y encontró diferencias frente a la percepción visual humana.

Biyu He, investigador de la Universidad de Nueva York y uno de los autores del artículo, señaló que ningún modelo ha reproducido por completo los patrones de reconocimiento de objetos de los seres humanos. La capacidad humana de usar la forma global, la textura y los detalles internos para identificar elementos sigue siendo inigualable.

Para el estudio, los investigadores crearon un conjunto de imágenes en el que modificaron de forma sistemática las formas generales, las partes internas y las texturas de objetos como un gato, una mariposa, un coche y una mazorca de maíz. Luego compararon la capacidad de las personas para identificarlos con la de docenas de modelos avanzados de redes neuronales profundas.

Los algoritmos obtuvieron de manera sistemática resultados inferiores a los de las personas cuando el reconocimiento dependía exclusivamente de la forma general del objeto. Los resultados indican que los modelos actuales de visión por computadora no se asemejan del todo a los humanos, aunque hayan sido entrenados con enormes cantidades de fotografías tomadas por personas.

El estudio plantea una nueva metodología para evaluar y comparar la visión artificial con la percepción humana. Los investigadores consideran que estos resultados podrían contribuir a mejorar los sistemas de visión artificial y favorecer el desarrollo de dispositivos de asistencia más eficaces, incluidas las interfaces cerebro-ordenador.