¿Qué precisión tiene el reconocimiento de puros con IA y por qué fallan tantas veces los escáneres de foto?
Mejor de lo que era, peor de lo que sugiere el marketing. Un escáner de identificación por foto son varias señales poco fiables votando a la vez: el texto de la anilla, el color y la textura de la capa, la forma del casquillo y las dimensiones. Cualquiera de ellas puede inducir a error por sí sola. Los fallos no son aleatorios. Se concentran en anillas dañadas, nombres de modelo genéricos y puros cuya única foto de referencia no coincide con lo que tienes en la mano.
¿Qué mira realmente un escáner?
Apunta una cámara a un puro y no hay una sola cosa que reconocer. Hay cuatro cosas superpuestas, y un sistema que funcione tiene que leerlas todas y después decidir cuánto confiar en cada una.
La anilla lleva texto impreso o en relieve, normalmente la señal más ruidosa cuando es legible. La capa tiene un color y una textura superficial que acotan la familia de tonos: una hoja Connecticut de sombra no se parece en nada a un maduro oscuro y aceitoso, pero muchos tonos están lo bastante cerca entre sí como para que solo la iluminación cambie la clasificación. El casquillo y la silueta general acotan la vitola: un parejo de lados rectos se lee de forma distinta a un figurado ahusado. Y las dimensiones, cepo y longitud, reducen aún más los candidatos dentro de la línea a la que ya apuntan las otras señales.
Ninguna de estas cuatro es lo bastante fiable como para funcionar sola. Un sistema que funciona las ejecuta juntas y deja que cada una corrija a las demás. Cuando alguien dice que un escáner "se equivocó", lo que suele haber pasado es que una señal era fuerte, segura y errónea, y nada más lo detectó.
Emparejar con un catálogo real es además un problema distinto de clasificar una foto de forma aislada. El propio catálogo de Paradigm contiene 11.519 puros, y cada una de esas cuatro señales acaba teniendo que contrastarse con entradas reales, no solo reconocerse como "un robusto maduro", lo que estrecha el campo sin identificar nada.
¿Por qué falla tan a menudo el texto de la anilla?
El texto de la anilla parece la parte fácil. Normalmente no lo es. Una anilla envuelve un cilindro, así que la cámara la fotografía curvada, y el reconocimiento de texto entrenado sobre todo con páginas planas funciona peor con texto curvo de lo que la mayoría espera. Las anillas metalizadas añaden reflejos que se tragan letras enteras según el ángulo de la luz. Las anillas que han pasado tiempo en un bolsillo o en una petaca de viaje se arrugan, se rozan o se despegan en parte, y una palabra parcialmente oculta puede leerse como una palabra completamente distinta de la que está impresa.
Luego hay un problema que no tiene nada que ver con la calidad de imagen: bastantes puros sencillamente no tienen nombres distintivos que leer. El enfoque basado solo en la anilla falla de un conjunto de maneras bastante predecibles, y una de las mayores es que algunos productos llevan nombres formados por palabras tan genéricas que incluso una extracción de texto perfecta sigue sin decirte qué puro concreto tienes en la mano.
¿Qué significa realmente el problema del 13,3 % de nombres genéricos?
En un catálogo de 11.519 puros, el 13,3 % de las entradas tienen nombres de modelo construidos enteramente con palabras genéricas, términos que describen una categoría en lugar de identificar un producto. Un escáner que leyera cada carácter de esa anilla con total precisión seguiría sin tener nada distintivo con lo que emparejar, porque las palabras en sí no pertenecen a un puro más que a cualquier otro.
Por eso el texto de la anilla no puede ser todo el sistema, ni siquiera con una foto perfecta. El emparejamiento de texto necesita algo con lo que emparejar, y aproximadamente uno de cada ocho puros de un catálogo real no se lo da.
¿Por qué no pueden el color de la capa y la forma cubrir el resto del camino?
La capa y la forma parecen señales más indulgentes, ya que ninguna depende de una impresión legible. En la práctica, son difíciles de otra manera.
La clasificación del tono varía con la humedad. Los aceites afloran a la superficie de la capa con el tiempo y cambian cómo se refleja la luz, y una hoja fotografiada bajo luz interior cálida, más baja en la escala de temperatura de color que la luz del día, se lee varios tonos más oscura que esa misma hoja al aire libre. La clasificación de la forma choca con la enorme cantidad de familias de vitolas que parecen casi idénticas desde un solo ángulo. Hay decenas de formas y tamaños con nombre en circulación, y varios pares de ellas se diferencian sobre todo en un ángulo de ahusado o en un estilo de casquillo que la cámara de un móvil capta de forma inconsistente según la distancia y el encuadre.
Ninguna de estas dificultades es motivo para renunciar a la señal. Es motivo para esperar que necesite ingeniería real y dirigida, en lugar de una pasada amplia. El propio clasificador de forma de casquillo de Paradigm pasó del 78,6 % al 91,9 % de precisión en escaneos reales de producción tras una corrección construida en torno a dos características medidas concretas, y no a un cambio integral del modelo, lo que demuestra que el reconocimiento de formas responde mejor a correcciones estrechas y cuidadosas que a un modelo más grande y general. Qué pueden decirte honestamente una capa y una forma antes incluso de encender el puro es una cuestión relacionada pero distinta que merece su propia respuesta.
¿Cómo debería interpretar una cifra de precisión de cualquier app de puros?
La mayoría de las cifras de precisión publicadas describen un conjunto de prueba: un lote seleccionado de fotos de referencia limpias y bien iluminadas, elegidas porque salen bien en foto. Ese número no te dice casi nada sobre lo que ocurre cuando estás de pie con luz irregular y una anilla medio desgastada.
El número más útil es el medido sobre escaneos reales de producción: fotos reales tomadas por personas reales en condiciones reales, no un banco de pruebas montado para quedar bien. Ese es un conjunto de ejemplos más pequeño con el que contrastar, porque exige lanzar algo de verdad y medir lo que pasa después, en vez de publicar un resultado de laboratorio una vez y pasar página.
| Pregunta que hacer | Por qué importa |
|---|---|
| ¿Medido en un conjunto de prueba o en escaneos reales? | Un conjunto de prueba es mucho más limpio que la realidad |
| ¿Una señal o varias combinadas? | Un sistema de una sola señal hereda exactamente sus modos de fallo |
| ¿Dice cómo maneja una anilla dañada o con reflejos metálicos? | Si el texto de la anilla es todo el sistema, aquí es donde se rompe |
| ¿La cifra tiene fecha o es una afirmación puntual? | Los modelos y los catálogos cambian; la cifra del año pasado puede no valer hoy |
Si una app no puede responder a las dos primeras preguntas, trata cualquier porcentaje destacado como marketing y no como medición.
La versión corta
- Un escáner lee cuatro señales distintas, texto de la anilla, color de la capa, forma del casquillo y dimensiones, y ninguna de ellas es fiable por sí sola.
- El metalizado curvado, los reflejos, las arrugas y el desgaste son la razón por la que el texto de la anilla falla más a menudo de lo que la gente espera.
- Alrededor de uno de cada ocho puros (13,3 %) de un catálogo real tiene un nombre demasiado genérico para que el emparejamiento de texto lo resuelva, sea cual sea la calidad de la foto.
- El reconocimiento de forma y color mejora con correcciones dirigidas y medidas: una corrección de dos características llevó a un clasificador en producción del 78,6 % al 91,9 %.
- Antes de fiarte de una cifra de precisión, pregunta si procede de escaneos reales o de un conjunto de prueba limpio.