Koliko je točno prepoznavanje cigara pomoću umjetne inteligencije i zašto skeneri za prepoznavanje putem fotografije često pogriješe?
Bolje je nego što je bilo, lošije nego što marketing sugerira. Skener za prepoznavanje putem fotografije zapravo je nekoliko nepouzdanih signala koji istovremeno "glasaju": tekst na omotu, boja i tekstura pokrovnog lista, oblik kape i dimenzije. Svaki od njih zasebno može zavarati. Pogreške nisu nasumične. Grupiraju se oko oštećenih omota, generičkih naziva modela i cigara čija jedina referentna fotografija ne odgovara onome što držite u ruci.
Što skener zapravo promatra?
Usmjerite kameru na cigaru i nema samo jedne stvari koju treba prepoznati. Postoje četiri elementa poslagana jedan na drugi, a funkcionalan sustav mora pročitati sve njih i zatim odlučiti koliko vjerovati svakome.
Omot nosi tiskani ili reljefni tekst, obično najglasniji signal kada je čitljiv. Pokrovni list ima boju i površinsku teksturu koja sužava obitelj nijansi - list vrste Connecticut-shade ne nalikuje nimalo tamnom, uljastom maduro listu - no dosta nijansi leži dovoljno blizu jedna drugoj da samo osvjetljenje može promijeniti klasifikaciju. Kapa i cjelokupna silueta sužavaju vitolu - parejo ravnih stranica čita se drugačije od suženog figurada. A dimenzije, promjer prstena i duljina, dodatno sužavaju kandidate unutar linije na koju su ostali signali već ukazali.
Nijedan od ova četiri signala nije dovoljno pouzdan da radi sam. Sustav koji funkcionira pušta ih da rade zajedno i dopušta da jedan ispravlja druge. Kada ljudi kažu da je skener "pogriješio", obično se dogodilo da je jedan signal bio snažan, siguran u sebe - i pogrešan, a ništa drugo to nije uhvatilo.
Uspoređivanje sa stvarnim katalogom također je drugačiji problem od klasificiranja fotografije izolirano. Paradigm-ov vlastiti katalog sadrži 11.519 cigara, a svaki od ta četiri signala na kraju se mora provjeriti prema stvarnim unosima, a ne samo prepoznati kao "tamni robusto", što sužava polje, ali ništa ne identificira.
Zašto tekst na omotu tako često zakaže?
Tekst na omotu djeluje kao lakši dio. Obično nije. Omot se omotava oko cilindra, pa ga kamera fotografira zakrivljenog, a prepoznavanje teksta trenirano uglavnom na ravnim stranicama lošije se snalazi sa zakrivljenim tekstom nego što većina ljudi očekuje. Folijski omoti dodaju odsjaj koji, ovisno o kutu svjetla, proguta cijela slova. Omoti koji su proveli vrijeme u džepu ili putnoj kutiji postaju izgužvani, izgrebani ili djelomično odljepljeni, a djelomično zaklonjena riječ može se pročitati kao potpuno druga riječ od one koja je zapravo otisnuta.
Zatim postoji problem koji nema veze s kvalitetom slike: priličan broj cigara jednostavno nema prepoznatljive nazive za čitanje. Pristup identifikaciji koji se oslanja isključivo na omot pogrešiv je na prilično predvidljive načine, a jedan od najvećih problema je taj što su neki proizvodi nazvani riječima toliko generičkim da čak ni savršeno izdvajanje teksta ne otkriva koju točno cigaru držite.
Što zapravo znači problem od 13,3% generičkih naziva?
U katalogu od 11.519 cigara, 13,3% unosa ima nazive modela sastavljene isključivo od generičkih riječi - izraza koji opisuju kategoriju, a ne identificiraju proizvod. Skener koji bi pročitao svaki znak na tom omotu s potpunom točnošću i dalje ne bi imao ništa prepoznatljivo s čime bi to usporedio, jer same riječi ne pripadaju jednoj cigari više nego bilo kojoj drugoj.
Zato tekst na omotu ne može biti cijeli sustav čak ni uz savršenu fotografiju. Usklađivanje teksta treba nešto s čime će se uspoređivati, a otprilike jedna od osam cigara u stvarnom katalogu mu to ne pruža.
Zašto boja pokrovnog lista i oblik ne mogu odraditi ostatak posla?
Pokrovni list i oblik djeluju kao da bi trebali biti popustljiviji, jer nijedan ne ovisi o čitljivom tisku. U praksi su jednostavno teški na drugačiji način.
Klasifikacija nijanse mijenja se ovisno o vlažnosti. Ulja s vremenom izlaze na površinu pokrovnog lista i mijenjaju način na koji se svjetlost odbija od njega, a list fotografiran pod toplim unutarnjim svjetlom, koje je niže na ljestvici temperature boje od dnevnog svjetla, čita se za nekoliko nijansi tamnije nego isti list na otvorenom. Klasifikacija oblika nailazi na golem broj obitelji vitola koje iz jednog kuta izgledaju gotovo identično. U opticaju postoje desetci imenovanih oblika i veličina, a nekoliko parova njih razlikuje se uglavnom po kutu suženja ili stilu kape, što kamera mobitela nedosljedno bilježi ovisno o udaljenosti i kadriranju.
Nijedan od ovih razloga nije razlog da se odustane od signala. To je razlog da se očekuje kako mu je potreban stvaran, ciljan inženjerski rad, a ne jedan opći pokušaj. Paradigm-ov vlastiti klasifikator oblika kape porastao je s 78,6% na 91,9% točnosti na stvarnim produkcijskim skeniranjima nakon ispravka izgrađenog oko dvije konkretne izmjerene značajke, a ne cjelovite promjene modela, što dokazuje da prepoznavanje oblika bolje reagira na uzak, pažljiv ispravak nego na veći, opći model. Što vam pokrovni list i oblik iskreno mogu reći prije nego što uopće zapalite cigaru povezano je, ali zasebno pitanje koje zaslužuje vlastiti odgovor.
Kako trebam čitati tvrdnju o točnosti bilo koje aplikacije za cigare?
Većina objavljenih brojki o točnosti opisuje testni skup: odabranu seriju čistih, dobro osvijetljenih referentnih fotografija izabranih jer se dobro fotografiraju. Ta brojka gotovo ništa ne govori o tome što se događa kada stojite u neujednačenom svjetlu s omotom koji je napola istrošen.
Korisnija brojka je ona izmjerena na stvarnim produkcijskim skeniranjima - stvarnim fotografijama koje su snimili stvarni ljudi u stvarnim uvjetima, a ne na testu sastavljenom da dobro izgleda. To je manji skup primjera za provjeru, jer zahtijeva da se nešto zaista lansira i izmjeri što se događa nakon toga, umjesto da se jednom objavi laboratorijski rezultat i krene dalje.
| Pitanje koje treba postaviti | Zašto je važno |
|---|---|
| Mjereno na testnom skupu ili na stvarnim skeniranjima? | Testni skup je znatno čišći od stvarnosti |
| Jedan signal ili nekoliko kombiniranih? | Sustav s jednim signalom nasljeđuje točno njegove načine pogreške |
| Navodi li kako se nosi s oštećenim ili folijom zasjenjenim omotom? | Ako je tekst na omotu cijeli sustav, ovdje puca |
| Je li brojka datirana ili je jednokratna tvrdnja? | Modeli i katalozi se mijenjaju; lanjska brojka možda više ne vrijedi |
Ako aplikacija ne može odgovoriti na prva dva pitanja, tretirajte svaki istaknuti postotak kao marketing, a ne mjerenje.
Ukratko
- Skener čita četiri odvojena signala - tekst na omotu, boju pokrovnog lista, oblik kape i dimenzije - i nijedan od njih sam po sebi nije pouzdan.
- Zakrivljena folija, odsjaj, gužvanje i istrošenost razlozi su zašto tekst na omotu zakazuje češće nego što se očekuje.
- Otprilike jedna od osam cigara (13,3%) u stvarnom katalogu ima naziv previše generičan da bi ga uspoređivanje teksta riješilo, bez obzira na kvalitetu fotografije.
- Prepoznavanje oblika i boje poboljšava se ciljanim, izmjerenim ispravcima: ispravak temeljen na dvije značajke podigao je jedan stvarni klasifikator s 78,6% na 91,9%.
- Prije nego što povjerujete brojci o točnosti, pitajte je li dobivena na stvarnim skeniranjima ili na čistom testnom skupu.