Prečo aplikácie na rozpoznávanie cigár tak často zlyhávajú, keď je etiketa poškodená alebo chýba?
Pretože väčšina z nich číta iba etiketu a nič iné. Etikety sa opotrebúvajú, otáčajú sa mimo záber kamery, sú zabalené v celofáne alebo úplne odlepené. A aj etiketa, ktorá sa odfotí dokonale, často nesie názov zložený zo slov príliš všeobecných na to, aby čokoľvek identifikovali: skutočný, meraný výsek z ktoréhokoľvek katalógu, nie okrajový prípad.
Čo vlastne robí skener, ktorý číta iba etiketu?
Spúšťa rozpoznávanie textu (optické rozpoznávanie znakov, OCR) na jednom malom papierovom prúžku a čokoľvek z toho vyjde, považuje za celú odpoveď. Namierite kameru, softvér prečíta vytlačené písmená a vyhľadá tento reťazec v databáze. To je celý proces. Nič sa nepokúša prečítať farbu obalového listu, tvar hlavičky, dĺžku či priemer (ring gauge), ani čokoľvek iné, čo je viditeľné na zvyšku cigary. Ak text z etikety vyjde čisto, aplikácia pôsobí kompetentne. Ak nie, v procese už nie je nič, na čo by sa dalo spoľahnúť.
Poznávacím znamením je, ako sa tieto aplikácie správajú, keď je etiketa prítomná, ale mierne pootočená, alebo keď potlač vyblednutá manipuláciou. Nezhoršujú svoj výkon postupne — zlyhajú úplne, pretože jediný signál, ktorý mali, práve zmizol. Systém s viac ako jedným vstupom môže jeden stratiť a stále urobiť rozumný odhad. Systém s presne jedným vstupom nemá kam sa uchýliť, keď je tento vstup zlý.
Prečo sa etiketa tak často stráca alebo je nečitateľná?
Etiketa je malý pásik papiera obtočený okolo valca a bežná manipulácia s ňou neustále pracuje proti nej:
- Odlesk celofánu. Maloobchodný obal odráža blesk fotoaparátu priamo do objektívu a presvetlí presne tie písmená, ktoré OCR potrebuje.
- Otočenie. Etiketa odfotená z nesprávneho uhla okolo obvodu cigary skryje väčšinu vlastného textu za zakrivením.
- Opotrebenie. Cigara nosená vo vrecku, cestovnom puzdre alebo jednoducho často manipulovaná získa odreniny, ktoré ako prvé rozmažú fóliovú potlač a tenký atrament.
- Zámerné odstránenie. Mnohí fajčiari si etiketu pred zapálením zložia, čo znamená, že fotka urobená počas fajčenia (často práve vo chvíli, keď chce niekto identifikovať cigaru, ktorú mu niekto podal) už nemá čo skenovať.
- Čiastočné etikety. Niektoré vitoly majú aj sekundárnu etiketu alebo pásik pri nožičke, ktorý nesie iba fragment celého názvu, nie celý.
Nič z toho nie je vzácne. Je to bežný stav, v akom sa cigara nachádza väčšinu času, keď sa skutočne fajčí — čo je presne tá chvíľa, keď človek najpravdepodobnejšie siahne po telefóne.
Prečo nestačí ani „dokonalá" fotka etikety?
Pretože slová, ktoré sú na nej vytlačené, nemusia byť rozlišujúce. Značná časť ktoréhokoľvek reálneho katalógu cigár nesie modelové názvy zložené výhradne zo všeobecných opisných slov (výrazov ako „reserve", „especial", „maduro", „selection", „anniversary") bez akéhokoľvek jedinečného slova spätého s konkrétnou značkou kdekoľvek v názve. Vlastná produkčná diagnostika Paradigm uvádza toto číslo na úrovni 13,3 % katalógových položiek: názvy zložené iba zo slov natoľko všeobecných, že samotné porovnávanie textu nedokáže zúžiť výber, pretože presne rovnaké slová sa objavujú v desiatkach nesúvisiacich radov od rôznych výrobcov.
Ak dáte engine na porovnávanie textu reťazec, ktorý je len všeobecná slovná zásoba, nemá sa oproti čomu jedinečnému vyhľadávať. Nejde o zlyhanie kvality fotky. OCR odviedlo svoju prácu, prečítalo každé písmeno správne, a vyhľadávanie sa aj tak nedokáže zúžiť na jednu cigaru, pretože samotný text nikdy jedinečný nebol. Architektúra skenera postavená výhradne na texte etikety sa cez to nedostane. Neexistuje druhý signál, ktorý by rozhodol.
Čo by muselo skener naozaj vybaviť, aby prežil zlú etiketu?
Musel by pristupovať k etikete ako k jednému z viacerých vstupov, nie ako k celému systému. Prístup založený na celej cigare číta odtieň a textúru obalového listu, tvar hlavičky a spôsob jej odrezania, ako aj fyzické rozmery (dĺžku a priemer, tzv. ring gauge) popri akomkoľvek dostupnom texte etikety a všetko toto váži spolu. Viac o tom, čo tieto vizuálne znaky samy osebe naznačujú, nájdete v článku čo očakávať od obalového listu a tvaru cigary.
To je najdôležitejšie presne vtedy, keď je etiketa poškodená. Roztrhnutá alebo chýbajúca etiketa stále ponecháva farbu obalového listu, viditeľný štýl hlavičky a približnú veľkosť, s ktorými možno pracovať — tri signály namiesto nuly. Etiketa so všeobecným pomenovaním, no plne čitateľná, stále ponecháva vizuálne dôkazy na zúženie výberu, ktorý samotný text nedokázal uzavrieť. Žiaden z týchto signálov nie je sám osebe rozhodujúci. Spolu dokážu zúžiť zhodu z „nemožné" na „pravdepodobné", čo je celý rozdiel medzi skenerom, ktorý potichu zlyhá, a takým, ktorý vás dostane dostatočne blízko na to, aby ste to potvrdili očami. Celkový obraz spoľahlivosti vrátane toho, kde sa mýli aj rozpoznávanie z viacerých signálov, nájdete v článku aká presná je AI pri rozpoznávaní cigár.
Znamená to, že text etikety je bezcenný?
Nie. Zvyčajne je to najrýchlejší a najkonkrétnejší dostupný signál, ktorý stojí za to prečítať ako prvý. Problém je v tom, ak ho považujete za jediný signál a nedokážete povedať nič užitočné vo chvíli, keď je znehodnotený. Etiketa, ktorá sa číta čisto a obsahuje jedinečné slovo spojené so značkou, je takmer vždy správna. Zlyhaním je konkrétne to, čo sa deje na druhej strane: zlé fotografické podmienky alebo čitateľný, no všeobecný názov. Akýkoľvek systém, ktorý na túto kombináciu nemá žiadny plán, zlyhá na predvídateľnom, opakujúcom sa výseku reálnych pokusov — nie na vzácnom okrajovom prípade, ale na bežnej utorkovej večernej cigare s napoly ešte nasadeným celofánom.
Dá sa to sám otestovať?
Áno, neformálne. Zoberte etiketu, ktorú viete rozpoznať očami, a skúste ju odfotiť tromi spôsobmi: priamo spredu v dobrom svetle, v ostrom uhle a cez celofán s odleskom blesku v zábere. Každú fotku spustite cez skener, ktorý skúmate. Nástroj čítajúci iba etiketu pravdepodobne perfektne zvládne prvú fotku a úplne zlyhá na ďalších dvoch, bez akejkoľvek čiastočnej odpovede v ani jednom prípade, pretože nemá žiadnu záložnú vrstvu. Systém čítajúci viac než len etiketu by sa mal aj pri tých dvoch ťažších trafiť niekam blízko, aj keby netrafil presný rad, pretože obalový list a tvar nikam nezmizli.
| Podmienka | OCR iba pre etiketu | Porovnávanie celej cigary |
|---|---|---|
| Čistá etiketa, jedinečný názov | Spoľahlivé | Spoľahlivé |
| Čistá etiketa, výhradne všeobecné pomenovanie | Nedokáže zúžiť výber | Obalový list/tvar/veľkosť zužujú výber |
| Roztrhnutá, vyblednutá alebo pootočená etiketa | Úplné zlyhanie | Zúži sa na krátky zoznam |
| Etiketa úplne odstránená | Žiadny vstup | Obalový list, hlavička a veľkosť stále použiteľné |
Skrátená verzia
- Skenery čítajúce iba etiketu majú presne jeden vstup a tento vstup je bežnou manipuláciou, odleskom obalu, otočením alebo zámerným odstránením často znehodnotený.
- Značná časť reálnych katalógových položiek (v produkčných dátach Paradigm nameraná na 13,3 %) nesie modelové názvy zložené výhradne zo všeobecných slov, čo porazí porovnávanie textu aj na dokonale čitateľnej etikete.
- Systém, ktorý popri texte etikety číta aj farbu obalového listu, tvar hlavičky a rozmery, má stále k dispozícii signály, keď samotná etiketa nestačí.
- Žiadny prístup k rozpoznávaniu nie je neomylný; praktickou otázkou je, čo systém urobí vo chvíli, keď je jeho najlepší signál znehodnotený.
- Ktorýkoľvek skener môžete sami preveriť tromi fotkami jednej etikety: priamo spredu, v uhle a cez celofán.