Hvor nøyaktig er AI-basert sigargjenkjenning, og hvorfor bommer bildebaserte skannere ofte?
Bedre enn før, men svakere enn markedsføringen antyder. En bildebasert skanner er egentlig flere usikre signaler som stemmer samtidig: bandtekst, dekkbladets farge og struktur, hetteform og mål. Hvert av dem kan lure deg alene. Feilene er ikke tilfeldige. De opphopes rundt skadde bånd, generiske modellnavn, og sigarer der det eneste referansebildet ikke stemmer med det du holder i hånden.
Hva ser en skanner egentlig på?
Rett et kamera mot en sigar, og det finnes ikke bare én ting å gjenkjenne. Det er fire ting lagt på hverandre, og en pipeline som fungerer må lese alle sammen og deretter avgjøre hvor mye den skal stole på hver av dem.
Bandet bærer trykt eller preget tekst, som vanligvis er det tydeligste signalet når det er leselig. Dekkbladet har en farge og en overflatestruktur som snevrer inn nyansefamilien – et Connecticut-skyggedyrket blad ser ikke ut som en mørk, oljete maduro, men mange nyanser ligger så tett at belysningen alene kan vippe klassifiseringen. Hetten og den generelle silhuetten snevrer inn vitolaen – en rett parejo ser annerledes ut enn en avsmalnende figurado. Og målene, ringmål og lengde, snevrer kandidatene ytterligere inn innenfor hvilken linje de andre signalene allerede har pekt mot.
Ingen av disse fire er pålitelige nok til å kjøres alene. Et system som fungerer, kjører dem sammen og lar hvert signal korrigere de andre. Når folk sier at en skanner «tok feil», er det som vanligvis har skjedd at ett signal var sterkt og sikkert – og feil – uten at noe annet fanget det opp.
Å matche mot et reelt katalog er også et annet problem enn å klassifisere et bilde isolert. Paradigms eget katalog inneholder 11 519 sigarer, og alle disse fire signalene må til slutt kontrolleres mot reelle oppføringer – ikke bare gjenkjennes som «en maduro robusto», som snevrer inn feltet uten å identifisere noe som helst.
Hvorfor svikter bandtekst så ofte?
Bandtekst ser ut som den enkle delen. Det er den vanligvis ikke. Et bånd ligger rundt en sylinder, så kameraet fotograferer det krummet, og tekstgjenkjenning som i hovedsak er trent på flate sider, gjør det dårligere på krummet tekst enn de fleste forventer. Bånd i folie gir refleksjoner som sluker hele bokstaver avhengig av lysvinkelen. Bånd som har ligget i en lommebok eller et reiseetui blir skrukket, skrapt opp eller delvis løsnet, og et delvis skjult ord kan leses som et helt annet ord enn det som faktisk står trykt.
Så er det et problem som ikke har noe med bildekvalitet å gjøre: en god del sigarer har rett og slett ingen særegne navn å lese. Band-only-tilnærmingen til identifisering svikter på en ganske forutsigbar rekke måter, og en av de største er at noen produkter er navngitt med ord som er så generiske at selv en perfekt tekstgjenkjenning fortsatt ikke sier deg hvilken bestemt sigar du holder.
Hva betyr egentlig problemet med 13,3 % generiske navn?
I et katalog med 11 519 sigarer har 13,3 % av oppføringene modellnavn som er bygget helt opp av generiske ord – begreper som beskriver en kategori i stedet for å identifisere et produkt. En skanner som leste hvert tegn på bandet med total nøyaktighet, ville likevel ikke hatt noe særegent å matche mot, fordi ordene i seg selv ikke tilhører én sigar mer enn en annen.
Dette er grunnen til at bandtekst ikke kan være hele systemet, selv med et perfekt bilde. Tekstmatching trenger noe å matche mot, og omtrent én sigar av åtte i et reelt katalog gir den ikke noe slikt.
Hvorfor kan ikke dekkbladfarge og form bære resten av veien?
Dekkblad og form ser ut som de burde være mer tilgivende, siden ingen av dem er avhengige av leselig trykk. I praksis er de bare vanskelige på en annen måte.
Nyanseklassifisering endrer seg med luftfuktigheten. Oljer stiger til overflaten av et dekkblad over tid og endrer hvordan lyset reflekteres, og et blad fotografert i varmt innendørslys – lavere på fargetemperatur-skalaen enn dagslys – leses som flere nyanser mørkere enn det samme bladet utendørs. Formklassifisering møter på det rene antallet vitola-familier som ser nesten identiske ut fra én enkelt vinkel. Det finnes dusinvis av navngitte former og størrelser i sirkulasjon, og flere par av dem skiller seg hovedsakelig i en avsmalningsvinkel eller en hettestil som et mobilkamera fanger ulikt avhengig av avstand og innramming.
Ingen av disse er en grunn til å gi opp signalet. Det er en grunn til å forvente at det krever reell, målrettet ingeniørkunst snarere enn ett bredt forsøk. Paradigms egen hetteform-klassifiserer gikk fra 78,6 % til 91,9 % nøyaktighet på reelle produksjonsskanninger etter en fiks bygget rundt to spesifikke, målte egenskaper i stedet for en full modellendring, noe som er et bevis på at formgjenkjenning responderer mer på smale, nøye korreksjoner enn på en større, mer generell modell. Hva et dekkblad og en form faktisk kan si deg før du selv tenner sigaren er et relatert, men eget spørsmål som er verdt sitt eget svar.
Hvordan bør jeg tolke en nøyaktighetspåstand fra en sigar-app?
De fleste publiserte nøyaktighetstallene beskriver et testsett: en utvalgt samling rene, godt belyste referansebilder valgt fordi de fotograferer bra. Det tallet sier deg nesten ingenting om hva som skjer når du står i ujevnt lys med et bånd som er halvveis slitt bort.
Det mer nyttige tallet er ett som er målt på reelle produksjonsskanninger – ekte bilder tatt av ekte mennesker under ekte forhold, ikke en referansetest satt sammen for å se bra ut. Det er en mindre mengde eksempler å kontrollere mot, fordi det krever at man faktisk lanserer noe og måler hva som skjer etterpå, i stedet for å rapportere et laboratorieresultat én gang og gå videre.
| Spørsmål å stille | Hvorfor det betyr noe |
|---|---|
| Målt på et testsett, eller på reelle skanninger? | Et testsett er langt renere enn virkeligheten |
| Ett signal, eller flere kombinert? | Et system med kun ett signal overtar nøyaktig de feilmåtene det signalet har |
| Sier den noe om hvordan den håndterer et skadet eller folierefleksert bånd? | Hvis bandtekst er hele pipelinen, er det her den bryter sammen |
| Er tallet datert, eller er det en engangspåstand? | Modeller og kataloger endres; fjorårets tall holder kanskje ikke nå |
Hvis en app ikke kan svare på de to første spørsmålene, bør du behandle enhver prosentandel i overskriften som markedsføring snarere enn måling.
Kort oppsummert
- En skanner leser fire separate signaler – bandtekst, dekkbladfarge, hetteform og mål – og ingen av dem er pålitelige alene.
- Krummet folie, refleksjoner, skrukker og slitasje er grunnen til at bandtekst svikter oftere enn folk forventer.
- Omtrent én sigar av åtte (13,3 %) i et reelt katalog har et navn som er for generisk for tekstmatching, uansett bildekvalitet.
- Form- og fargegjenkjenning forbedres med målrettede, veloverveide fikser: en korreksjon basert på to egenskaper flyttet én reell klassifiserer fra 78,6 % til 91,9 %.
- Før du stoler på et nøyaktighetstall, bør du spørre om det kommer fra reelle skanninger eller fra et rent testsett.