Kuinka tarkkaa tekoälyyn perustuva sikaritunnistus on, ja miksi kuvatunnistimet menevät usein pieleen?
Parempaa kuin ennen, huonompaa kuin markkinointi antaa ymmärtää. Kuvaan perustuva tunnistin on useita epäluotettavia signaaleja, jotka äänestävät yhtä aikaa: nauhan teksti, peitelehden väri ja pintarakenne, hatun muoto sekä mitat. Mikä tahansa näistä voi johtaa harhaan yksinään. Virheet eivät ole satunnaisia. Ne kasautuvat vaurioituneiden nauhojen, yleisluontoisten mallinimien ja sellaisten sikarien ympärille, joiden ainoa vertailukuva ei vastaa sitä, mitä kädessäsi on.
Mitä tunnistin oikeastaan näkee?
Kun kameran suuntaa sikariin, tunnistettavana ei ole yksi asia. Päällekkäin on neljä asiaa, ja toimivan järjestelmän on luettava ne kaikki ja päätettävä sitten, kuinka paljon kuhunkin kannattaa luottaa.
Nauhassa on painettua tai kohokuvioitua tekstiä, ja se on tavallisesti voimakkain signaali silloin, kun se on luettavissa. Peitelehdellä on väri ja pintarakenne, joka rajaa sävyperheen – Connecticut-shade-tupakkalehti ei muistuta lainkaan tummaa, öljyistä maduroa, mutta monet sävyt ovat niin lähellä toisiaan, että valaistus yksinään voi kääntää luokituksen väärään suuntaan. Hattu ja kokonaissilhuetti rajaavat vitolan: suorareunainen parejo näyttää erilaiselta kuin kapeneva figurado. Ja mitat, ympärysmitta ja pituus, rajaavat ehdokkaita edelleen sen linjan sisällä, johon muut signaalit ovat jo osoittaneet.
Mikään näistä neljästä ei ole yksinään riittävän luotettava. Toimiva järjestelmä ajaa niitä yhdessä ja antaa kunkin korjata toisiaan. Kun ihmiset sanovat tunnistimen "menneen pieleen", tavallisesti on käynyt niin, että yksi signaali oli vahva, varma ja väärässä, eikä mikään muu huomannut sitä.
Vertailu todelliseen luettelointiin on myös eri asia kuin yksittäisen kuvan luokittelu erillisenä. Paradigmin omassa luettelossa on 11 519 sikaria, ja lopulta kaikki neljä signaalia on verrattava todellisiin tietueisiin, ei vain tunnistettava "maduro-robustoksi", mikä rajaa joukkoa mutta ei tunnista mitään.
Miksi nauhan teksti epäonnistuu niin usein?
Nauhan teksti vaikuttaa helpoimmalta osuudelta. Tavallisesti se ei ole. Nauha kiertyy sylinterin ympärille, jolloin kamera kuvaa sen kaarevana, ja tekstintunnistus, joka on koulutettu enimmäkseen tasaisilla sivuilla, toimii kaarevalla tekstillä huonommin kuin moni olettaa. Foliopintaiset nauhat tuovat heijastusta, joka nielee kokonaisia kirjaimia valon kulmasta riippuen. Nauhat, jotka ovat viettäneet aikaa taskussa tai matkakotelossa, rypistyvät, kuluvat tai kuoriutuvat osittain, ja osittain peittynyt sana voi näyttää kokonaan toiselta sanalta kuin siihen on oikeasti painettu.
Sitten on ongelma, joka ei liity kuvanlaatuun lainkaan: huomattavalla osalla sikareista ei yksinkertaisesti ole erottuvia nimiä luettavaksi. Pelkkään nauhaan perustuva tunnistustapa epäonnistuu varsin ennustettavalla tavalla, ja yksi suurimmista syistä on se, että osa tuotteista on nimetty sanoilla, jotka ovat niin yleisiä, että täydellinenkin tekstintunnistus ei vielä kerro, mitä tarkkaa sikaria kädessä pitelet.
Mitä 13,3 %:n yleisnimiongelma oikeastaan tarkoittaa?
11 519 sikarin luettelossa 13,3 %:lla tuotteista on mallinimi, joka koostuu kokonaan yleisistä sanoista – termeistä, jotka kuvaavat kategoriaa sen sijaan, että tunnistaisivat tuotteen. Tunnistin, joka lukisi nauhan kirjaimen tarkkuudella täysin oikein, ei saisi siltikään mitään erottuvaa, mihin verrata, koska sanat itsessään eivät kuulu yhdelle sikarille enemmän kuin toiselle.
Tästä syystä nauhan teksti ei voi olla koko järjestelmä, vaikka kuva olisi täysin virheeton. Tekstin täsmäytys tarvitsee jotain, mihin täsmäyttää, ja noin joka kahdeksas sikari todellisessa luettelossa ei anna sille sellaista.
Miksi peitelehden väri ja muoto eivät riitä loppumatkaan?
Peitelehti ja muoto vaikuttavat antoisammilta signaaleilta, koska kumpikaan ei riipu luettavasta painotekstistä. Käytännössä ne ovat vain vaikeita toisella tavalla.
Sävyluokitus ajelehtii kosteuden mukana. Öljyt nousevat peitelehden pintaan ajan myötä ja muuttavat sitä, miten valo heijastuu siitä, ja lämpimässä sisävalaistuksessa – jonka värilämpötila on matalampi kuin päivänvalossa – kuvattu lehti näyttää useita sävyjä tummemmalta kuin samainen lehti ulkona. Muodon luokittelu kompastuu siihen, kuinka monta vitolaperhettä näyttää lähes samalta yhdestä kuvakulmasta. Käytössä on kymmeniä nimettyjä muotoja ja kokoja, ja useat parit eroavat toisistaan lähinnä kapenemiskulman tai hattutyylin osalta, jonka puhelimen kamera tallentaa epäjohdonmukaisesti etäisyydestä ja kuvakulmasta riippuen.
Kumpikaan näistä ei ole syy luopua signaalista. Se on syy odottaa, että se tarvitsee aitoa, kohdennettua kehitystyötä yhden laajan yrityksen sijaan. Paradigmin oma hattumuodon luokittelija nousi 78,6 %:n tarkkuudesta 91,9 %:iin tuotannon live-skannauksissa korjauksen ansiosta, joka rakennettiin kahden tarkasti mitatun piirteen varaan koko mallin vaihtamisen sijaan – tämä osoittaa, että muodontunnistus reagoi kapeaan, huolelliseen korjaukseen enemmän kuin isompaan, yleisempään malliin. Se, mitä peitelehti ja muoto voivat rehellisesti kertoa jo ennen kuin sikaria sytytetään, on omaa vastaustaan ansaitseva, erillinen kysymys.
Miten minun pitäisi tulkita sikarisovelluksen tarkkuusväitteitä?
Useimmat julkaistut tarkkuusluvut kuvaavat testijoukkoa: valittua erää siistejä, hyvin valaistuja vertailukuvia, jotka on valittu siksi, että ne kuvautuvat hyvin. Tämä luku ei kerro juuri mitään siitä, mitä tapahtuu, kun seisot epätasaisessa valossa nauha, joka on puoliksi kulunut pois.
Hyödyllisempi luku on mitattu tuotannon live-skannauksista – oikeista kuvista, joita oikeat ihmiset ottavat oikeissa olosuhteissa, ei vertailua, joka on koostettu näyttämään hyvältä. Se on pienempi otos verrattavaksi, koska se vaatii oikean julkaisun ja sen jälkeisten tulosten mittaamisen, ei kertaluonteista laboratoriotulosta, jonka jälkeen siirrytään eteenpäin.
| Kysymys, jonka kannattaa esittää | Miksi se on tärkeää |
|---|---|
| Mitattu testijoukosta vai live-skannauksista? | Testijoukko on reilusti siistimpi kuin todellisuus |
| Yksi signaali vai useita yhdistettynä? | Yhden signaalin järjestelmä perii sen signaalin omat virhetavat |
| Kertooko se, miten se käsittelee vaurioituneen tai folioheijastuksesta kärsivän nauhan? | Jos nauhan teksti on koko putki, tästä se murtuu |
| Onko luku päivätty, vai kertaluonteinen väite? | Mallit ja luettelot muuttuvat; viime vuoden luku ei välttämättä päde nyt |
Jos sovellus ei pysty vastaamaan kahteen ensimmäiseen kysymykseen, suhtaudu mihin tahansa otsikkoprosenttiin markkinointina, ei mittauksena.
Lyhyesti
- Tunnistin lukee neljä erillistä signaalia – nauhan tekstin, peitelehden värin, hatun muodon ja mitat – eikä mikään niistä ole yksinään luotettava.
- Kaareva folio, heijastukset, rypistyminen ja kuluminen selittävät, miksi nauhan teksti epäonnistuu useammin kuin odottaisi.
- Noin joka kahdeksannella sikarilla (13,3 %) todellisessa luettelossa on nimi, joka on liian yleisluontoinen tekstintunnistuksen ratkaistavaksi, kuvan laadusta riippumatta.
- Muodon- ja värintunnistus parantuvat kohdennetuilla, mitatuilla korjauksilla: kahden piirteen korjaus nosti yhden live-luokittelijan tarkkuuden 78,6 %:sta 91,9 %:iin.
- Ennen kuin luotat tarkkuuslukuun, kysy, tuliko se live-skannauksista vai siististä testijoukosta.