Колку е точно препознавањето на пури со вештачка интелигенција и зошто скенерите за идентификација преку фотографија често грешат?
Подобро отколку порано, но послабо отколку што тврди маркетингот. Скенерот за идентификација преку фотографија всушност е неколку ненадежни сигнали кои гласаат истовремено: текст на бандеролата, боја и текстура на обвивката, облик на капата и димензии. Секој од нив може сам по себе да заведе. Грешките не се случајни. Тие се концентрирани околу оштетени бандероли, генерички имиња на модели и пури чија единствена референтна фотографија не се совпаѓа со тоа што го држите во раката.
Во што всушност гледа скенерот?
Насочете камера кон пура и нема само едно нешто за препознавање. Постојат четири слоја наслоени едни врз други, и функционален систем мора да ги прочита сите и потоа да одлучи колку да му верува на секој.
Бандеролата носи печатен или релјефен текст, обично најгласниот сигнал кога е читлив. Обвивката има боја и површинска текстура која го сужува семејството на нијанси - лист Connecticut-shade тутун не изгледа ништо слично на темен, маслен мадуро, но многу нијанси се доволно блиски за да само осветлувањето ги замени класификациите. Капата и целосната силуета го сужуваат вителот - прав парехо се чита поинаку од конусен фигурадо. А димензиите, обемот и должината, дополнително ги сужуваат кандидатите внатре во линијата на која веќе укажуваат другите сигнали.
Никој од тие четири сигнали не е доволно надежен да се користи самостојно. Систем што функционира ги пушта сите заедно и дозволува секој да ги коригира другите. Кога луѓето велат дека скенер „погрешил", обично се работи за тоа што еден сигнал бил силен, сигурен во себе и погрешен, а ништо друго не го фатило тоа.
Совпаѓањето со реален каталог е исто така поинаков проблем од класификацијата на изолирана фотографија. Сопствениот каталог на Paradigm содржи 11.519 пури, и секој од тие четири сигнали на крајот мора да се провери наспроти реални записи, а не само да се препознае како „мадуро робусто", што го сужува опсегот без да идентификува ништо конкретно.
Зошто текстот на бандеролата толку често не успева?
Текстот на бандеролата изгледа како најлесниот дел. Обично не е. Бандеролата се обвиткува околу цилиндар, па камерата го фотографира закривен, а препознавањето на текст, обучено главно на рамни страници, работи полошо на закривен текст отколку што повеќето луѓе очекуваат. Фолиите на бандеролите додаваат бљесок што проголта цели букви во зависност од аголот на светлината. Бандероли што поминале време во џеб или патна кутија се изгужваат, изгребуваат или делумно се одлепуваат, а делумно скриен збор може да се прочита како сосема друг збор од оној што навистина е отпечатен.
Потоа има проблем што нема никаква врска со квалитетот на сликата: значителен дел од пурите едноставно немаат карактеристични имиња за читање. Пристапот заснован единствено на бандеролата при идентификацијата не успева на доста предвидливи начини, а еден од најголемите проблеми е тоа што некои производи се именувани со зборови толку генерички што дури и совршено извлекување на текстот сепак не ви кажува која конкретна пура ја држите.
Што всушност значи проблемот со 13,3% генерички имиња?
Во каталог од 11.519 пури, 13,3% од записите имаат имиња на модели составени целосно од генерички зборови - термини што описуваат категорија наместо да идентификуваат производ. Скенер што ќе прочита секоја буква на таа бандерола со целосна точност сепак нема ништо карактеристично со кое да спореди, бидејќи самите зборови не припаѓаат на една пура повеќе отколку на која и да е друга.
Затоа текстот на бандеролата не може да биде целиот систем дури и со совршена фотографија. Совпаѓањето на текст има потреба од нешто со кое да се спореди, а приближно една од осум пури во реален каталог не му дава тоа.
Зошто бојата на обвивката и обликот не можат сами да го носат остатокот?
Обвивката и обликот изгледаат како да треба да бидат попростодушни, бидејќи ниедниот не зависи од читлив печат. Во пракса, тие се тешки на поинаков начин.
Класификацијата на нијансата варира со влажноста. Маслата се издигнуваат на површината на обвивката со времето и го менуваат начинот на кој светлината се одразува од неа, а лист фотографиран под топло внатрешно светло, пониско на скалата на температура на бојата од дневна светлина, се чита неколку нијанси потемен отколку истиот лист надвор. Класификацијата на обликот наидува на самиот број на семејства на вители кои изгледаат речиси идентични од еден агол. Постојат десетици именувани облици и големини во употреба, и неколку парови од нив се разликуваат главно по аголот на конусноста или стилот на капата, што камерата на телефон ги снима нецелосно конзистентно во зависност од растојанието и кадрирањето.
Ниедно од ова не е причина да се откажете од сигналот. Тоа е причина да очекувате дека му треба вистинско, насочено инженерство наместо едно широко решение. Сопствениот класификатор на облик на капа кај Paradigm отишол од 78,6% на 91,9% точност при живи продукциски скенирања по поправка изградена околу две конкретни измерени карактеристики, наместо целосна промена на моделот, што е доказ дека препознавањето на обликот реагира повеќе на тесна, внимателна корекција отколку на поголем, пообопфатен модел. Што чесно можат да ви кажат обвивката и обликот пред дури и да ја запалите пурата е поврзано, но посебно прашање кое заслужува свој одговор.
Како треба да читам тврдење за точност од апликација за пури?
Повеќето објавени бројки за точност описуваат тестно множество: избрана серија од чисти, добро осветлени референтни фотографии избрани затоа што фотогенично изгледаат добро. Тој број не ви кажува речиси ништо за тоа што се случува кога стоите во нерамномерно светло со бандерола која е наполовина изабена.
Покорисниот број е оној измерен на живи продукциски скенирања - реални фотографии направени од реални луѓе во реални услови, не репер составен да изгледа добро. Тоа е помал опсег примероци за проверка, бидејќи бара всушност да се пушти нешто во употреба и да се мери што се случува потоа, наместо еднаш да се пријави резултат од лабораторија и да се продолжи понатаму.
| Прашање за поставување | Зошто е важно |
|---|---|
| Мерено на тестно множество или на живи скенирања? | Тестното множество е значително почисто од реалноста |
| Еден сигнал или неколку комбинирани? | Систем со единствен сигнал наследува точно неговите начини на грешење |
| Дали се наведува како се справува со оштетена или бљеснита бандерола од фолија? | Ако текстот на бандеролата е целиот систем, тука е местото каде пукнува |
| Бројката е датирана или е еднократно тврдење? | Моделите и каталозите се менуваат; минатогодишната бројка можеби повеќе не важи |
Ако апликацијата не може да одговори на првите два прашања, третирајте секоја истакната процентуална бројка како маркетинг, а не мерење.
Кратка верзија
- Скенерот чита четири одделни сигнали - текст на бандерола, боја на обвивка, облик на капа и димензии - и ниеден од нив сам по себе не е надежен.
- Закривена фолија, бљесок, изгужвување и изабеност се причините зошто текстот на бандеролата не успева почесто отколку што луѓето очекуваат.
- Приближно една од осум пури (13,3%) во реален каталог има име премногу генеричко за да го реши совпаѓањето на текст, без разлика на квалитетот на фотографијата.
- Препознавањето на облик и боја се подобруваат со насочени, измерени поправки: корекција со две карактеристики преместила еден жив класификатор од 78,6% на 91,9%.
- Пред да верувате на бројка за точност, прашајте дали доаѓа од живи скенирања или од чисто тестно множество.