Колко точно е разпознаването на пури с изкуствен интелект и защо скенерите за снимки често грешат?
По-добре е, отколкото беше, но по-зле, отколкото подсказва маркетингът. Скенерът, разпознаващ по снимка, всъщност е няколко ненадеждни сигнала, които „гласуват“ едновременно: текст на бандерола, цвят и текстура на покривния лист, форма на капата и размери. Всеки от тях сам по себе си може да подведе. Грешките не са случайни — те се струпват около повредени бандероли, родови имена на модели и пури, чиято единствена референтна снимка не съвпада с това, което държите в ръка.
В какво всъщност се вглежда скенерът?
Насочете камера към пура и няма едно-единствено нещо за разпознаване. Има четири неща, наслоени едно върху друго, и работещият процес трябва да прочете и четирите, а после да прецени доколко да се довери на всяко от тях.
Бандеролът носи отпечатан или релефен текст — обикновено най-силният сигнал, когато е четим. Покривният лист има цвят и повърхностна текстура, които стесняват семейството от нюанси: лист Connecticut shade не прилича по нищо на тъмен маслен мадуро, но доста нюанси стоят достатъчно близо един до друг, че самото осветление може да обърне класификацията. Капата и цялостният силует стесняват вида (витола) — прав парехо се различава от конусовиден фигурадо. А размерите — диаметър (ring gauge) и дължина — стесняват още повече кандидатите в рамките на линията, към която вече сочат другите сигнали.
Никой от тези четири сигнала сам по себе си не е достатъчно надежден. Работеща система ги пуска заедно и оставя всеки от тях да коригира останалите. Когато хората казват, че скенерът „сгрешил“, обикновено се е случило това: един сигнал е бил силен, уверен и грешен, и нищо друго не го е уловило.
Съпоставянето с реален каталог също е различен проблем от класифицирането на снимка в изолация. Собственият каталог на Paradigm съдържа 11 519 пури, и всеки от тези четири сигнала рано или късно трябва да бъде сверен с реални записи — не просто разпознат като „мадуро робусто“, което стеснява полето, без да идентифицира каквото и да било.
Защо текстът на бандерола греши толкова често?
Текстът на бандерола изглежда като лесната част. Обикновено не е. Бандеролът обвива цилиндър, така че камерата го снима извит, а разпознаването на текст, обучено предимно върху плоски страници, се справя по-зле с извит текст, отколкото повечето хора очакват. Фолиевите бандероли добавят отблясъци, които поглъщат цели букви в зависимост от ъгъла на светлината. Бандероли, прекарали време в джоб или пътна кутия, се намачкват, надраскват или частично олющват, а частично закрита дума може да се прочете като съвсем друга дума от тази, действително отпечатана върху нея.
После идва проблем, който няма нищо общо с качеството на изображението: доста голяма част от пурите просто нямат отличителни имена за прочитане. Подходът, разчитащ само на бандерола, се проваля по доста предвидим начин, и един от най-големите проблеми е, че някои продукти са именувани с думи, толкова родови, че дори перфектно извличане на текст пак не казва коя точно пура държите.
Какво всъщност означава проблемът с 13,3% родови имена?
В каталог от 11 519 пури 13,3% от записите имат имена на модели, изградени изцяло от родови думи — термини, които описват категория, а не идентифицират продукт. Скенер, който прочете всеки символ на бандерола с пълна точност, пак няма да има с какво отличително да го съпостави, защото самите думи не принадлежат повече на една пура, отколкото на друга.
Затова текстът на бандерола не може да бъде цялата система, дори при перфектна снимка. Съпоставянето на текст се нуждае от нещо, с което да го съпостави, а приблизително всяка осма пура в реален каталог не му предоставя такова.
Защо цветът на покривния лист и формата не могат да поемат останалото?
Покривният лист и формата изглеждат сякаш би трябвало да са по-снизходителни, тъй като нито едно от двете не зависи от четлив печат. На практика и двете са трудни, но по различен начин.
Класификацията на нюанса се променя с влажността. Маслата се издигат на повърхността на покривния лист с времето и променят как светлината се отразява от него, а лист, снимай под топла вътрешна светлина, по-ниска по скалата на цветовата температура от дневната светлина, изглежда с няколко нюанса по-тъмен от същия лист на открито. Класификацията на формата се сблъсква с огромния брой семейства витоли, които изглеждат почти еднакви от един-единствен ъгъл. В обращение съществуват десетки наименувани форми и размери, а няколко от двойките им се различават основно по ъгъла на стесняване или стила на капата, които камерата на телефона улавя непоследователно в зависимост от разстоянието и кадрирането.
Нито едно от тези неща не е причина да се отказваме от сигнала. Причина е да очакваме, че се нуждае от истинско, целенасочено инженерство, а не от едно общо преминаване. Собственият класификатор на Paradigm за форма на капата премина от 78,6% на 91,9% точност при реални сканирания в продукция, след поправка, изградена около две конкретни измерени характеристики, а не при цялостна смяна на модела — това е доказателство, че разпознаването на формата реагира повече на тясна, внимателна корекция, отколкото на по-голям, по-общ модел. Какво честно могат да ви кажат покривният лист и формата, още преди да запалите пурата е свързан, но отделен въпрос, заслужаващ собствен отговор.
Как да чета твърдение за точност от кое да е приложение за пури?
Повечето публикувани числа за точност описват тестов набор: подбрана партида от чисти, добре осветени референтни снимки, избрани, защото се снимат добре. Това число почти нищо не казва за това какво се случва, когато сте изправени пред неравномерна светлина с наполовина изтрит бандерол.
По-полезното число е измереното при реални сканирания в продукция — истински снимки, направени от истински хора в истински условия, а не еталон, съставен, за да изглежда добре. Това е по-малък набор от примери за проверка, защото изисква реално пускане на продукт и измерване на резултатите след това, а не еднократно отчитане на лабораторен резултат и продължаване напред.
| Въпрос за задаване | Защо е важен |
|---|---|
| Измерено при тестов набор или при реални сканирания? | Тестовият набор е далеч по-чист от реалността |
| Един сигнал или няколко, комбинирани? | Система с един сигнал наследява точно неговите слабости |
| Казва ли се как се справя с повреден или блестящ от фолио бандерол? | Ако текстът на бандерола е цялата система, точно тук се проваля |
| Числото датирано ли е, или е еднократно твърдение? | Моделите и каталозите се променят; миналогодишното число може вече да не важи |
Ако едно приложение не може да отговори на първите два въпроса, приемайте всеки главен процент по-скоро като маркетинг, отколкото като измерване.
Накратко
- Скенерът чете четири отделни сигнала — текст на бандерола, цвят на покривния лист, форма на капата и размери — и нито един от тях сам по себе си не е надежден.
- Извитото фолио, отблясъците, намачкването и износването са причината текстът на бандерола да греши по-често, отколкото хората очакват.
- Приблизително всяка осма пура (13,3%) в реален каталог има име, твърде родово, за да го реши съпоставянето на текст, независимо от качеството на снимката.
- Разпознаването на форма и цвят се подобрява чрез целенасочени, измерени поправки: корекция с две характеристики премести един класификатор в реални условия от 78,6% на 91,9%.
- Преди да се доверите на число за точност, попитайте дали идва от реални сканирания или от чист тестов набор.