ParadigmJournal
Polski

Updated 2026-08-30

Jak dokładne jest rozpoznawanie cygar oparte na AI i dlaczego skanery identyfikacji ze zdjęć często się mylą?

Lepiej niż kiedyś, gorzej niż sugeruje marketing. Skaner identyfikacji ze zdjęć to kilka niepewnych sygnałów głosujących jednocześnie: tekst na banderoli, kolor i faktura okrywy, kształt czapki oraz wymiary. Każdy z nich z osobna może wprowadzić w błąd. Awarie nie są przypadkowe. Skupiają się wokół uszkodzonych banderol, ogólnikowych nazw modeli oraz cygar, których jedyne referencyjne zdjęcie nie pasuje do tego, co trzymasz w ręku.

Na co właściwie patrzy skaner?

Skieruj aparat na cygaro, a nie znajdziesz jednej rzeczy do rozpoznania. Są cztery warstwy nałożone na siebie, a działający system musi odczytać je wszystkie, a potem zdecydować, na ile ufać każdej z nich.

Banderola niesie drukowany lub wytłaczany tekst, zwykle najgłośniejszy sygnał, gdy jest czytelny. Okrywa ma kolor i fakturę powierzchni, które zawężają rodzinę odcieni — liść typu Connecticut-shade nie przypomina w niczym ciemnego, oleistego maduro, ale wiele odcieni leży na tyle blisko siebie, że samo oświetlenie potrafi odwrócić klasyfikację. Czapka i ogólna sylwetka zawężają vitolę — prosty parejo czyta się inaczej niż zwężający się figurado. A wymiary, obwód i długość, dalej zawężają kandydatów w obrębie linii, na którą wskazały już pozostałe sygnały.

Żaden z tych czterech elementów nie jest wystarczająco pewny, by działać samodzielnie. Działający system uruchamia je razem i pozwala, by każdy korygował pozostałe. Gdy ludzie mówią, że skaner „się pomylił", zwykle chodzi o to, że jeden sygnał był silny, pewny siebie i błędny, a nic innego tego nie wychwyciło.

Dopasowywanie do prawdziwego katalogu to też zupełnie inny problem niż klasyfikowanie pojedynczego zdjęcia w oderwaniu od reszty. Własny katalog Paradigm zawiera 11 519 cygar, a każdy z tych czterech sygnałów musi w końcu zostać zestawiony z realnymi pozycjami, a nie tylko rozpoznany jako „maduro robusto", co zawęża pole, ale niczego nie identyfikuje.

Dlaczego tekst z banderoli tak często zawodzi?

Tekst na banderoli wygląda na łatwą część. Zwykle nią nie jest. Banderola owija się wokół walca, więc aparat fotografuje ją zakrzywioną, a rozpoznawanie tekstu wytrenowane głównie na płaskich stronach radzi sobie z tekstem zakrzywionym gorzej, niż większość ludzi się spodziewa. Foliowe banderole dodają odbicia światła, które potrafią pochłonąć całe litery w zależności od kąta padania światła. Banderole, które spędziły czas w kieszeni lub etui podróżnym, bywają pomięte, przetarte lub częściowo odklejone, a częściowo zasłonięte słowo może zostać odczytane jako zupełnie inne niż to faktycznie wydrukowane.

Jest też problem niemający nic wspólnego z jakością zdjęcia: sporo cygar po prostu nie ma charakterystycznych nazw do odczytania. Podejście oparte wyłącznie na banderoli zawodzi w dość przewidywalny sposób, a jednym z największych problemów jest to, że niektóre produkty nazwane są słowami na tyle ogólnymi, że nawet idealne odczytanie tekstu wciąż nie mówi, które konkretnie cygaro trzymasz w ręku.

Co właściwie oznacza problem 13,3% ogólnikowych nazw?

W katalogu liczącym 11 519 cygar 13,3% pozycji ma nazwy modeli zbudowane wyłącznie z ogólnikowych słów — określeń opisujących kategorię, a nie identyfikujących konkretny produkt. Skaner, który odczytałby każdy znak na tej banderoli z absolutną dokładnością, i tak nie miałby nic charakterystycznego do porównania, bo same słowa nie należą bardziej do jednego cygara niż do innego.

Dlatego tekst z banderoli nie może być całym systemem, nawet przy idealnym zdjęciu. Dopasowywanie tekstu potrzebuje czegoś, do czego można go dopasować, a mniej więcej co ósme cygaro w prawdziwym katalogu tego nie zapewnia.

Dlaczego kolor okrywy i kształt nie mogą udźwignąć reszty?

Okrywa i kształt wyglądają, jakby powinny być bardziej wybaczające, bo żadne z nich nie zależy od czytelnego druku. W praktyce są trudne, tylko na inny sposób.

Klasyfikacja odcienia dryfuje wraz z wilgotnością. Oleje z czasem wychodzą na powierzchnię okrywy i zmieniają sposób odbicia światła, a liść sfotografowany w ciepłym świetle wewnętrznym, niższym w skali temperatury barwowej niż światło dzienne, wygląda na kilka odcieni ciemniejszy niż ten sam liść na zewnątrz. Klasyfikacja kształtu napotyka na samą liczbę rodzin vitoli, które z jednego kąta wyglądają niemal identycznie. W obiegu funkcjonują dziesiątki nazwanych kształtów i rozmiarów, a kilka par różni się głównie kątem zwężenia lub stylem czapki, który aparat telefonu rejestruje niespójnie w zależności od odległości i kadrowania.

Żaden z tych faktów nie jest powodem, by rezygnować z danego sygnału. To powód, by oczekiwać, że wymaga on prawdziwej, ukierunkowanej inżynierii, a nie jednego szerokiego podejścia. Własny klasyfikator kształtu czapki Paradigm przeszedł z 78,6% do 91,9% dokładności na rzeczywistych skanach produkcyjnych po poprawce zbudowanej wokół dwóch konkretnych, mierzonych cech, a nie po całościowej zmianie modelu — co dowodzi, że rozpoznawanie kształtu reaguje bardziej na wąskie, staranne korekty niż na większy, bardziej ogólny model. To, co okrywa i kształt naprawdę mogą powiedzieć, zanim jeszcze zapalisz cygaro, to osobne pytanie, warte odrębnej odpowiedzi.

Jak czytać deklarację dokładności dowolnej aplikacji do cygar?

Większość publikowanych liczb dokładności opisuje zbiór testowy: wyselekcjonowaną partię czystych, dobrze oświetlonych zdjęć referencyjnych wybranych dlatego, że dobrze się fotografują. Ta liczba mówi niemal nic o tym, co się dzieje, gdy stoisz w nierównym świetle z banderolą do połowy zdartą.

Bardziej użyteczna jest liczba zmierzona na rzeczywistych skanach produkcyjnych — prawdziwych zdjęciach zrobionych przez prawdziwych ludzi w rzeczywistych warunkach, a nie na wystylizowanym benchmarku. To mniejsza pula przykładów do sprawdzenia, bo wymaga faktycznego wypuszczenia produktu i zmierzenia, co dzieje się później, zamiast jednorazowego przedstawienia wyniku laboratoryjnego.

Pytanie do zadania Dlaczego to ważne
Zmierzone na zbiorze testowym czy na rzeczywistych skanach? Zbiór testowy jest znacznie czystszy niż rzeczywistość
Jeden sygnał czy kilka połączonych? System oparty na jednym sygnale dziedziczy dokładnie jego wady
Czy podano, jak radzi sobie z uszkodzoną lub błyszczącą banderolą? Jeśli tekst z banderoli to cały system, tutaj właśnie się załamuje
Czy liczba ma datę, czy to jednorazowa deklaracja? Modele i katalogi się zmieniają; zeszłoroczna liczba może już nie obowiązywać

Jeśli aplikacja nie potrafi odpowiedzieć na pierwsze dwa pytania, traktuj każdy nagłówkowy procent jako marketing, a nie pomiar.

W skrócie