ParadigmJournal
Bahasa Melayu

Updated 2026-08-30

Sejauh Mana Tepatnya Pengecaman Cerut Berasaskan AI, dan Mengapa Pengimbas Kenal Pasti Foto Sering Tersilap?

Lebih baik daripada dahulu, tetapi tidak sehebat yang digambarkan oleh pemasaran. Pengimbas kenal pasti foto sebenarnya adalah beberapa isyarat yang tidak boleh dipercayai sepenuhnya, "bersuara" serentak: teks jalur, warna dan tekstur pembalut, bentuk tudung, dan dimensi. Mana-mana satu sahaja boleh mengelirukan jika digunakan bersendirian. Kegagalan ini bukan secara rawak. Ia cenderung berlaku pada jalur yang rosak, nama model yang terlalu umum, dan cerut yang satu-satunya foto rujukannya tidak sepadan dengan apa yang ada di tangan anda.

Apakah sebenarnya yang dilihat oleh pengimbas?

Hadapkan kamera pada sebatang cerut dan bukan satu perkara sahaja yang perlu dikenal pasti. Terdapat empat perkara yang bertindih antara satu sama lain, dan sistem yang berfungsi dengan baik perlu membaca kesemuanya kemudian menentukan sejauh mana setiap satu boleh dipercayai.

Jalur membawa teks yang dicetak atau ditimbul, biasanya isyarat paling jelas apabila ia boleh dibaca. Pembalut pula mempunyai warna dan tekstur permukaan yang mempersempitkan kumpulan warnanya — daun Connecticut-shade langsung tidak kelihatan seperti maduro gelap berminyak — tetapi banyak warna yang begitu hampir sehingga pencahayaan sahaja boleh menukar klasifikasinya. Tudung dan siluet keseluruhan pula mempersempitkan vitola; parejo bersisi lurus kelihatan berbeza daripada figurado yang meruncing. Dan dimensi, iaitu gaya gelang (ring gauge) serta panjang, mempersempitkan lagi calon dalam kalangan siri yang telah ditunjukkan oleh isyarat-isyarat lain.

Tiada satu pun daripada empat isyarat ini cukup boleh dipercayai untuk digunakan secara bersendirian. Sistem yang berfungsi menjalankan kesemuanya serentak dan membiarkan setiap satu membetulkan yang lain. Apabila orang berkata pengimbas "tersilap," biasanya apa yang berlaku ialah satu isyarat kelihatan kukuh dan yakin — tetapi salah, dan tiada isyarat lain yang menangkap kesilapan itu.

Memadankan dengan katalog sebenar juga merupakan masalah yang berbeza daripada sekadar mengklasifikasikan satu foto secara berasingan. Katalog milik Paradigm sendiri mengandungi 11,519 cerut, dan setiap satu daripada empat isyarat tersebut akhirnya perlu disemak berbanding entri sebenar, bukan sekadar dikenal pasti sebagai "robusto maduro," yang hanya mempersempitkan bidang tanpa mengenal pasti apa-apa secara khusus.

Mengapa teks jalur begitu kerap tersilap?

Teks jalur kelihatan seperti bahagian yang mudah. Selalunya ia tidak semudah itu. Jalur membalut sekeliling bentuk silinder, jadi kamera memotretnya dalam keadaan melengkung, dan pengecaman teks yang kebanyakannya dilatih dengan teks rata berprestasi lebih buruk pada teks melengkung berbanding jangkaan kebanyakan orang. Jalur kerajang pula menambah silauan yang boleh menelan keseluruhan huruf bergantung pada sudut cahaya. Jalur yang pernah berada dalam poket atau beg perjalanan boleh berkedut, tercalar, atau sebahagiannya terkelupas, dan perkataan yang sebahagiannya tersembunyi boleh dibaca sebagai perkataan yang sama sekali berbeza daripada perkataan yang sebenarnya tercetak di situ.

Kemudian terdapat satu masalah yang tiada kaitan dengan kualiti imej: ramai cerut yang namanya memang tidak khusus untuk dibaca. Pendekatan yang hanya bergantung pada jalur untuk pengenalan cerut gagal dengan cara yang agak boleh diramal, dan salah satu sebab terbesarnya ialah sesetengah produk dinamakan dengan perkataan yang begitu umum sehingga walaupun pengekstrakan teks yang sempurna sekalipun tetap tidak memberitahu anda cerut khusus yang mana sedang anda pegang.

Apakah sebenarnya maksud masalah 13.3% nama generik?

Dalam katalog sebanyak 11,519 cerut, 13.3% daripada entri mempunyai nama model yang dibina sepenuhnya daripada perkataan generik, iaitu istilah yang menggambarkan kategori dan bukannya mengenal pasti satu produk tertentu. Pengimbas yang membaca setiap huruf pada jalur itu dengan ketepatan sempurna sekalipun masih tidak mempunyai apa-apa yang khusus untuk dipadankan, kerana perkataan itu sendiri bukan milik satu cerut lebih daripada cerut lain.

Inilah sebabnya teks jalur tidak boleh menjadi keseluruhan sistem walaupun dengan foto yang sempurna. Padanan teks memerlukan sesuatu untuk dipadankan dengannya, dan lebih kurang satu daripada lapan cerut dalam katalog sebenar tidak menyediakan itu.

Mengapa warna pembalut dan bentuk tidak boleh menampung selebihnya?

Pembalut dan bentuk kelihatan seperti sepatutnya lebih mudah, kerana kedua-duanya tidak bergantung pada cetakan yang boleh dibaca. Pada hakikatnya, kedua-duanya sukar dengan cara yang berbeza.

Klasifikasi warna berubah mengikut kelembapan. Minyak naik ke permukaan pembalut dari semasa ke semasa dan mengubah cara cahaya dipantulkan daripadanya, dan sehelai daun yang difoto di bawah cahaya dalaman yang hangat, lebih rendah pada skala suhu warna berbanding cahaya siang, kelihatan beberapa tahap lebih gelap berbanding daun yang sama di luar. Klasifikasi bentuk pula menghadapi masalah bilangan keluarga vitola yang terlalu banyak dan kelihatan hampir sama dari satu sudut sahaja. Terdapat puluhan bentuk dan saiz bernama yang digunakan secara meluas, dan beberapa pasangan antaranya hanya berbeza terutamanya pada sudut keruncingan atau gaya tudung yang ditangkap secara tidak konsisten oleh kamera telefon bergantung pada jarak dan bingkai gambar.

Tiada satu pun daripada ini menjadi alasan untuk mengabaikan isyarat tersebut. Sebaliknya, ia alasan untuk menjangkakan bahawa isyarat itu memerlukan kejuruteraan yang tepat dan khusus, bukan satu pendekatan umum sahaja. Pengelas bentuk tudung milik Paradigm sendiri meningkat daripada ketepatan 78.6% kepada 91.9% pada imbasan pengeluaran sebenar selepas satu pembaikan yang dibina berdasarkan dua ciri khusus yang diukur, bukannya perubahan model secara menyeluruh — bukti bahawa pengecaman bentuk bertindak balas lebih baik terhadap pembetulan yang sempit dan teliti berbanding model yang lebih besar dan umum. Apa yang sebenarnya boleh diberitahu oleh pembalut dan bentuk sebelum anda menyalakan cerut adalah soalan berkaitan tetapi berasingan yang wajar dijawab sendiri.

Bagaimana saya patut menilai dakwaan ketepatan daripada mana-mana aplikasi cerut?

Kebanyakan angka ketepatan yang diterbitkan menggambarkan satu set ujian: kumpulan foto rujukan terpilih yang bersih dan pencahayaannya baik, dipilih kerana ia nampak baik dalam gambar. Angka itu hampir tidak memberitahu anda apa-apa tentang apa yang berlaku apabila anda berdiri di bawah cahaya tidak sekata dengan jalur yang separuh lusuh.

Angka yang lebih berguna ialah yang diukur berdasarkan imbasan pengeluaran sebenar — foto sebenar yang diambil oleh pengguna sebenar dalam keadaan sebenar, bukan penanda aras yang dibina supaya kelihatan baik. Ini adalah kumpulan contoh yang lebih kecil untuk disemak, kerana ia memerlukan sesuatu benar-benar dilancarkan dan diukur kesannya kemudian, bukan sekadar melaporkan satu keputusan makmal sekali sahaja lalu berhenti di situ.

Soalan untuk ditanya Mengapa ia penting
Diukur berdasarkan set ujian, atau imbasan sebenar? Set ujian jauh lebih bersih berbanding keadaan sebenar
Satu isyarat, atau beberapa isyarat digabungkan? Sistem satu isyarat mewarisi corak kegagalan isyarat itu sepenuhnya
Adakah ia menyatakan cara ia mengendalikan jalur yang rosak atau bersilau kerajang? Jika teks jalur menjadi keseluruhan sistem, di sinilah ia gagal
Angka itu bertarikh, atau dakwaan sekali sahaja? Model dan katalog berubah; angka tahun lepas mungkin sudah tidak sah lagi

Jika sesebuah aplikasi tidak dapat menjawab dua soalan pertama, anggap sahaja mana-mana peratusan utama yang didakwa sebagai pemasaran, bukan ukuran sebenar.

Ringkasan ringkas