Qual é o melhor app de charutos para recomendações com IA, e como esses recursos realmente funcionam?
A maioria deles trabalha a partir de duas entradas: o que você disse que gosta e o que você avaliou. Nenhum modelo prova tabaco. Uma função de recomendação pontua os traços descritos dos charutos que você avaliou bem e depois encontra charutos não avaliados com pontuação semelhante. Ela só é tão boa quanto a consistência com que você registra o que gostou, para começar.
Em quais duas entradas uma função de recomendação realmente se baseia?
Duas, e ambas são suas. A primeira é a preferência declarada: aquilo que você informou ao app logo no início, normalmente por alguma versão de um questionário perguntando se você prefere corpos mais encorpados, um determinado tom de capa ou certas regiões. A segunda, e a que mais importa com o tempo, é o seu histórico avaliado: os charutos que você de fato registrou e a nota que deu a cada um.
Nenhuma das duas entradas é exótica. Um questionário é um formulário. Um histórico avaliado é uma lista de linhas em um banco de dados, cada uma marcada com a capa, a origem, a força, o corpo e as notas de sabor do charuto, ao lado do número que você atribuiu. O que as pessoas chamam de "IA" aqui é a etapa seguinte: um processo de pontuação — formalmente, filtragem baseada em conteúdo — que observa os traços associados aos charutos que você avaliou bem e ordena os charutos não avaliados conforme a proximidade desses traços.
Por que o app simplesmente não "sabe" do que você vai gostar?
Porque nada nesse fluxo tem paladar. Não existe modelo sensorial em nenhum ponto da cadeia, nenhum componente que experimente pimenta, cedro ou carvão. O que existe é um banco de dados de etiquetas (tom de capa, país, faixa de força, um punhado de categorias de sabor) e uma função de pontuação que compara a sobreposição de etiquetas entre charutos. Chamar isso de "IA" não é errado, mas induz à imagem errada. Está mais para uma planilha com colunas ponderadas do que para um degustador com opinião própria.
Essa distinção importa porque define o teto honesto do que o recurso consegue fazer. Ele consegue encontrar um charuto cujos traços registrados se parecem com os traços dos charutos que você avaliou bem. Ele não consegue detectar que uma determinada folha teve uma semana ruim, que o seu paladar está num dia ruim ou que uma fábrica mudou o blend desde o último registro feito. Ele está comparando descrições, não provando nada.
Como é, na prática, "comparar características descritas"?
Concretamente: digamos que os seus três registros mais bem avaliados sejam todos puros nicaraguenses encorpados, com capa maduro e notas intensas de cacau e café expresso. O recurso não precisa saber por que você gostou deles. Ele só precisa notar o padrão nas etiquetas (origem, capa, força e as categorias de sabor associadas às suas notas) e sair procurando no restante do catálogo por charutos com a mesma combinação que você ainda não avaliou. Se as suas notas tivessem ido na direção oposta, se você tivesse detestado os três, o mesmo mecanismo sinalizaria essa combinação como algo a evitar.
O lado do sabor só funciona se o vocabulário for fixo. Se um registro chama uma nota de "couro" e outro chama a mesma nota de "pele curtida", a comparação não tem nada consistente para confrontar. É por isso que um vocabulário estruturado importa mais do que parece — é o mesmo problema que o vinho e o uísque resolveram décadas atrás com as rodas de aromas. Como os sabores de charuto são categorizados é, na verdade, uma peça da mesma infraestrutura que torna a comparação possível. O diário do Paradigm, por exemplo, classifica cada nota em uma de seis categorias principais (café, amendoado, doce, madeira e vegetal, natural, ervas e especiarias) exatamente por esse motivo: para que um registro de janeiro e outro de agosto caiam nos mesmos grupos e possam de fato ser comparados.
Onde isso deixa de funcionar?
Quatro limites honestos, em ordem de frequência com que atrapalham:
- Sem dados, sem previsão. Uma conta recém-criada não tem nada com que comparar. As primeiras recomendações se apoiam quase inteiramente nas respostas declaradas do questionário, que são um sinal muito mais fraco do que um histórico avaliado de verdade. Isso melhora quanto mais você registra, não quanto mais você usa o app em geral.
- Vocabulário ruim na entrada, correspondência ruim na saída. Se as suas próprias notas oscilam, com o mesmo sabor registrado com palavras diferentes a cada vez, o recurso está comparando ruído com ruído. Corrigir isso é responsabilidade sua, não do algoritmo.
- As etiquetas do catálogo precisam estar certas. Uma recomendação é tão boa quanto a descrição associada ao charuto recomendado. Um dado errado de capa ou uma etiqueta de sabor faltando produz uma correspondência confiante com o charuto errado.
- Ele reflete o seu histórico, não o seu humor. Um perfil de paladar construído a partir de meses de avaliações ainda é uma média. Ele pode apontar charutos parecidos com aquilo de que você gostou; não tem como saber que hoje à noite você quer especificamente algo mais leve.
Nada disso se resolve com mais "IA". Resolve-se com dados melhores, inseridos de forma mais consistente, ao longo de mais tempo.
Qual é a diferença em relação a uma simples nota em estrelas?
Uma nota em estrelas é uma média da multidão: ela diz o que a maioria das pessoas achou, agregando todos os paladares que enviaram uma avaliação. Uma função de recomendação é personalizada. Ela pergunta se um charuto específico combina com o padrão do seu histórico específico, não se ele é bem visto de modo geral. Um charuto pode ter uma média medíocre e ainda assim ser uma ótima correspondência para um fumante em particular cujas preferências vão na contramão da maioria, e o inverso acontece com a mesma frequência. Como decidir o que fumar em seguida em vez de escolher aleatoriamente trata do processo de decisão mais amplo em que isso se insere; a comparação é uma das entradas dessa decisão, não a decisão inteira.
O que um exemplo concreto de fato calcula?
O veredito Tasting Match do Paradigm é um caso concreto do mecanismo acima, não um mecanismo diferente. Para um determinado charuto, ele pesa a capa, a origem, a força e as etiquetas de sabor registradas do charuto contra um perfil construído a partir dos seus próprios registros avaliados e então devolve um veredito binário, provável que combine com você ou não, verificado contra um catálogo de 11.519 charutos. Ele faz a mesma comparação de etiquetas descrita antes, em escala maior; não há nenhuma etapa separada de simulação de paladar escondida por baixo. O resultado é tão confiável quanto o histórico avaliado que o alimenta, que é a mesma ressalva aplicável a qualquer versão desse recurso em qualquer app.
Se você for avaliar apps com base nisso, a pergunta mais útil não é qual algoritmo é o mais esperto. O mecanismo é basicamente o mesmo em todos. A questão é se o app realmente faz você registrar com consistência suficiente para que esse mecanismo tenha algo real com que trabalhar. O que realmente procurar em um app de diário ou de controle de umidificador é um roteiro melhor para essa decisão do que qualquer comparação recurso a recurso de motores de recomendação. E, se o marketing também chamar o scanner por trás disso de "movido a IA", vale saber que essa afirmação tem seu próprio teto de precisão, tratado em qual é a precisão do reconhecimento de charutos por IA.
Em resumo
- Uma função de recomendação funciona com duas entradas fornecidas por você: preferências declaradas e o seu histórico avaliado. Nada prova tabaco em nenhum ponto do fluxo.
- O mecanismo consiste em comparar etiquetas (capa, origem, força, categoria de sabor) entre os charutos que você avaliou bem e os que você ainda não experimentou, não em previsão sensorial.
- Ele falha silenciosamente em uma conta nova sem histórico e diante de notas inconsistentes, em que o mesmo sabor é registrado com palavras diferentes a cada vez.
- Uma nota em estrelas diz o que a multidão achou. Uma recomendação diz se este charuto combina com o seu padrão específico, o que é uma pergunta diferente com uma resposta diferente.
- O algoritmo por trás de qualquer versão desse recurso é basicamente semelhante; o que de fato varia entre os apps é se eles fazem você registrar o suficiente, com consistência suficiente, para que haja algo real a comparar.