scieee AI-readable full text Open interactive document viewer

Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo

Souza, Luiz Sérgio; Silva, Leticia Kimberly Borges; Gonçalves, Neidina Naara Souza

Abstract

A crescente produção e disseminação de conteúdos em mídias digitais trazem novos desafios para a avaliação da confiabilidade da informação. Diante da diversidade de opiniões e da possibilidade de manipulação discursiva , torna-se necessário desenvolver modelos computacionais capazes de analisar textos de forma escalável, transparente e sensível à ambiguidade. Este trabalho apresenta uma Revisão de Escopo da Literatura sobre a integração entre Processamento de Linguagem Natural (PLN), preditores linguísticos e Lógica Fuzzy como ferramentas para inferência automatizada da confiabilidade textual. Foram analisados estudos publicados entre 2019 e 2024, oriundos de bases de dados como Web of Science, IEEE Xplore, ACM Digital Library, SpringerLink, dentre outras. Os resultados apontam uma predominância da polaridade como principal preditor linguístico utilizado, seguida pela subjetividade. A extensão textual não apareceu em nenhum dos estudos, o que pode indicar uma lacuna a ser explorada. Verificou-se ainda que a combinação entre Processamento de Linguagem Natural (PLN) e Lógica Fuzzy vem se consolidando como uma abordagem promissora para lidar com a subjetividade e a incerteza inerentes à linguagem natural, sobretudo em domínios como redes sociais, e-commerce, saúde e mídias digitais. Versão publicada na Revista Processando o Saber:https://revistamd.fateccarapicuiba.pagework.com.br/index.php/md/article/view/18

Full text

A Revista Mídia e Design (eISSN 2965-6826) é publicada pela Fatec Carapicuíba Revisão por pares • Acesso aberto • revistamd.fateccarapicuiba.edu.br • rev[email protected] eISSN 2965-6826 Fatec Carapicuíba • revistamd.fateccarapicuiba.edu.br submetido: Jun/2025 • aceito: Set/2025 • publicado: Dez/2025 Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Sentiment analysis of digital content and textual reliability using fuzzy logic: a scope review Luiz Sérgio Souza [email protected] Fatec Carapicuíba Leticia Kimberly Borges Silva [email protected] Fatec Carapicuíba Neidina Naara Souza Gonçalves neidina.goncalv[email protected].gov.br Fatec Carapicuíba RESUMO A crescente produção e disseminação de conteúdos em mídias digitais trazem novos desafios para a avaliação da confiabilidade da informação. Diante da diversidade de opiniões e da possibilidade de manipulação discursiva 1 , torna-se necessário desenvolver modelos computacionais capazes de analisar textos de forma escalável, transparente e sensível à ambiguidade. Este trabalho apresenta uma Revisão de Escopo da Literatura sobre a integração entre Processamento de Linguagem Natural (PLN), preditores linguísticos e Lógica Fuzzy como ferramentas para inferência automatizada da confiabilidade textual. Foram analisados estudos publicados entre 2019 e 2024, oriundos de bases de dados como Web of Science, IEEE Xplore, ACM Digital Library, SpringerLink, dentre outras. Os resultados apontam uma predominância da polaridade como principal preditor linguístico utilizado, seguida pela subjetividade. A extensão textual não apareceu em nenhum dos estudos, o que pode indicar uma lacuna a ser explorada. Verificou-se ainda que a combinação entre Processamento de Linguagem Natural (PLN) e Lógica Fuzzy vem se consolidando como uma abordagem promissora para lidar com a subjetividade e a incerteza inerentes à linguagem natural, sobretudo em domínios como redes sociais, e-commerce, saúde e mídias digitais. PALAVRAS-CHAVE: Processamento de Linguagem Natural, Lógica Fuzzy, Preditores Linguísticos, Confiabilidade Textual, Revisão de Escopo 1 O termo “manipulação discursiva” é empregado neste estudo no sentido técnico da Análise do Discurso, referindo-se ao uso estratégico da linguagem com vistas a induzir interpretações distorcidas ou a instrumentalizar sentidos em contextos comunicacionais específicos. Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 18 ABSTRACT The increasing production and dissemination of content in digital media pose new challenges for assessing information reliability. Given the diversity of opinions and the potential for discursive manipulation 1 , it becomes essential to develop computational models capable of analyzing texts in a scalable, transparent, and ambiguity-aware manner. This study presents a Scoping Review of the literature on the integration of Natural Language Processing (NLP), linguistic predictors, and Fuzzy Logic as tools for the automated inference of textual reliability. Publications from 2019 to 2024 were analyzed, retrieved from databases such as Web of Science, IEEE Xplore, ACM Digital Library, and SpringerLink, among others. The results indicate a predominance of polarity as the primary linguistic predictor, followed by subjectivity, whereas text length was absent from all studies, suggesting a potential research gap. Furthermore, the combination of NLP and Fuzzy Logic has been consolidating as a promising approach to address the subjectivity and uncertainty inherent to natural language, especially in domains such as social networks, e-commerce, healthcare, and digital media. KEY-WORDS: Natural Language Processing, Fuzzy Logic, linguistic predictors, textual reliability, scoping review. INTRODUÇÃO A Análise de Sentimento (doravante AS) é um ramo do Processamento de Linguagem Natural (PLN) voltado à identificação, classificação e quantificação de emoções expressas em textos. Geralmente, essa análise é realizada em escalas como positiva, negativa ou neutra, podendo também incluir classificações mais refinadas, como intensidade emocional e tipo de emoção predominante (LIU, 2012). As primeiras aplicações de AS utilizavam abordagens baseadas em léxicos, como o SentiWordNet, em combinação com regras linguísticas fixas. Embora simples e interpretáveis, essas aplicações apresentam limitações diante de aspectos como ironia, negação, ambiguidade e polissemia. Contudo, essas lacunas começam a ser contornadas com a introdução de Modelos de Linguagem (LLM - Large Language Model) baseados em arquiteturas de Transformers, como o BERT (DEVLIN et al., 2019) e o RoBERTa (LIU et al., 2019), que permitem uma representação contextualizada das palavras. No contexto da língua portuguesa, o modelo BERTimbau demonstra ser eficaz ao lidar com variações morfossintáticas, gírias e expressões idiomáticas (SOUZA et al., 2020). Em pesquisas voltadas à avaliação da credibilidade de conteúdo, a AS tem sido utilizada para detectar carga emocional excessiva, traço frequentemente associado à desinformação. 1 “Discursive manipulation” is used here in its technical sense from Discourse Analysis, referring to strategic uses of language aimed at inducing distorted interpretations or instrumentalizing meaning within specific communicative contexts Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 19 Estudos como o de Da Silva et al. (2020) revelam que títulos com forte carga negativa e linguagem sensacionalista aumentam a probabilidade de um texto ser classificado como não confiável. De modo semelhante, Xu e Kechadi (2023) analisaram postagens em redes sociais sobre saúde e verificaram que postagens com forte carga emocional, linguagem ambígua e polaridade negativa tendem a ser percebidas como menos confiáveis. É importante destacar, no entanto, que emoção e subjetividade não implicam necessariamente em uma informação não confiável. Como observam Xu e Kechadi (2023), conteúdos autênticos, como notícias sobre tragédias, naturalmente expressam sentimento de tristeza, choque ou indignação. O verdadeiro desafio, portanto, está em contextualizar o sentimento expresso com o tipo de conteúdo e sua finalidade para então determinar a confiabilidade. De fato, a confiabilidade textual emerge como um componente estratégico em movimentos voltados ao combate à desinformação e à promoção de uma comunicação digital mais transparente e ética. O crescente volume de dados oriundos de diferentes ambientes digitais, torna inviável a análise manual da confiabilidade, exigindo soluções escaláveis, interpretáveis e baseadas em inteligência computacional, como destacam Xu e Kechadi (2023). Nesse cenário, a combinação entre PLN e lógica fuzzy apresenta-se como uma abordagem promissora. Por meio da extração de preditores linguísticos, é possível alimentar modelos computacionais capazes de simular inferências humanas de maneira gradual e transparente. A lógica fuzzy complementa esse processo ao permitir que essas variáveis linguísticas sejam tratadas em termos de graus de verdade, o que é especialmente útil para lidar com a imprecisão e a ambiguidade presentes na linguagem cotidiana (OLIVEIRA; COSTA; RODRIGUES, 2020). Diante disso, esta Revisão de Escopo (doravante RE) propõe-se a compreender como a literatura científica tem respondido ao desafio da confiabilidade informacional, buscando mapear e discutir as principais propostas científicas que integram PLN, preditores linguísticos e lógica fuzzy na inferência automatizada da confiabilidade de conteúdos digitais. A Revisão de Escopo mostra-se adequada por seu caráter exploratório, voltado a mapear e organizar a produção científica sem a exigência de avaliação formal da qualidade dos estudos envolvidos, diferindo assim de uma Revisão Sistemática da Literatura (doravantee RSL), que busca responder a questões específicas com síntese de evidências, bastante comuns nas áreas médicas e de saúde, por exemplo. Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 20 1. FUNDAMENTAÇÃO TEÓRICA Nesta seção são apresentados os fundamentos conceituais que embasam o presente estudo. Primeiro, apresenta-se o Processamento de Linguagem Natural (PLN) como base para a análise de textos digitais. Na sequência, são explorados elementos da Análise de Sentimentos, especialmente os preditores linguísticos mais recorrentes, como polaridade, subjetividade e extensão textual. Por fim, se discute a Lógica Fuzzy, utilizada para lidar com ambiguidades e incertezas na interpretação de informações. 1.1 PROCESSAMENTO DE LINGUAGEM NATURAL (PLN) O Processamento de Linguagem Natural (PLN) é uma subárea da Inteligência Artificial (IA) voltada ao estudo de métodos computacionais que permitem interpretar e processar automaticamente a linguagem usada por pessoas. Seu objetivo é capacitar máquinas a compreender, interpretar, gerar e manipular textos e discursos 2 de forma semelhante à comunicação entre seres humanos. Por ser um campo altamente interdisciplinar, o PLN incorpora fundamentos de linguística, ciência da computação, estatística e aprendizado de máquina (JURAFSKY; MARTIN, 2025). No cenário da confiabilidade de conteúdos digitais, o PLN tem sido fundamental para extrair informações linguísticas que indicam o grau de veracidade ou manipulação de um texto. Técnicas de PLN são empregadas para identificar padrões de escrita associados à linguagem enganosa, sensacionalista ou com muita emoção, aspectos frequentemente presentes em desinformações. Como destacam Souza et al. (2020), Da Silva et al. (2020) e Liu et al. (2022), a aplicação do PLN permite construir modelos preditivos a partir de características textuais observáveis, automatizando o processo de avaliação de confiabilidade. 2 Neste estudo, o termo “discursos” é empregado no sentido teórico da Análise do Discurso, referindo-se a enunciados historicamente situados, marcados por intencionalidades, posições ideológicas e pertencimento a gêneros discursivos (BAKHTIN, 1997) Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 21 1.2 PREDITORES LINGUÍSTICOS Ferramentas como VADER, TextBlob, SentiWordNet e spaCy (SILVA, OLIVEIRA E JORGE, 2021) têm sido amplamente utilizadas para extrair variáveis como polaridade 3 , subjetividade e extensão textual em diferentes idiomas. No português, modelos baseados em redes neurais pré-treinadas, como o BERTimbau (SOUZA et al., 2020), têm ganhado espaço por sua precisão em tarefas mais sensíveis ao contexto. Ainda assim, a implementação da AS em sistemas reais enfrenta obstáculos importantes, como a dificuldade de detectar ironia, a ambiguidade cultural de expressões idiomáticas e a necessidade de especialização em domínios específicos, como o médico ou o jurídico. Segundo Silva, Oliveira e Jorge (2021), essas limitações impactam diretamente a acurácia e a aplicabilidade dos modelos em contextos reais. 1.3 LÓGICA FUZZY A Lógica Fuzzy, proposta por Lotfi Zadeh em 1965, é uma abordagem matemática voltada ao tratamento da incerteza e da subjetividade, sendo eficaz em contextos em que as categorias tradicionais do verdadeiro ou falso não são suficientes. Diferente da lógica clássica binária, que opera com valores absolutos (0 ou 1), ela admite valores intermediários que representam graus de verdade, permitindo uma modelagem mais flexível de situações ambíguas, algo comum em textos produzidos em linguagem natural (FERNANDEZPERALTA; PÉREZ-RODRÍGUEZ e TRILLAS, 2025). Essa flexibilidade torna a Lógica Fuzzy especialmente útil na análise linguística automatizada, permitindo interpretar variáveis qualitativas como tom negativo moderado ou comentário parcialmente confiável de forma gradual. Tais capacidades são valiosas na avaliação de conteúdos digitais, onde elementos como carga emocional, organização das sentenças e expressões ambíguas desafiam modelos de inferência tradicionais (OLIVEIRA, COSTA e RODRIGUES, 2020). 3 No contexto do Processamento de Linguagem Natural (PLN), polaridade refere-se à orientação afetiva ou avaliativa de um texto ou expressão, geralmente classificada como positiva, negativa ou neutra. É um dos principais indicadores utilizados na Análise de Sentimento para mensurar a valência emocional de enunciados. Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 22 2. MATERIAIS E MÉTODOS A presente Revisão de Escopo (RE) foi conduzida com base na metodologia proposta por Arksey e O’Malley (2005), posteriormente aprimorada por Levac, Colquhoun e O’Brien (2010) e sistematizada de acordo com o protocolo PRISMA-ScR (Preferred Reporting Items for Systematic Reviews and Meta-Analyses extension for Scoping Reviews), conforme estabelecido por Tricco et al. (2018). Tal abordagem metodológica é amplamente reconhecida por sua robustez na identificação, mapeamento e categorização de evidências científicas, além de sua capacidade de revelar lacunas de conhecimento, sobretudo em áreas emergentes ou de natureza interdisciplinar. O modelo estruturado em cinco estágios proposto por Arksey e O'Malley — (i) identificação das questões de pesquisa, (ii) identificação de estudos relevantes, (iii) seleção dos estudos, (iv) mapeamento e extração dos dados, e (v) colação, sumarização e relato dos resultados — foi complementado pelas recomendações de Levac et al., que enfatizam a necessidade de maior rigor na definição dos critérios de elegibilidade, na análise qualitativa e na incorporação de consultas a especialistas como etapa opcional. 2.1 QUESTÕES DE PESQUISA As Questões de Pesquisa (QP) que delimitam essa RE são: • QP1: Como os principais preditores linguísticos são utilizados para inferir a confiabilidade informacional? • QP2: Qual o papel da Lógica Fuzzy na análise de confiabilidade? • QP3: Em quais domínios a análise de confiabilidade informacional é aplicada? 2.2 ESTRATÉGIA DE BUSCA A busca foi realizada nas bases Scopus, Web of Science, IEEE Xplore, ACM Digital Library, SpringerLink, ScienceDirect, SciELO e PubMed, com base na seguinte string de busca: { ("trustworthiness" OR "credibility" OR "reliability") AND ("text length" OR "subjectivity" OR "polarity") AND ("fuzzy logic") } Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 23 A string de busca é o instrumento operacional que traduz as questões de pesquisa em combinações de descritores, sinônimos e operadores booleanos 4 . Seu papel é ampliar o alcance da revisão para garantir exaustividade e reprodutibilidade. • Ela deve ser suficientemente sensível para capturar um número amplo de estudos relevantes. • Porém, por si só, não assegura a pertinência dos resultados, já que pode trazer também trabalhos marginais ou não pertinentes. 2.3 CRITÉRIOS DE INCLUSÃO Os critérios de inclusão funcionam como condições necessárias para que um artigo seja considerado pertinente à revisão. Nessa RE considera-se: • Estudos entre 2019 e 2025 [ AND ] • Publicações revisadas por pares [ AND ] • Estudos primários. 2.4 CRITÉRIOS DE EXCLUSÃO Os critérios de exclusão funcionam como restrições adicionais que eliminam estudos que, mesmo aparecendo na busca e atendendo parcialmente ao escopo, não contribuem para os objetivos da RE. Os critérios de exclusão demandam um segundo nível de refinamento, por isso são aplicados tanto na leitura de resumos quanto, principalmente, na leitura completa dos artigos selecionados nas buscas. São condições de corte nessa RE: • Trabalhos duplicados [ OR ] • Estudos que abordam tangencialmente o tema da confiabilidade textual [ OR ] • Publicações cujo texto completo não está disponível ou acessível. 4 Operadores booleanos (como AND, OR e NOT) são palavras-chave utilizadas em buscas acadêmicas para combinar ou excluir termos, refinando os resultados. Por exemplo, “PLN AND confiabilidade” retorna estudos que contêm ambos os termos; “polaridade OR subjetividade” inclui trabalhos que abordam pelo menos um deles; e “desinformação NOT política” exclui resultados relacionados a política. Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 24 3. RESULTADOS E DISCUSSÃO A busca foi realizada nas bases de dados (Scopus, Web of Science, IEEE Xplore, ACM Digital Library e ScienceDirect) utilizando as palavras-chave definidas na Seção 3.2, priorizando termos relacionados à confiabilidade de conteúdos digitais, preditores linguísticos e lógica fuzzy. Como resultado dessa busca inicial, foram identificados 37 estudos. A etapa seguinte consistiu na leitura dos títulos e resumos dos artigos selecionados na etapa de busca anterior, com o objetivo de verificar se atendiam aos critérios de inclusão, resultando na seleção de 24 artigos. Concomitantemente, foram aplicados os critérios de exclusão definidos na seção 3.4. Durante essa etapa, observou-se que alguns trabalhos, embora abordassem temas próximos, não tratavam especificamente do uso de preditores linguísticos, aplicados à inferência da confiabilidade de postagens e comentários em ambientes digitais. Também foram desconsiderados os estudos que não abordaram de forma robusta técnicas de modelagem da incerteza, como a lógica fuzzy e trabalhos sem texto completo disponível. A aplicação dos critérios de inclusão e de exclusão resultou em 10 artigos completos e acessíveis. As informações extraídas desses estudos estão sintetizadas na Tabela 1, destacando os métodos utilizados, os dados analisados, os resultados obtidos e os preditores linguísticos operacionalizados. Tabela 1 – Estudos selecionado e suas principais características Artigo Preditores Linguísticos Abordagem Aplicação SAIF et al. (2019) Polaridade Fuzzy Redes sociais AMBREEN et al. (2024) Polaridade e Subjetividade Híbrida (RNA + Fuzzy) Textos em árabe ES-SABERY et al. (2024) Polaridade Híbrida (Árvores de Decisão + Fuzzy) Saúde pública / Redes sociais VASHISHTHA e SUSAN (2022) Polaridade e Subjetividade Híbrida (RNA + Fuzzy) Redes sociais OLIVEIRA, COSTA e RODRIGUES (2020) Polaridade e Subjetividade Fuzzy Redes sociais XU e KECHADI (2023) Polaridade Híbrida (LLM + Fuzzy) Redes sociais REDA & ZELLOU (2023) Polaridade e Subjetividade Fuzzy Redes sociais GUTIÉRREZ-BATISTA et al. (2021) Polaridade Fuzzy Redes sociais SMITH e DOE (2023) Polaridade e Subjetividade Fuzzy Saúde pública WANG et al. (2024) Polaridade Híbrida (PLN + Fuzzy) E-commerce Fonte: Elaborada pelos autores. Análise de sentimento em conteúdos digitais e confiabilidade textual utilizando lógica fuzzy: uma revisão de escopo Revista Mídia e Design - v. 03 - p. 17-31 - 2025 25 Conforme indicado na Tabela 1, no que se refere à QP1, observa-se que a polaridade é um preditor recorrente nos estudos analisados, seguida pela subjetividade, em geral utilizada de forma complementar nos modelos. Metade dos estudos considerou dois preditores simultaneamente, evidenciando uma oportunidade de aprofundamento neste aspecto. Já a extensão textual não foi abordada em nenhum dos estudos selecionados. Em se tratando da QP2, a análise dos artigos revela a aplicação frequente da lógica fuzzy como mecanismo de inferência interpretável. No âmbito da QP3, pode-se afirmar que o domínio das redes sociais é prevalente nos estudos selecionados. 3.1 CORPUS FINAL • SAIF et al. (2019) propõem um modelo não supervisionado baseado em lógica fuzzy, aplicando regras do tipo Mamdani à análise de sentimentos em postagens de redes sociais. A abordagem utiliza múltiplos léxicos de polaridade (SentiWordNet, AFINN e VADER) para classificar sentimentos em categorias positivas, negativas e neutras. Os autores destacam a capacidade interpretável e adaptável do modelo em diferentes conjuntos de dados, evidenciando a aplicabilidade em ambientes como o Twitter. • AMBREEN et al. (2024) apresentam uma abordagem híbrida que integra redes neurais profundas (Bi-LSTM com mecanismo de atenção) a um sistema fuzzy de inferência para análise de sentimentos em textos em árabe. A polaridade e a subjetividade são utilizadas como variáveis linguísticas principais. Os resultados indicam melhora significativa na acurácia e na capacidade de generalização, especialmente na presença de ambiguidade semântica. • ES-SABERY et al. (2024) propõem um classificador de sentimentos escalável, desenvolvido em ambiente Hadoop, que combina CNN com lógica fuzzy e árvore de decisão C4.5. Aplicado a tweets relacionados à COVID-19, o modelo apresentou resultados robustos, demonstrando capacidade de lidar com incertezas linguísticas em grandes volumes de dados, por meio da fusão entre aprendizado profundo e regras fuzzy.