154 | Uma reflexão sobre as publicações científicas e a aderência brasileira ao paradigma da indústria 4.0 A Revista Processando o Saber (eISSN: 2179-5150) é publicada pela FATEC Praia Grande Multidisciplinar - Revisão por pares - Acesso aberto - www.fatecpg.edu.br/revista -
[email protected] eISSN 2179-5150 FATEC Praia Grande • fatecpg.edu.br/revista submetido: Jan/2021 • aceito: Mar/2021 • publicado: Jun/2021 Uma imagem contendo Interface gráfica do usuário Descrição gerada automaticamente Estudo para implementação de software de tradução automática para libras Study for implementing an automatic translation sofware for libras Vanina Carrara Sigrist [email protected] Fatec Rubens Lara Anna Haydée de Lima Siqueira [email protected] Fatec Rubens Lara Danubia Pinheiro Cunha [email protected] Fatec Rubens Lara RESUMO O objetivo deste artigo é identificar como a inteligência artificial junto com o reconhecimento óptico de caracteres (OCR) podem ajudar na tradução de documentos e livros escritos na língua portuguesa para LIBRAS. Por meio de artigos científicos e teses publicados sobre as duas tecnologias analisou-se a possibilidade de aplicação de ambas as tecnologias no processo de tradução, automatizando-a e tornando-a mais acessível para pessoas com deficiência auditiva, independentemente da língua de alfabetização. Para este artigo, realizou-se pesquisa teórica exploratória, com revisão bibliográfica, para entender a aplicação das tecnologias no cenário proposto, elaborando um protótipo tecnológico. Por fim, mediante o que foi evidenciado, chegou-se ao resultado da viabilidade de um aplicativo que utilize módulos separados de OCR e de uma rede neural interligados para realizar a tradução automática. PALAVRAS-CHAVE: Acessibilidade. Inteligência Artificial. Reconhecimento Óptico de Caracteres. Rede neural artificial. Língua brasileira de sinais (LIBRAS). ABSTRACT This article aims to identify how artificial intelligence together with optical character recognition (OCR) can help in the translation of documents and books written in Portuguese into the Brazilian Sign Language. Through scientific articles and theses published on the two technologies, we analyzed the possibility of applying both in the translation process, automating it, and making it more accessible to the people who are Deaf or Hard of Hearing (DHH), whether they are literate in Portuguese or not. For this article, we performed exploratory theoretical research and a bibliographic review to present the application of these technologies in the proposed scenario, elaborating a technological prototype. Finally, based on what has been evidenced, we concluded the feasibility of an application that uses separate modules of OCR and a neural network interconnected to perform automatic translation. KEY-WORDS: Accessibility. Artificial intelligence. Optical character recognition (OCR). Machine translation. Artificial neural network. Brazilian Sign Language.
155 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 INTRODUÇÃO Segundo um estudo feito, em setembro de 2019 no Brasil, pelo Instituto Locomotiva em conjunto com a Semana da Acessibilidade Surda (GANDRA, 2019, s/p), existem 10,7 milhões de pessoas com deficiência auditiva no Brasil. Dentre eles, 2,3 milhões têm deficiência severa e, na sua maioria, são pessoas na faixa etária de 60 anos de idade para cima. Nesse cenário, é importante ressaltar que, mesmo com a Lei Brasileira de Inclusão (nº 13.146, de 6 de julho de 2015), muitos ainda encontram diversas dificuldades no dia a dia, tendo um acesso limitado a oportunidades básicas como trabalho e educação. Ainda de acordo com esse estudo (GANDRA, 2019, s/p), do total de brasileiros com deficiência auditiva, somente 7% deles concluíram o ensino superior; 15% cursaram até o médio completo; 46%, têm fundamental completo; e 32%, sem instrução alguma (Quadro 1). Quadro 1 – Nível de escolaridade entre pessoas com deficiência auditiva no Brasil Nível de Escolaridade Quantidade (%) Ensino superior completo 7 Médio completo 15 Fundamental completo 46 Não possuem nenhuma instrução 32 Fonte: Gandra (2019) No que concerne a legislação vigente, o governo brasileiro, no Decreto Federal N° 5.296, de 2 de dezembro de 2004, definiu deficiência auditiva como a “perda bilateral, parcial ou total, de quarenta e um decibéis (dB) ou mais, aferida por audiograma nas frequências de 500Hz, 1.000Hz, 2.000Hz e 3.000Hz” (Brasil, 2004). E através do Decreto Federal Nº 5.626, de 22 de dezembro de 2005, que: para os fins deste Decreto, considera-se pessoa surda aquela que, por ter perda auditiva, compreende e interage com o mundo por meio de experiências visuais, manifestando sua cultura principalmente pelo uso da Língua Brasileira de Sinais – Libras (Brasil, 2005). O Art. 3º, deste mesmo decreto, tornou também obrigatória a disciplina de LIBRAS como componente curricular para professores em formação (Brasil, 2005). É importante ressaltar que a Língua Brasileira de Sinais foi oficializada no país pela Lei nº 10.436 de 2002 (Brasil, 2002). “Entretanto, a LIBRAS é pouco difundida nas escolas e na sociedade entre as
156 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 pessoas que não possuem deficiência, existindo assim, dificuldade por parte dos surdos de se comunicarem com a maioria da população e vice-versa.” (FURLAN, 2016, p. 33). O Art. 8º do decreto federal de 2004 descreve o conceito de acessibilidade como sendo a [...] condição para utilização, com segurança e autonomia, total ou assistida, dos espaços, mobiliários e equipamentos urbanos, das edificações, dos serviços de transporte e dos dispositivos, sistemas e meios de comunicação e informação, por pessoa portadora de deficiência ou com mobilidade reduzida (BRASIL, 2004). Montardo e Passerino (2007) apud Furlan (2016, p. 34) afirmam que o objetivo da acessibilidade é a “inclusão social, a fim [...] de melhorar qualidade de vida, autonomia financeira, direitos iguais e oportunidades para pessoas ou grupos de pessoas que possuem [...] desvantagem em relação a outros indivíduos”. Furlan também declara que uma das formas de promover a acessibilidade é a tecnologia. Mencionando o Comitê de Ajudas Técnicas da Coordenadoria Nacional para Integração da Pessoa Portadora de Deficiência (Corde), Ribeiro, Matos e Pimentel (2017) definem Tecnologia Assistiva (TA) como [...] uma área do conhecimento, de característica interdisciplinar, que engloba produtos, recursos, metodologias, estratégias, práticas e serviços que objetivam promover a funcionalidade, relacionada à atividade e participação, de pessoas com deficiência, incapacidades ou mobilidade reduzida, visando sua autonomia, independência, qualidade de vida e inclusão social (BRASIL, 2007). Já Santos (2018, p. 52) estabelece o significado de TA como “um termo novo, utilizado para identificar todo o tipo de recursos que, de alguma maneira, contribui para proporcionar vida autônoma ao portador de deficiência”. Além disso, ele cita Sartoretto e Bersch (2017) para explicar que “em seu sentido geral, pode-se entender que todos os artefatos usados por uma pessoa, em seu dia a dia, desde talheres, ferramentas, etc., são objetos de Tecnologia Assistiva”. Tendo em vista esse panorama, para garantir a acessibilidade desses indivíduos, é necessária a criação de uma ou mais tecnologia assistivas. Nesse âmbito, verifica-se a possibilidade de aplicações tecnológicas que consigam traduzir as línguas maternas para a língua brasileira de sinais (LIBRAS), levando em conta as diferenças gramaticais e de semântica existentes entre esta e a língua portuguesa. Na atualidade, já existem aplicativos que funcionam como tradutores, entretanto eles apenas traduzem um texto digitado na hora ou aquele que é ditado por áudio. Esses programas não permitem que um usuário escaneie uma imagem, tirada ou não na hora, e, a partir dela, possa ser feita a tradução do que está escrito nela, opção que é encontrada hoje em dia em
157 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 alguns apps de tradução de línguas naturais para dispositivos móveis, como o Google Tradutor e Naver Papago (tradutor da empresa coreana Naver). Visando essa lacuna, o objetivo deste artigo é identificar como a inteligência artificial junto com o reconhecimento óptico de caracteres (OCR) podem ajudar na tradução de documentos e livros escritos na língua portuguesa para LIBRAS. Apresentar-se-á, então, uma base teórica para analisar a possibilidade da implementação de uma aplicação voltada para a tradução de textos escaneados, com o propósito de aumentar a inclusão de pessoas portadoras de deficiência auditiva, em especial no mercado de trabalho, e, assim, facilitar o manuseio de suas documentações por parte deles. Utilizando o reconhecimento óptico de caracteres, que é uma tecnologia desenvolvida para converter diversos tipos de documentos em dados pesquisáveis e editáveis (VELAZ, 2018), serão reconhecidas as letras e palavras escritas nos papéis escaneados ou imagens. Tendo identificado as informações presentes no texto, através de uma rede neural artificial, ocorrerá a tradução da língua portuguesa para a língua brasileira de sinais, levando em conta as diferenças estruturais entre as duas. Para este artigo, realizou-se uma pesquisa de natureza teórica com revisão bibliográfica com o propósito de analisar as tecnologias citadas acima, buscando demonstrar as aplicações delas por intermédio de artigos científicos e teses com fundamentos similares. Por fim, mediante os resultados encontrados, apresentaram-se maneiras e recursos para viabilizar a geração de um software com a finalidade de tornar mais acessíveis textos impressos para os brasileiros com deficiência auditiva. 1. EMBASAMENTO TEÓRICO Atualmente, existem diversas tecnologias assistivas (TA) no mercado voltadas para pessoas com deficiência auditiva. Em uma pesquisa feita na Google Play Store, com dados até dia 20 de novembro de 2020, encontraram-se diversos aplicativos para a plataforma Android. Dentre eles, foram selecionados apenas três deles com a funcionalidade principal de serem tradutores de texto e áudio para LIBRAS, representando os sinais através de um avatar. São eles:
158 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 • Hand Talk: é uma plataforma que traduz simultaneamente conteúdos em português para a língua brasileira de sinais. Ele possui duas modalidades: o aplicativo para dispositivos móveis e um plugin para que empresas instalem em seus sites tornando-os acessíveis. Possui dois avatares: o Hugo e a Maya. Foi criada por Ronaldo Tenório, Carlos Wanderlan e Thadeu Luz e lançada em julho de 2013; • VLIBRAS: conforme seu site oficial, é o: resultado de uma parceria entre o Ministério da Economia (ME), por meio da Secretaria de Governo Digital (SGD) e a Universidade Federal da Paraíba (UFPB), [...] é um conjunto de ferramentas computacionais de código aberto, que traduz conteúdos digitais (texto, áudio e vídeo) para Língua Brasileira de Sinais - LIBRAS, tornando computadores, celulares e plataformas Web acessíveis para pessoas surdas (VLIBRAS, s/p). • O aplicativo possui dois avatares: o Ícaro e a Hozana. Está disponível também para computadores com sistemas operacionais Windows e Linux e para dispositivos IOS, além de extensões para os navegadores Chrome, Firefox e Safari e como widget para sites; • Rybená: uma TA brasileira desenvolvida por surdos que surgiu de uma parceria entre o Grupo de Usuários Java do Distrito Federal (DFJUG) e o Instituto CTS em 2003. Em seu site oficial é descrito como: uma tecnologia assistiva que traduz textos do português para Libras e Voz. Assim, surdos e pessoas com deficiências intelectuais, disléxicos e outros com dificuldades de leitura podem consumir conteúdos e interagir com diversos sites e plataformas online (RYBENÁ, s/p). Na tela principal dos aplicativos, aparece, em foco, seus respectivos avatares, com ícones que quando clicados é possível digitar em uma caixa ou ditar pelo microfone do celular o texto a ser representado em sinais. Com exceção do Rybená, eles também têm a possibilidade de trocar entre um avatar feminino e masculino, além de uma aba de dicionário, onde são encontrados diversos sinais e seus respectivos significados. No Hand Talk, em especial, existe além disso, uma aba com vídeos ensinando sobre a língua de sinais e uma outra chamada “Loja” onde se tem a possibilidade de trocar as roupas dos avatares Hugo e Maya, sendo algumas grátis e outras pagas através de moedas, que podem ser compradas no app com custo de R$9,90 a R$ 139,90. De acordo com Barbosa (2020, p.92) apud Nilsson (2009), inteligência artificial (IA, ou em inglês AI – artificial intelligence) é conjunto de técnicas para a construção de máquinas inteligentes, capazes de resolver problemas que requerem inteligência humana.
159 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 A autora configura que IA é um campo do conhecimento atualmente bastante explorado pelo cinema e pela literatura, mas ainda pouco conhecido no que se refere à sua gênese (2020, p.92). Para Barbosa (2020), o objetivo da inteligência artificial: é entender e construir sistemas inteligentes, o que representa um elevado impacto em nossa cultura ocidental, uma vez que nela há crenças humanistas e especistas que nos levam a pensar que somos seres superiores e que inteligência e pensamento são dádivas exclusivas à nossa espécie - o que nos diferenciaria e nos torna superiores às demais criaturas (BARBOSA, 2020, p. 93). Já Lobo (2018) define inteligência artificial como um ramo da ciência da computação que se propõe a desenvolver sistemas que simulem a capacidade humana na percepção de um problema, identificando seus componentes e, com isso, resolver problemas e propor/tomar decisões. [...] IA envolve várias etapas ou competências como reconhecer padrões e imagens, entender linguagem aberta escrita e falada, perceber relações e nexos, seguir algoritmos de decisão propostos por especialistas, ser capaz de entender conceitos e não apenas processar dados, adquirir “raciocínios” pela capacidade de integrar novas experiências e, pois, se auto aperfeiçoar (“self learning”), resolvendo problemas, ou realizando tarefas (LOBO, 2018, p. 3). Segundo Barbosa (2020), o marco-zero da inteligência artificial foi o ano de 1956. Ela, então, mencionando Russel e Norvig (2009), explica que nesse ano ocorreu a Conferência do Dartmouth College, em New Hampshire (USA), onde o termo “inteligência artificial” foi registrado pela primeira vez, referindo-se a um novo campo do conhecimento. Barbosa (2020), entretanto, salienta que o desenvolvimento de ideias concernentes a essa área é anterior a 1956, remontando à Segunda Guerra Mundial. Ela relata que: no que se refere à primeira produção bibliográfica correlata ao tema da IA, em 1943 Warren McCulloch e Walter Pitts escreveram um artigo sobre estruturas de raciocínio artificiais em forma de modelo matemático que imitam o sistema nervoso humano. Esse modelo matemático deu base para diversas outras formulações acadêmicas sobre o tema. (BARBOSA, 2020, p. 93). As técnicas de IA necessitam de uma grande quantidade de conhecimentos e de mecanismos de manipulação de símbolos para que os computadores se tornem capazes de pensar e tomar decisões. Eles devem ter a possibilidade de representação, modificação e ampliação de suas capacidades de interpretação e de análise de dados (SANTOS, 2018, p. 52). Voigt (2018) configura que Redes Neurais Artificiais (RNAs, ou em inglês ANNs – Artificial neural networks): são sistemas computacionais vagamente inspirados na estrutura das Redes Neurais Biológicas de animais. Na maioria dos casos é um sistema de aprendizagem supervisionada, capaz de aprender determinada tarefa mesmo sem que sejam programados detalhes específicos referentes à ela (VOIGT, 2018, p. 20).
160 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 Ele continua explicando que: é formada por um conjunto de unidades, representando neurônios, que possuem conexões uns com os outros, representando sinapses. Cada neurônio então recebe um determinado sinal como entrada, efetua um determinado processamento no mesmo, e o repassa para os neurônios adiante (VOIGT, 2018, p. 20). Para Voigt (2018, p. 21), um grande atrativo das Redes Neurais é a capacidade de reduzir problemas não-lineares para outros problemas menores e mais simplificados, e então resolvêlos de forma mais eficiente. O Reconhecimento Óptico de Caracteres ou Optical Charactere Recognition (OCR) é uma metodologia computacional capaz de extrair de forma completamente automática o texto (impresso ou manuscrito) contido em uma imagem digital (OLIVEIRA; PITERI; ARTERO; SILVA; 2014, p. 1). O OCR transforma através da conversão os tipos diferentes de documentos digitalizados em dados pesquisáveis e editáveis (IFRS, 2018, s/p). De acordo com Mithe, Indalkar e Divekar (2013), o reconhecimento óptico de caracteres é uma tecnologia que funciona como a capacidade humana de leitura, mas que ainda não consegue competir com ela. Eles ressaltam também que, o OCR: [...] consegue reconhecer tanto texto escrito a mão quanto impresso. Mas a performance do OCR está diretamente dependente na qualidade de entrada do documento. OCR é designado para processar imagens que consistem quase inteiramente de texto, com pouquíssimo lixo nãotextual obtido de uma imagem capturada por uma câmera móvel. (MITHE; INDALKAR; DIVEKAR, 2013, p. 1, tradução nossa). 1 Conforme relatado por Wanzeller (2018), o OCR: [...] segundo relatos, já existia e era praticado há vários anos; contudo, só se tornou objeto de pesquisas e registros em 1950, quando David Shepard e Louis Tordella pesquisavam uma forma de automatizar dados da Agência de Segurança das Forças Armadas que, em alguns anos, se tornaria a Agência de Segurança Nacional Americana (NSA) (HEITLINGER, 2007, p. 43). Auxiliados por Harvey Cook, Shepard e Tordella criaram o primeiro software de OCR, conhecido como Gismo e, após esse passo inicial, Shepard fundou a IMR, empresa que se tornou pioneira no desenvolvimento de software comercial de OCR (Wanzeller, 2018, p. 15). O termo Optical Character Recognition e a sigla OCR surgiram após a compra da licença da empresa pela IBM em 1953, 3 anos após a criação do primeiro software. ¹ No original: can recognize both handwritten and printed text. But the performance of OCR is directly dependant on quality of input documents. OCR is designed to process images that consist almost entirely of text, with very little non-text clutter obtain from picture captured by mobile camera.
161 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 2. RESULTADOS E DISCUSSÕES Embora existam diversos estudos científicos realizados em reconhecimento óptico de caracteres ou inteligência artificial e seus ramos, em especial redes neurais artificiais, pouquíssimos do que se encontra tive um foco próximo de uma tradução automática de língua de sinais para uma língua natural por meio de um texto. Romero (2017) buscou tratar da extração de texto em imagens complexas de documentos, especificamente os de identificação, com o objetivo de ler e reconhecer o conteúdo deles. O autor descreve que, atualmente, os sistemas de OCR possuem altas taxas de reconhecimento de caracteres (95 a 99%) para as imagens simples caracterizadas como documentos, como um trecho de um artigo ou uma notícia de jornal; porém esses tais sistemas são incapazes de reconhecer em imagens complexas, que em sua maioria, são coloridas e de baixa resolução (Romero, 2017, p. 30). Para o processamento de imagem, Romero (2017, p. 43-44) abordou diversas técnicas, convertendo inicialmente uma imagem colorida para tons de cinza para reduzir a quantidade de informações presentes. Segundo o mesmo estudo, o pré-processamento procura corrigir os defeitos na imagem através de algoritmos eficientes. O autor configura que: as técnicas de melhoria da qualidade de imagens podem ser divididas em duas famílias: as de realce e as de restauração de imagens. Quando a melhoria é usada para combater um processo de degradação conhecido ou avaliado por métodos da teoria da filtragem, a palavra usada é restauração de imagens. A restauração difere de realce pelo fato de que a primeira procura obter a imagem “real” tendo, se possível, um conhecimento a priori da degradação (ROMERO, 2017, p. 44). Ele destaca a técnica MSER (Maximally Stable Extremal Regions – regiões extremas maximamente estáveis) que é usada como um método de detecção de componentes em imagens. O algoritmo é capaz de localizar com precisão texto em diferentes tamanhos, estilos e cores, independente de perspectiva e rotação, portanto, é amplamente usado na localização de texto (Romero, 2017, p. 62-65). Feito o processamento de imagem, entra a etapa de reconhecimento, onde: [...] a ideia principal do OCR é o reconhecimento de um caractere em uma determinada imagem digitalizada. Para isso, as características desse caractere são comparadas com características de padrões de um determinado alfabeto. Após o reconhecimento de cada um dos caracteres, deve-se fazer a associação entre eles com a finalidade de se ter uma sequência de caracteres que tenha algum significado, ou seja, eles devem ser agrupados de modo a formar palavras (ROMERO, 2017, p. 66).
162 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 O autor, então, ressalta a importância de considerar a ocorrência de erros nessa etapa de classificação, sugerindo uma atividade de detecção e correção dos erros. Utilizando vários tipos de imagens e banco de imagens, Romero (2017) testou o sistema proposto. Ele efetuou testes da etapa de seleção, reconhecimento e o sistema geral usando as métricas de revocação e precisão. Os resultados obtidos apontaram alguns erros pelas imagens de texto apresentarem uma grande diversidade de fontes, estilos, tamanhos e orientações. Entretanto, os algoritmos propostos pelo autor tiveram resultados satisfatórios nas métricas empregadas, apresentando, no sistema geral, uma precisão de 89%. Romero (2017, p. 135) conclui que o algoritmo é bastante robusto, tendo selecionado 84% do texto existente nas imagens na etapa de seleção, no qual 94% são corretamente classificados. E na etapa de reconhecimento, reconheceu 88% do texto existente nas imagens, onde foi classificado corretamente 96% deles. Para a tradução de língua natural textual para língua de sinais brasileira, analisou-se o trabalho de conclusão de curso no qual Gaio (2020) realizou o processo inverso, utilizando uma luva sensorial para reconhecer os sinais efetuados por seu usuário. O autor estudou LIBRAS profundamente para poder buscar as alternativas que contemplassem as suas características morfológicas. Conforme cita seu estudo: [...] como LIBRAS não é composta apenas por sinais de mão, para aumentar a compatibilidade de um tradutor com a língua em questão, notou-se a necessidade de um sistema de reconhecimento facial em conjunto com um reconhecimento dos referidos gestos (GAIO, 2020, p. 45). Para a programação do sistema, como o aprendizado por máquina é dependente de dados, o autor (2020, p. 45) buscou por datasets, que são conjuntos de dados mais específicos, que melhor representassem as expressões faciais e a composição de sinais com as mãos de LIBRAS. Obtido os dados, Gaio (2020) explicou que: [...] foi necessário criar um modelo com base nos dados obtidos, para então executar uma aplicação que, em tempo real, classificasse os movimentos executados pelo usuário que utiliza a luva. Foi feita uma sequência de testes, com diferentes algoritmos de aprendizado de máquina, e, em seguida, executado o “ajuste fino” de parâmetros para cada um deles. [...] Posteriormente, foi selecionado o modelo que tivesse o melhor desempenho dentre os testados (GAIO, 2020, p. 59).
169 | Estudo para implementação de software de tradução automática para libras Revista Processando o Saber - v.13 - p. 154-169 - 2021 W3C. World Wide Web Consortium. 2021. Disponível em: https://www.w3.org/. Acesso em: 27 mar. 2021. WANZELLER, Moisés Monteiro Pacheco. Tecnologias de apoio à tradução: tutorial de OCR. 2018.