Creación de una base de datos bilingüe (inglés-español) para la asignatura de ciencias de la educación primaria
Abstract
Universidad de Granada. Grado en Traducción e Interpretación. Curso académico 2022/2023
Full text
! ! ! Presentado por: D. Federico Ortega Riba Tutor: Dra. Míriam Buendía Castro Curso académico 2022/2023 CREACIÓN DE UNA BASE DE DATOS BILINGÜE (INGLÉS-ESPAÑOL) PARA LA ASIGNATURA DE CIENCIAS DE LA EDUCACIÓN PRIMARIA Facultad de Traducción e Interpretación ! GRADO EN TRADUCCIÓN E INTERPRETACIÓN! TRABAJO FIN DE GRADO TÍTULO DEL TRABAJO
2
3 ÍNDICE DE CONTENIDOS ABSTRACT .................................................................................................................................. 4 RESUMEN .................................................................................................................................... 5 1. INTRODUCCIÓN .............................................................................................................. 6 2. ESTADO DE LA CUESTIÓN ........................................................................................... 7 2.1. EL DISCURSO GENERAL Y EL ESPECIALIZADO: EL CASO DE LA EDUCACIÓN PRIMARIA 7 2.2. RECURSOS TERMINOGRÁFICOS ESPECIALIZADOS EN ESPAÑA .................................... 11 2.3. COMPETENCIAS LINGÜÍSTICAS Y DIGITALES EN EDUCACIÓN PRIMARIA .................... 13 3. METODOLOGÍA ............................................................................................................. 14 4. ANÁLISIS DE LOS CORPUS CON SKETCH ENGINE Y EXCEL .......................... 16 5. RESULTADOS ................................................................................................................. 19 6. CREACIÓN DE LA BASE DE DATOS Y PROPUESTA DE ENTRADA ................ 20 7. CONCLUSIONES............................................................................................................. 25 8. BIBLIOGRAFÍA............................................................................................................... 26
4 Abstract Terminographic resources in Spain such as databases, glossaries or multilingual dictionaries created by Royal Academies or other organizations are designed by specialists and aimed at experts. With regard to education, the Ministry of Education and Vocational Training proposes to consolidate multilingual and technological skills at the end of Primary Education, and to promote open educational resources. Nevertheless, there is currently a lack of linguistic infrastructures for students enrolled in bilingual subjects (Spanish-English) at this stage. The aim of this work is to compile a corpus to serve as a basis for analyzing the most frequent monolexical and polylexical units in the subdomains of Natural Science. Based on the results, we present the creation of a database which meets the terminological needs of students between the ages of six and twelve. This resource is proposed as a future reference work for teachers and students of Primary Education. Keywords: terminology, corpus linguistics, linguistic analysis, terminographic resource, Natural Science, Primary Education
5 Resumen Los recursos terminográficos en España como bases de datos, glosarios o diccionarios multilingües creados por Reales Academias u otros organismos están diseñados por especialistas y dirigidos a expertos. En lo que respecta a la enseñanza, el Ministerio de Educación y Formación Profesional propone consolidar las competencias plurilingües y tecnológicas al acabar la Educación Primaria y promover los recursos educativos abiertos. Sin embargo, en la actualidad no existen infraestructuras lingüísticas para estudiantes de esta etapa que cursen asignaturas en modalidad bilingüe (español-inglés). Mediante esta trabajo, se pretende compilar un corpus que sirva de base para analizar las unidades monoléxicas y poliléxicas más frecuentes en los subdominios de Ciencias de la Naturaleza. Partiendo de los resultados, se propone la creación de una base de datos que se ajuste a las necesidades terminológicas del estudiantado de entre seis y doce años. Este recurso se plantea como una futura obra de referencia para docentes y alumnos de Educación Primaria. Palabras clave: terminología, lingüística de corpus, análisis lingüístico, recurso terminográfico, Ciencias de la Naturaleza, Educación Primaria
6 1. Introducción Los recursos terminográficos son herramientas que nos permiten homogeneizar el conocimiento lingüístico y resolver problemas relacionados con la terminología, como contextos de uso o colocaciones. Asimismo, son utilizados en la enseñanza de idiomas en forma de obras de consulta (base de datos, diccionarios o glosarios). Para crear y ampliar recursos terminográficos de calidad, es necesario poseer conocimientos especializados en dos ámbitos: lingüística y tecnología. Las humanidades digitales y la lingüística computacional nos permiten llevar a cabo tareas específicas en el ámbito del procesamiento del lenguaje natural mediante programas como Sketch Engine (Kilgarriff et al. 2004), mientras que otras aplicaciones están diseñadas para trabajar con datos que, de otra forma, programas como Sketch Engine no nos permitirían, sobre todo en lo referente a análisis estadísticos. Es el caso de las funciones de Excel (Microsoft Corporation, 2018) o las de Python (Van Rossum y Drake, 2009). En lo que respecta a de bases de datos lingüísticas, el punto de partida es el corpus. El Diccionario de la lengua española de la RAE define corpus como «conjunto lo más extenso y ordenado posible de datos o textos científicos, literarios, etc., que pueden servir de base a una investigación» 1 , mientras que John Sinclair (1991, p. 171), el padre de la lingüística de corpus, sostiene que «a corpus is a collection of naturally-occurring language text, chosen to characterize a state or variety of a language». La lingüística de corpus clasifica estos conjuntos ateniéndose a diversos parámetros como su objetivo, accesibilidad o formato; si bien este último punto es cada vez menos relevante, ya que encontraríamos limitaciones para acceder a ellos de otra forma que no fuese la digital. Además de esta clasificación, las características de los corpus los diferencian en anotados (etiquetas morfológicas, sintácticas, etc.), de referencia (recogen la lengua general), de aprendices de segundas lenguas extranjeras, entre otras categorías. Desde el punto de vista de un traductor, la importancia del corpus reside en el idioma o idiomas en los que se configure, así como su acceso. Este trabajo está centrado en la creación de corpus monolingües, comparables y escritos, que son las características básicas de los corpus compilados para la creación de la base de datos. En primer lugar, se establece que son monolingües porque han sido compilados individualmente en inglés y 1 Real Academia Española. (s.f.). Corpus. En Diccionario de la lengua española. Recuperado el 26 de mayo de 2023, de https://dle.rae.es/corpus
7 español. En segundo lugar, son escritos, a diferencia de los orales. En última instancia, son comparables. Peters et al. (1996) define los corpus comparables como: Un conjunto de textos en más de una lengua que, sin ser traducciones, por coincidir en el tema y en la función comunicativa proporcionan una excelente base para la comparación de dos o más lenguas. (citado en López Rodríguez, 2001, p. 175) Las ventajas de la creación y utilización de corpus para traductores se resumen en los siguientes puntos, como sostiene Bowker (2002): extracción de frecuencias de palabras para saber el uso de una unidad y contextos de uso sobre cómo se expresa una unidad en la lengua de estudio. A partir del conocimiento que nos proporciona el análisis de corpus, podemos crear herramientas representativas que sirvan como obra de referencia a un público concreto. En los siguientes apartados de este Trabajo de Fin de Grado, se exponen las bases teórico-prácticas que se deben consolidar para que el desarrollo y análisis de un corpus sean óptimos. Una vez definidas, se propone la creación de una base de datos bilingüe (español-inglés) para la asignatura Ciencias de la Naturaleza de Educación Primaria a partir de los corpus compilados. 2. Estado de la cuestión 2.1. El discurso general y el especializado: el caso de la Educación Primaria Uno de los principales problemas que conlleva la creación de diccionarios, sobre todo aquellos enfocados al estudiantado de entre seis y doce años, es la dicotomía entre discurso general y especializado, entre término y palabra. Si estudiamos el enfoque normalizador de la terminología, de acuerdo con la norma ISO 1087 Terminology work and terminology science – Vocabulary (2019) el término es «a designation that represents a general concept by linguistic means». Del mismo modo, se explicita que puede consistir en una o más palabras. Aunque este organismo de estandarización sea reconocido de manera internacional, la definición no es suficientemente limitante y nos lleva a preguntarnos cuáles son las diferencias entre el discurso general y el especializado. A esta problemática le sumamos otra: a la hora de extraer las palabras cuyas frecuencias son más elevadas en un corpus, las herramientas informáticas solo nos devuelven las unidades monoléxicas y poliléxicas más empleadas en un campo de especialidad. No obstante, cuando se analiza un corpus con información destinada a estudiantes de primaria, encontraremos entre las frecuencias más altas palabras que a primera vista no pasarían por discurso especializado.
8 Los lenguajes de especialidad se entienden como lenguas naturales que sirven como instrumento para compartir conocimiento especializado. En el proceso de la comunicación entre especialistas, Jakobson (1963) enumera factores como el emisor, el canal, el código, el receptor, el mensaje y el referente. Mientras que el discurso general, ya sea oral u escrito, se define como aquel usado en la vida cotidiana para producir una reacción en el receptor (Alcaraz y Martínez, 1997). El discurso general también se caracteriza por ser propio de una comunidad lingüística determinada. Sus rasgos están delimitados por su contexto cotidiano, lo que lleva a una variación a nivel dialectal, en geolecto, sociolecto y cronolecto, y funcional, que se manifiesta en: discurso normalmente oral, temática no especializada, tenor referencial y registro informal con bajo grado de abstracción. A diferencia del lenguaje general, el especializado trata temáticas, ámbitos y experiencias especializadas, no son fenómenos aislados y también mantiene el tenor referencial (Cabré, 1993, p. 135). Desde el punto de vista de la traducción, el discurso especializado destaca por su idiosincrasia léxica sin estar separado del lenguaje general, es decir, se puede entender como un subconjunto de este, usado por especialistas que comparten códigos y tenor. Sager (1990, p. 18) afirma: «the linguistic subsystem selected by an individual whose discourse is to be centred on a particular subfield». Además, dentro del propio discurso especializado pueden desarrollarse otros subdiscursos especializados según el conocimiento de la materia entre los interlocutores. No es lo mismo el nivel de lengua de dos oncólogos que están al mismo nivel, al de un oncólogo y un niño de doce años. Debido a estas casuísticas, que dependen estrechamente de la pragmática del discurso especializado, Cabré considera que existe una intersección entre lengua general y lenguajes especializados (Figura 1). Figura 1. Los lenguajes de especialidad (LE) y la lengua general (LG). Adaptado de Gómez (2005, 46).
9 Para ilustrar esto, tomemos como ejemplo un tema de Ciencias de la Naturaleza sobre el cuerpo humano en Educación Primaria. Cuando se habla del cuerpo, la voz mano es aquí una unidad del discurso especializado orientada a niños de esta etapa educativa. Sin embargo, en un contexto especializado para anatomía del tronco superior, la voz mano pasaría a ser parte distal del miembro superior. Al igual que decía Gutiérrez (1998) en la siguiente afirmación: Lo que «playa» significa para cada uno de nosotros tiene poco que ver con un «depósito arenoso en forma de suave talud inclinado hacia el mar, formado por partículas procedentes de la erosión costera y situado sobre la plataforma literal». (p. 105) Al existir un continuum del conocimiento y no estar dividido en compartimentos estancos, si se observa un término desde diferentes perspectivas, se asociará al discurso especializado o al discurso general. El momento en el que pasa al discurso especializado se denomina terminologización. Para ilustrar esto, la voz resistencia, según el DRAE, se define como «acción y efecto de resistir o resistirse»; pero también en el ámbito de la electricidad «elemento que se intercala en un circuito para modificar el paso de la corriente o para producir calor» 2 . Al igual que existe la terminologización, también se da el caso contrario en el proceso denominado banalización, cuyo origen atribuye Cabré a los medios de comunicación de masas y al acceso a la enseñanza universal. Es el caso de la voz pélet (adaptación de pellet), según la Fundéu: «para aludir a las piezas cilíndricas prensadas de materiales variados y que sirven como combustible para calderas o estufas» 3 . Por otra parte, Cabré también describe las variaciones del lenguaje especializado a través de dos ejes, el horizontal y el vertical. En cuanto a la primera división, se basa en la multidimensionalidad de las perspectivas utilizadas para tratar una temática concreta. La temática define el discurso especializado, pero la perspectiva es definitoria para conseguir el objetivo que se persigue; se puede tratar un discurso especializado de manera trivial como si fuese conocimiento general o se puede abordar desde el punto de vista especializado. En la misma línea del ejemplo anterior, la voz mano también se podría utilizar en un temario sobre anatomía del tronco inferior para estudiantes universitarios de Medicina, 2 Real Academia Española. (s.f.). Resistencia. En Diccionario de la lengua española. Recuperado en 26 de mayo de 2023, de https://dle.rae.es/resistencia?m=form 3 FundéuRAE. (25 noviembre de 2022). «pélet», adaptación de «pellet». Recuperado el 27 de mayo de 2023. https://www.fundeu.es/recomendacion/pelet-adaptacion-depellet/#:~:text=La%20forma%20p%C3%A9let%20es%20una,combustible%20para%20calderas%20o%2 0estufas.
16 reconocimiento como espacios en blanco, saltos de línea, caracteres ASCII no reconocidos y signos de puntuación incorrectos. A través de un análisis exhaustivo, el planteamiento inicial incluye 100 unidades monoléxicas y 100 unidades poliléxicas, aunque en apartados posteriores comprobaremos que varían en función de las unidades que nos proporcione Sketch Engine. Las estadísticas de palabras extraídas para los corpus son las siguientes: Figura 2. Codificación, idioma y número de palabras de cada corpus. Los corpus donde se recogen las unidades de todos los cursos siguen el siguiente etiquetado: editorial_ALL_idioma. Se han recogido estos dos corpus adicionales para poder estudiar las concordancias y diseñar las entradas. Las estadísticas de palabras en este caso son: Figura 3. Codificación y número de palabras de los corpus en inglés y en español. 4. Análisis de los corpus con Sketch Engine y Excel Una vez compilados los corpus y subidos a la plataforma (Figuras 2 y 3), se ha utilizado la función Keywords para extraer las palabras clave de cada uno de los temas compilados. Al realizar una comparación automática con corpus de referencia, podremos comprobar
17 qué unidades monoléxicas y poliléxicas (Figura 4) son más frecuentes en nuestros corpus especializados. Figura 4. Extracción de unidades monoléxicas y poliléxicas. Single-words y multi-word terms en inglés, respectivamente. Tomemos dos cursos como ejemplo. El primer nivel equivale a primero de primaria. El problema que se plantea es el hecho de que no hay suficientes palabras como para que el programa devuelva un máximo de 1000 (Figura 5). El segundo problema que se plantea es la frecuencia de aparición de unidades de la lengua general frente a unidades de significación especializada. Figura 5. Ejemplo de extracción terminológica con la función keywords para primero de primaria en español. Con el fin de asegurar la homogeneidad y respetar las pautas que hemos asentado en el marco teórico del trabajo, se han eliminado aquellas unidades no especializadas o no pertenecientes al subdominio de estudio. Entre ellas encontramos: colorear, dibujar, asear, mural-silueta, exprésate o farola (Figura 5). El hecho de que aparezcan como palabras clave se debe a que aparecen en ejercicios de las unidades o en las introducciones y páginas finales que hay en cada tema de la asignatura. Al revisar manualmente todas las unidades, limitamos los términos válidos a 99 en cuanto a unidades monoléxicas y 21 en unidades poliléxicas. Si calculamos el porcentaje de unidades que son adecuadas para incluirlas en nuestra base de datos, seguimos la siguiente fórmula:
18 Porcentaje de unidades finales = Unidades seleccionadas ∗ 100 Total de 𝑘𝑒𝑦𝑤𝑜𝑟𝑑𝑠 Al seguir esta fórmula vemos que el 11,04 % de las keywords son aptas para incluirlas en nuestra base de datos. Ahora bien, si comparamos el número de unidades para sexto de primaria, limitamos los términos válidos a 263 unidades monoléxicas y 71 unidades poliléxicas. Figura 6. Ejemplo de extracción terminológica con la función keywords para sexto de primaria en español. Si calculamos el porcentaje de unidades que son adecuadas para incluirlas en nuestra base de datos siguiendo la formula anterior, obtenemos un 16,7 %. Todavía es un porcentaje bajo, pero comprobamos la tendencia a un incremento de la dificultad terminológica conforme pasan los cursos (Figura 6). Una vez hecho esto, se han acotado el número de palabras clave en todos los cursos para intentar recoger el mismo número de unidades y se han filtrado hasta alcanzar 120 para primero de primaria y 200 para el resto de los niveles, tanto en los corpus en inglés como en español. Las unidades resultantes se han comparado en Excel. Para ello, primero se han vuelto a copiar todas ellas en una columna titulada All corpus words y se han eliminado duplicados a través de la opción Herramientas de tabla > Quitar duplicados. Las palabras resultantes se han dispuesto en una segunda columna titulada Single words. Más tarde, se ha empleado la función estadística CONTAR.SI, que cuenta el número de celdas, dentro del rango, que cumplen el criterio especificado. Con el objetivo de contar las frecuencias, la función quedaría formulada como sigue: =CONTAR.SI(A$2:A$879;B2). Una vez aplicada a la celda C2, se arrastra con el cursor para aplicarla al resto de celdas de la columna titulada Frequency. De este modo, se ha extraído el número de veces que se repite cada palabra (Figura 7).
19 Figura 7. Ejemplo de los resultados de la función estadística CONTAR.SI con las unidades monoléxicas en español. Una vez hecho esto para las unidades monoléxicas en ambos idiomas, se ha establecido el límite de frecuencias en 3, ya que uno menor no sería suficientemente representativo. El número de unidades que se repiten 3 o más veces es el siguiente: ● Unidades monoléxicas en español: 95; ● Unidades monoléxicas en inglés: 94; ● Unidades poliléxicas en español: 27; ● Unidades poliléxicas en inglés: 25. Ahora que conocemos estos datos, se ha creado otra hoja de cálculo donde se han comparado manualmente las unidades coincidentes en inglés y español (Figura 8). Figura 8. Comparación manual de las unidades monolingües coincidentes en inglés y en español con frecuencia superior o igual a 3. 5. Resultados Al tener estos datos de los cuatro tipos de unidades, monoléxicas y poliléxicas en inglés y en español, se han comparado manualmente las coincidencias en ambos idiomas para Spanish words English words Bilingual matches ovíparo viviparous ovíparo vertebrado oviparous vertebrado invertebrado omnivore invertebrado carnívoro vertebrate carnívoro vivíparo invertebrate vivíparo anfibio amphibian anfibio esqueleto reptile esqueleto herbívoro herbivore herbívoro escama carnivore máquina máquina pollute oído oído intestine electricidad electricidad skeleton músculo
20 aquellas unidades que coincidían 3 o más veces. Los resultados del análisis indican que coinciden 57 unidades monoléxicas y 18 unidades poliléxicas, por lo tanto contamos con 150 unidades para poblar nuestra base de datos. Para extraer el porcentaje de unidades coincidentes en ambos idiomas, se ha utilizado la siguiente fórmula: Porcentaje de coincidencias = Unidades coincidentes ∗ 100 Total de unidades Los resultados son los siguientes: 60 % y 60, 63 % para unidades monoléxicas en inglés y español, respectivamente. 66,66 % y 72 % en unidades poliléxicas en inglés y español, respectivamente. Una vez extraído el porcentaje para cada idioma, se ha hecho la media de los porcentajes de coincidencias. El análisis demuestra que existe más de un 50 % de relación entre la frecuencia de unidades en el corpus en español y su equivalente en el corpus en inglés, en concreto: 60,31 % en unidades monoléxicas y 69,33 % en unidades poliléxicas. La lista de términos seleccionados se acota, por tanto, a 150 unidades monoléxicas y poliléxicas, es decir 75 en español y 75 en inglés. 6. Creación de la base de datos y propuesta de entrada Para crear la base datos se ha utilizado un dominio público en la plataforma WordPress.com. En cuanto a la macroestructura de la base de datos, el menú principal se estructura en: ● Página de inicio: con el nombre de la base de datos y una interfaz de búsqueda para introducir el término. Más abajo se explican los motivos de creación, la manera de hacer las búsquedas, así como la información pertinente de cada una de las entradas. ● Acerca de: menú fijo donde se explica el motivo de creación del blog y los objetivos del trabajo. ● Guía de usuario: menú fijo donde se explica la información que contiene cada entrada y cómo han sido diseñadas. ● Glosario: contiene un desplegable según el idioma. Una vez se accede a él, se visualiza una lista ordenada alfabéticamente de todos los términos en inglés y en español ● Contacto: formulario de contacto para consultas o peticiones de los usuarios.
21 El diseño de las entradas, el cual está explicado tanto en la página de inicio como en el menú Guía de usuario, contará con los puntos propuestos por terminólogos y lingüistas. Entre ellos se enumeran, como mínimo, definición, ejemplo de uso y principales colocaciones (véase Buendía 2013; Buendía y Faber 2014; Buendía, Montero y Faber 2014; Buendía 2019, inter alia). La configuración final sería la siguiente: 1. Definición y ejemplo de uso: se extraerá la definición para cada una de las entradas y se acompañará de un ejemplo de uso. Con esto en mente, se empleará la funcionalidad Concordance y el parámetro avanzado Corpus Query Language (CQL), un tipo de código usado en Sketch Engine para hacer buscar patrones gramaticales o léxicos complejos o emplear criterios de búsqueda que no están disponibles desde la interfaz básica. Como base a las búsquedas en CQL se ha seguido la propuesta de León-Araúz y San Martín (2018). 2. Equivalente: en inglés, enlazado con su respectiva entrada. 3. Colocaciones y ejemplo de uso: priorizando las colocaciones verbales por frecuencia. Para ello, se ha utilizado la funcionalidad Word Sketch, que nos permite estudiar la categorías o categorías gramaticales de una palabra y sus relaciones sintácticas. 4. Imagen: con licencia Creative Commons. Los corpus de referencia serán AN_ALL_ES y AN_ALL_EN para español e inglés, respectivamente (Figura 3). A continuación se propone el análisis lingüístico para el término fotosíntesis y su equivalente en inglés photosynthesis. En primer lugar, se realiza una búsqueda en CQL con la siguiente ecuación: [lemma="fotosíntesis"][]{0,5}[lemma="ser|generar|transformar|obtener|utilizar|mantene r"] within <s/> 12 Figura 9. Ejemplo de búsqueda en CQL mediante la funcionalidad Concordance de Sketch Engine. 12 De esta manera, acotamos la búsqueda a aquellos verbos especificados en cualquier de sus formas que estén hasta cinco tokens a la derecha de fotosíntesis.
22 Una vez comprobados los resultados, de las concordancias 4 y 6 (Figura 9) se extrae la definición y el ejemplo de uso: La fotosíntesis es el proceso por el que la planta utiliza las sustancias que absorbe y la energía de la luz del sol para fabricar nutrientes. La fotosíntesis mantiene el nivel de dióxido de carbono en la atmósfera, ya que permite reducir el producido por las industrias, los motores de los vehículos y los animales. El equivalente es fácilmente extraíble: photosynthesis, como ya se había estudiado en la tabla de coincidencias anterior (Figura 7). Las colocaciones extraídas del word sketch (Figura 10) son las siguientes: • fotosíntesis + hacer: En las hojas, las plantas hacen la fotosíntesis; utilizan la energía del Sol para combinar el dióxido de carbono y el agua y fabricar sus propios alimentos. • fotosíntesis + producir: La fotosíntesis produce oxígeno como desecho. • realizar + fotosíntesis: Para fabricar sus alimentos, las plantas obtienen sustancias del suelo y del aire, y realizan la fotosíntesis. Figura 10. Ejemplo de la funcionalidad Word Sketch de Sketch Engine para fotosíntesis. La imagen seleccionada cumple con la licencia Creative Commons para su distribución y es citada según las recomendaciones de la organización:
23 Figura 11. “Química de la fotosíntesis: Reactivos y productos” cuyo original es “The Scientific Process of Photosynthesis” de At09kg con licencia CC BY-SA 3.0. Traducido y adaptado por RoRo, con licencia CC BY-SA 3.0. Para el término en inglés, photosynthesis, la búsqueda en CQL quedaría como sigue: [lemma="photosynthesis"][]{0,5}[lemma="be|perform|obtain|absorb|take"] within <s/>. De esta manera, se acota la búsqueda a aquellos verbos especificados que se encuentren hasta cinco tokens después del lema. Para la definición, se ha escogido la siguiente: Plants take in water, minerals and carbon dioxide, and they perform photosynthesis to obtain nutrients and oxygen. Su equivalente es fotosíntesis y las colocaciones verbales en inglés son: • perform + photosynthesis: Plants exhibit autotrophic nutrition; in other words, they produce nutrients from substances that they take from the environment, and perform photosynthesis. • photosynthesis + take: The thin, flat green organs, joined to the stem, where photosynthesis takes place. En los casos en los que existe una adaptación traducida de la imagen original y es posible respetar el diseño, se ha optado por escoger la imagen más similar. De este modo, a los niños de Educación Primaria les resultará más fácil e intuitivo reconocer los elementos.
24 Figura 12. “The overall process of photosynthesis”, whose original is “The Scientific Process of Photosynthesis” by At09kg, used under CC BY-SA 3.0. This work has been translated and adapted by Wattcle and Nefronus, and it is licensed under CC BY-SA 4.0. Después de recoger todos estos datos, podríamos publicarlo en nuestra base de datos. El resultado final para la primera entrada sería el siguiente: Figura 13. Ejemplo del término fotosíntesis en la base de datos. En general, las entradas propuestas como en la Figura 13 están configuradas con definiciones y ejemplos de uso sencillos y colocaciones con frecuencias altas, lo que facilitará la mejor comprensión de los conceptos por parte del alumnado (véase Norman y Rumelhart 1975 y Rumelhart 1980). Cuando se haya poblado la base de datos con todas las unidades recogidas, se plantea pasar al plan personal de WordPress.com con el fin de abrir al público este recurso.
25 7. Conclusiones Los objetivos principales de este Trabajo de Fin de Grado han sido la extracción y análisis terminológico de unidades monoléxicas y poliléxicas a partir de un corpus compilado en función de los subdominios de Ciencias de la Naturaleza de Educación Primaria y la creación de un recurso terminográfico bilingüe para el estudiantado de esta etapa educativa. Se ha constatado que, ante falta materiales con estas características, en la actualidad es necesaria la creación de recursos educativos abiertos para impulsar las competencias digitales y lingüísticas del alumnado en la modalidad de enseñanza bilingüe (español-inglés). Asimismo, es tarea de expertos, terminólogos y lingüistas computacionales desarrollar medios y permitir la digitalización en todos los niveles. La extracción terminológica dio lugar a un corpus en español de 107 201 palabras y un corpus en inglés de 33 964. Tras la selección de 150 unidades, se creó una base de datos. Gracias a la representatividad y adecuación de los resultados obtenidos, esta base de datos se propone como una obra de referencia que conseguirá superar las lagunas de conocimiento y las limitaciones de la modalidad bilingüe en Educación Primaria. Esta investigación se entiende como la antesala a un Trabajo de Fin de Máster e incluso una tesis doctoral en la que se aumente el número de palabras recogidas en el corpus, se ahonde en el aspecto computacional y se resuelvan dificultades de escalabilidad.