scieee AI-readable full text Open interactive document viewer

Drafting Definitions for Emerging Concepts and Terms Undergoing Semantic Shift Within the ARTES Knowledge Base: A Protocol for Integrating LLMS Into Terminological Analysis by Experimental Approach

Mojca Pecman

Abstract

This paper presents a protocol for evaluating and integrating generative AI (GenAI) tools in the framework of the terminological analysis of emerging, semantically unstable terms, absent from established term bases. Implemented within the ARTES knowledge base, the protocol supports Master’s students in translation at Université Paris Cité, in their task consisting of conducting a terminological analysis required for their dissertation. The study focuses particularly on terms displaying semantic instability and variation, thereby giving rise to semantic neologisms, and on evaluating the effectiveness of GenAI in retrieving existing definitions and drafting new terminological definitions for such terms. A survey of students’ GenAI use and an experimental study on the concept of data pollution illustrate the approach. Findings show corpus-linguistic tools help structure conceptual knowledge and critically assess GenAI outputs, confirming the need for human oversight. The study proposes a model for prompt construction and evaluation, a systematic process for building a collection of effective prompts, and a methodology that combines LLMs and corpus linguistics’ techniques for terminology management.

Full text

Terminología y terminología 2025, vol. 32, páginas 1 a 43 Enlace de contenido Turinio nuoroda ISSN 2669-2198 (electrónica en línea) Copyright © 2025 Mojca Pecman. (Copyright) Copyright © 2025 Mojca Pecman. (Copyright) Copyright © 2025 Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Mojca Pecman. (Copyright) Publicado por el Instituto de la Lengua Lituana. Este es un artículo de Acceso Abierto distribuido bajo los términos de la Licencia de Atribución Creative Commons, que permite el uso, distribución y reproducción sin restricciones en cualquier medio, siempre que se acredite al autor original y la fuente. Instituciones de la lengua lituana. Este artículo es atviros prieigos, platinados según Creative Commons‚ priskyrimo licencijos sąlygos, leidžiančias neribotai naudoti, platinti ir atkurti turinį bet kokioje laikmenoje, nurodant autorių ir šaltinį. Recibido por: Gauta: 2025-09-10. Aceptado por: Priimta: 2025-09-22 y 1 DEFINICIÓNES DE RECURSO DE CONCEPTOS Y TERMINOS EMERGENTES SON EN VERGENCIA SEMÁNTICA Dentro de la Base de Conocimiento de las Artes: Un Protocolo para la Integración de los LLMS en el Análisis Terminológico por Experimento Enfoque de la Comisión Naujų sąvokų ir semantiniu poslinkiu pasižyminčių terminų apibrėžčių rengimas ARTES conocimientos bazės kontekste: didžiųjų kalbos modelių integravimo į terminologinę analizę eksperimentinis protokolas Mojca Pecman Universidad de la ciudad de París El correo electrónico es el siguiente: [email protected] ORCID ID: https://orcid.org/0000-0002-6753-1936 Campos de investigación: base de datos de conocimiento ARTES, terminología basada en corpus, neologismos semánticos, redacción de definiciones terminológicas, IA generativa, ingeniería rápida para la terminología. El documento se encuentra en el siguiente enlace: https: www.doi.org/10.35321/term32-02 ------------------------------------------------------------------------------------------------------------------ RESUMENDO: El Consejo de Administración y el Consejo de Administración de la Unión Europea han adoptado el presente Reglamento. Este documento presenta un protocolo para evaluar e integrar herramientas de IA generativa (GenAI) en el marco del análisis terminológico de términos emergentes, semánticamente inestables, ausentes de las bases de términos establecidas. Implementado dentro de la base de conocimientos ARTES, el protocolo apoya a los estudiantes de maestría en traducción de la Université Paris Cité, en su tarea que consiste en realizar un análisis terminológico dissertation. The study focuses particularly on terms displaying semantic instability and variation, thereby giving rise to semantic neologisms, and on evaluating the effectiveness of GenAI in retrieving existing definitions requerido para su traducción y redactar nuevas definiciones terminológicas para dichos términos. Una encuesta sobre el uso de GenAI por parte de los estudiantes y un estudio experimental sobre el concepto de contaminación de datos ilustran el enfoque. Los hallazgos muestran que las herramientas corpus-lingüísticas ayudan a estructurar el conocimiento conceptual y evaluar críticamente los resultados de GenAI, confirmando la necesidad de supervisión humana. El estudio propone un modelo para la construcción y evaluación rápidas, un proceso sistemático para la construcción de una colección de instrucciones efectivas y una metodología que combina técnicas de LLM y lingüística de corpus para terminology management. 2 PAZAS clave: base de datos de conocimiento de ARTES, terminología basada en corpus, neologismos semánticos, redacción de definiciones terminológicas, IA generativa, ingeniería rápida para la terminología. ANOTACIJA Šiame straipsnyje pristatomas generatyvinio DI (GDI) įrankių vertinimo terminologinių analizės kontekste ir jų integravimo į terminologinės analizės sistemą, taikomą naujiems, semantiškai pripažbiliems, įintas terminų bazes neįtrauktiems terminams, protokolas. Jis, įgyvendinamas ARTES conocimientos bazėje, palengvina darbą Paryžiaus universiteto vertimo magistrantūros studentams, atliekantiems terminologinę analizę, reikalingą baigiamiesiems darbams. Tyrime principalmente atención skiriama terminams, kurie pasižymi semantiniu nestabilumu ir variantiškumu, todėl tai lemia semantinius neologizmus, bei GDI veiksmingumo atrenkant esamas šių terminų apibrėžtis ir rengiant naujas šių terminų apibrėžtis įvertinimui. Metodą iliustruoja atlikta studentų apklausa dėl GDI naudojimo ir eksperimentinis sąvokos análisis de contaminación de datos (klaidingų duomenų įrašymas) Rezultatai rodo, kad tekstynų lingvistikos įrankiai padeda struktūrizuoti konceptualias žinias, kritiškai įvertinti GDI išvestis ir patvirtina žmogaus atliekamos priežiūros poreikį. Tyrime siūlomas užklausų kūrimo ir vertinimo modelis, sistemingas prosessų veiksmingų užklausų rinkiniui kurti bei didžiųjų kalbos modelių ir tekstynų lingvistikos technikas suderinanti terminologijos valdymo metodologija. Se trata de una metodología de gestión de la lengua que se utiliza en el ámbito lingüístico. ESMINIAI ŽODŽIAI: ARTES conocimientos bazė, tekstynais grindžiama terminologija, semantiniai neologizmai, terminologinių apibrėžčių rengimas, generatyvinis DI, užklausų kūrimas terminologijai. INTRODUCCIÓN El presente Reglamento no tiene por qué ser aplicable a las operaciones de transporte por carretera. En este estudio, presentamos el protocolo para el análisis terminológico asistido por GenAI, implementado dentro del proyecto ARTES. El protocolo está diseñado específicamente para 1 abordar conceptos emergentes que aún no están documentados en las bases de datos terminológicas existentes, pero que se utilizan cada vez más en la literatura especializada. En primer lugar, hay que definir los conceptos emergentes. El proyecto ARTES se centra en la creación de los recursos y conocimientos lingüísticos necesarios para abordar tales conceptos, que a menudo dan lugar a variaciones terminológicas, ya sean formales o semánticas, y que generalmente están ausentes de las bases de términos establecidas (véase L[…]Homme 2024b). En este contexto, los términos se analizan utilizando una metodología basada en corpus y se registran en la base de conocimientos ARTES, que funciona tanto como base de términos como 2 como herramienta pedagógica para la enseñanza de terminología a futuros traductores en la Université Paris Cité. Además, ARTES es utilizado activamente por los estudiantes de maestría como parte de su disertación de maestría en terminología. Cada año, los estudiantes recopilan corpora comparables para realizar un análisis terminológico en profundidad y redactar registros de términos para apoyar la traducción especializada. Este estudio tiene como objetivo evaluar la contribución de los grandes modelos lingüísticos (LLM) a la gestión terminológica en este contexto educativo específico y destacar la importancia de realizar un análisis basado en corpus antes de interactuar con las herramientas de inteligencia artificial generativa (GenAI). El estudio también ilustra la contribución de la terminología a la ingeniería del conocimiento y su conexión, en este contexto, con la inteligencia artificial (Condamines 2022). Utilizando un corpus piloto compuesto de textos que representan varios contextos de comunicación especializada y semi-especializada en inglés, analizamos el concepto de contaminación de datos por medio de Contextos ricos en conocimiento (KRC) (Meyer 2001). 1 Disponible en: https://altae.u-pariscite.fr/artes-aide-a-la-redaction-de-textes-scientifiques. 2 Available at: https://artes.app.univ-paris-diderot.fr/artes-symfony/web/app.php. 3 El significado del término contaminación de datos comenzó a cambiar en 2018, lo que lo convierte en un candidato valioso para estudiar los procesos de cambio semántico y los desafíos involucrados en la definición de neologismos semánticos. Si bien el término se utiliza cada vez más en inglés (junto con su contraparte más establecida, la contaminación digital, que está bien documentada en las bases de términos), aún no se ha registrado en las principales bases de datos terminológicas con su significado recién emergente. Este estudio describe las fases de un protocolo experimental diseñado para explorar y evaluar la contribución de las herramientas GenAI al trabajo terminológico, con especial atención a la redacción de definiciones. El objetivo es emprender una adaptación informada del plan de estudios de terminología en el programa de maestría para el año académico 2025-2026. La integración de las herramientas GenAI en la gestión de períodos también está motivada por las necesidades en evolución de los estudiantes identificadas a través de una encuesta cuyos resultados se 3 presentan en este estudio. También está impulsado por los requisitos del Máster Europeo en Traducción (EMT), acompañado del Máster ILTS en 2009. La última versión del marco de competencias EMT (2022), que cubre el período 2023-2028, hace especial hincapié en la integración de tecnologías y en la necesidad de que los futuros traductores actualicen continuamente sus habilidades en herramientas y tecnologías de traducción. A la luz de los recientes avances en IA y traducción automática neuronal (NMT), este aspecto se ha convertido en central para las necesidades actuales de capacitación. La primera sección del estudio está dedicada a presentar el contexto de fondo con especial énfasis en la interconectividad entre la terminología, la lingüística de corpus y la IA. También presentamos el marco ARTES para el análisis terminológico y el paso clave en este proceso: la redacción de definiciones terminológicas. También introducimos el enfoque experimental para integrar los LLM en el análisis de términos basado en corpus. La segunda sección presenta la metodología para diseñar un protocolo para la integración de GenAI y la encuesta realizada entre los estudiantes de maestría. La última sección proporciona el análisis del protocolo diseñado para recopilar y redactar definiciones terminológicas mediante la integración de GenAI a través de un enfoque crítico. También ilustramos la etapa final del análisis que condujo a la redacción de un registro de términos para la contaminación de datos de términos en la base de conocimientos de ARTES, y el modelo diseñado dentro de este protocolo para recopilar las instrucciones de terminología más eficientes. Terminología, inteligencia artificial y las artes Base de conocimientos En esta sección revisamos las últimas evoluciones en la terminología como una ciencia y práctica impulsada por el progreso en la IA. Luego presentamos la plataforma ARTES para redactar registros de términos en línea con los estándares ISO y los principios FAIR, y las posibilidades que ofrece para interactuar con la IA. También presentamos el papel central de la definición en el análisis terminológico, particularmente en el caso de conceptos y términos emergentes. 3 Maestría en industria de la lengua y traducción especializada (ILTS), UFR EILA, UPCité. 4 Terminología e inteligencia artificial Según Leonardi (2025: 148), el trabajo histórico de Eugen Wüster, el fundador de la ciencia de la terminología, es parte de una larga tradición de intervenciones en los lenguajes naturales con el objetivo de mejorar su eficiencia representativa y comunicativa. Por lo tanto, la terminología y la IA están intrínsecamente vinculadas. De hecho, la convergencia entre la terminología y la IA se remonta a 1993, cuando Didier Bourigault y Anne Condamines establecieron un grupo de investigación "Terminología e Inteligencia Artificial (TIA)". En ese momento, la IA relacionada con la terminología estaba arraigada en la ingeniería del conocimiento y las exploraciones de las interacciones entre corpora y terminología mediante la implementación de un enfoque simbólico utilizando patrones para buscar términos candidatos y modelado de conocimiento. conceptual relationships (Meyer et al. 1992; Bourigault et al. 2001; Condamines, Rebeyrolle 2001; Condamines 2005). Consequently, Terminology and AI share the same goal: Además, la intersección entre la terminología y la IA a través de su objetivo compartido, el modelado del conocimiento, tiene sus raíces en el surgimiento de la lingüística de corpus a finales de la década de 1980, que proporcionó acceso a corpora digitales y herramientas para su corpus linguistics became a leading approach in terminology studies (Pecman, Kübler 2022). It has also contributed to the development of the textual approach to terminology exploración. Con el tiempo, (Bourigault, Slodzian 1999), que a menudo se ve como una reacción a la metodología prescriptiva tradicional de la escuela Wüsterian (Humbley 2022). Esta conexión entre la terminología, la lingüística de corpus y la IA también es visible en el uso de términos como la terminología computacional y la terminología basada en corpus. En la opinión de Condamines (2022), esta alineación histórica entre la terminología y la IA que persigue objetivos comunes y utiliza herramientas comunes como corpora o grandes colecciones de datos lingüísticos se ha erosionado progresivamente, reflejando los paradigmas cambiantes y el desarrollo acelerado dentro del campo de la IA que culminó en la década de 2020 con la introducción de grandes modelos lingüísticos. Sin embargo, los datos lingüísticos, que sirven como depósito para el modelado del conocimiento, son otro elemento compartido entre Terminología, Corpus Linguística y LLM. En aproximadamente treinta años, la empresa conjunta entre lingüistas computacionales, especialistas en PNL e IT culminó en el desarrollo del prototipo de investigación, ChatGPT. Lanzado en noviembre de 2022, ChatGPT se convirtió rápidamente en una aplicación ampliamente utilizada, ilustrando la rápida aceptación pública de las innovaciones de inteligencia artificial. Los años siguientes se caracterizaron por la proliferación de diferentes tipos de LLM y herramientas GenAI: ChatGPT, DeepSeek, Perplexity, Gemini, Claude, etc. 5 El cambio de paradigma impulsado por la Inteligencia Artificial El cambio de paradigma traído por la IA está en curso, ampliando el alcance y las posibilidades tanto para la investigación como para la enseñanza, desde ahora orientado hacia la evaluación e integración de la IA. En relación con la terminología, la traducción especializada y la lingüística de corpus, se centra en la evaluación crítica de la eficacia y las trampas de la asistencia de la IA en el análisis lingüístico, la traducción y la gestión de términos. Si bien la mayoría de los trabajos subrayan la necesidad de un enfoque crítico, particularmente en el contexto de los idiomas especializados: por ejemplo, Raus, Mattioda 2024; San Martín 2024; Davies 2025; Kübler, Pecman 2025; también se pueden encontrar los artículos muy entusiastas hacia las posibilidades ofrecidas por las herramientas de IA, como el estudio de Schryver (2023) sobre los efectos de ChatGPT en la lexicografía general del lenguaje. Al mismo tiempo, la investigación destinada a mejorar el rendimiento de los modelos de LLM está específicamente interesada en la terminología específica del dominio, en particular en los recursos paralelos, que sirven como datos de formación de alta calidad: e.g. Ballier y otros, 2021; Bénard y otros, 2023; Zhu y otros, 2023. Además, en este contexto de rápida propagación de la IA, el creciente número de publicaciones y conferencias invita a los científicos a unirse a la reflexión sobre el papel de la IA en la ciencia y la enseñanza, en las prácticas profesionales y sociales, en cuestiones éticas y del GDPR (Reglamento General de Protección de Datos), así como en las cuestiones relacionadas con los datos de formación limitados para las lenguas de menor difusión. Rastier 2021; Casal, Kessler 2023; Finardi 2023; Lommel 2024. El proyecto se basa en el proyecto Rastier 2021; Casal, Kessler 2023; Finardi 2023; Lommel 2024. Las instituciones contribuyen al debate 4 organizando eventos importantes. La Conferencia Interpretación Europa 2025 invitó a profesionales, expertos de la industria, académicos y estudiantes a la discusión sobre el futuro de la interpretación, como profesión, en relación con los avances en la IA. En la Cumbre de Acción sobre Inteligencia Artificial 2025 (Sommet pour l'action sur l'intelligence artificielle) celebrada en 5 París, más de 60 países firmaron por primera vez una declaración destinada a promover una IA confiable, sostenible e inclusiva. Al mismo tiempo, los medios de comunicación y la prensa amplifican el debate al llevar el tema a la esfera pública, estimulando a los investigadores a llegar a un público más amplio y considerando una gama más amplia de géneros y fuentes: por ejemplo, Falgas, Robert 2023; Finardi 2023; Davies 2025. Este es el caso de los vehículos que se encuentran en la Unión Europea. Por lo tanto, es digno de mención que el progreso en la IA tenga un gran impacto en los entornos científicos, académicos y educativos. En el contexto de la traducción y los estudios lingüísticos, la creciente influencia de la IA está remodelando significativamente el comportamiento de los estudiantes, particularmente en la forma en que buscan y construyen definiciones. Como notaron Ptasznik y Lew (2025), ChatGPT ha provocado un debate entre los lexicógrafos. En su reciente estudio sobre el impacto de la IA entre los estudiantes polacos de inglés, encontraron que ChatGPT es ampliamente utilizado y considerado como una herramienta valiosa para la escritura y la traducción. Los autores informan que los estudiantes también recurren a ella por inspiración, curiosidad y entretenimiento. También subrayan que el papel futuro de la IA en el campo sigue siendo incierto. A medida que el paisaje tecnológico evoluciona, también lo hacen las prácticas académicas, creando la necesidad de revisar los marcos educativos y metodológicos para reflejar estos cambios. 4 Disponible en: https: knowledge-centre-translation-interpretation.ec.europa.eu/en/events/interpretingeurope-conference-2025. 5 Disponible en: https: www.elysee.fr/sommet-pour-l-action-sur-l-ia. 6 En consecuencia, gran parte de la investigación actual en terminología, desarrollo de recursos lingüísticos y creación de diccionarios se centra ahora en examinar el cambio de paradigma introducido por las herramientas de IA, junto con su evaluación crítica y su posible integración en la enseñanza y la investigación. Las iniciativas recientes notables incluyen un número especial de la revista Terminology, Terminology and AI, programado para 2027 y un taller 2025 en París que explora el papel de los diccionarios en la era de la IA. Como subraya Altamei (2024: 429), 6 la integración de CL [Corpus Linguistics] con ChatGPT tiene un gran potencial para la comprensión del lenguaje en la era digital. En otras palabras, en lugar de ser cautelosos en la aplicación de ChatGPT, los lingüistas deberían examinar la importancia de fusionar CL y ChatGPT. Incluso los programas académicos lingüísticos deben considerar la importancia de la aplicación de la tecnología en el plan de estudios de sus títulos. Además, no solo los lingüistas deben tener en cuenta este punto, sino también los académicos de otros campos que deben considerar estos aspectos y pensar en la utilización efectiva de la tecnología en el estudio de campos del conocimiento humano.En este contexto de necesidad apremiante de reflexión crítica sobre el papel de la IA y el desarrollo de prácticas apropiadas, este estudio tiene como objetivo explorar las posibilidades de integración de las herramientas GenAI en el proceso de análisis terminológico en el contexto del marco de base de conocimientos ARTES. La necesidad de tal evaluación es aún más crucial ya que, con la inevitable integración de la IA en el trabajo terminológico, la distinción entre el contenido creado por el hombre y el creado por la IA se borrará cada vez más, como señaló San Martín (2024). La base de conocimientos de ARTES y la IA La base de conocimientos ARTES se ha utilizado desde 2010 para la enseñanza de terminología a los estudiantes de maestría en traducción en el departamento de EILA (véase Pecman, 7 Kübler 2011; Kübler, Pecman 2012; Gledhill, Kübler 2015; Pecman 2021). Proporciona recursos valiosos para apoyar la enseñanza y la investigación en terminología y traducción especializada. Desarrollado por el equipo de investigación de ALTAE, ARTES consta de dos plataformas, una para recopilar recursos terminológicos y fraseológicos por parte de 8 estudiantes de traducción y la otra para consultar la base de datos libremente en línea. ARTES es una base de términos; Sin embargo, su mejora, knowledge-oriented approach to terminology and specialised discourses also qualifies it as a knowledge base (Pecman 2018). El principio básico del marco ARTES es que la gestión eficiente de los términos se basa en la adquisición de conocimientos especializados. Esto se puede lograr mediante la realización de análisis de términos onomasiológicos y semasiológicos impulsados y basados en corpus, a los que, en el marco de ARTES, se agrega el análisis de conocimientos o redes conceptuales. Debe subrayarse que 6 Le dictionnaire face à l’essor de la traduction automatique et des intelligences artificielles génératives, ISIT, Paris, El 12 de junio de 2025. Disponible en: https: www.isit-paris.fr/le-dictionnaire-face-a-lessor-de-la-traductionautomatique. 7 Disponible en el siguiente enlace: https: u-paris.fr/eila. 8 Disponible en el siguiente enlace: https: www.u-pariscite.fr 7 que tanto la terminología basada en corpus (Pecman, Kübler 2022) como los estudios de traducción basados en corpus (CBTS) (Kübler et al. 2024) se caracterizan por una sólida base en datos auténticos extraídos de corpora, utilizados para abordar desafíos terminológicos y de traducción. Además, en terminología, los corpora son particularmente útiles para identificar y analizar los términos recién acuñados y los neologismos semánticos. Además, la base de datos ARTES está diseñada de acuerdo con las normas ISO (es decir, ISO 1087:2019, 704:2022, 12620-1:2022, 5078:2025) y los principios de datos FAIR (localidad, accesibilidad, interoperabilidad y reutilización) iniciados por Wilkinson et al. (2016) y adaptados para la terminología por Vezzani et al. (2023). ARTES proporciona recursos valiosos para la formación en NMT (véase Los proyectos SPECTRANS (Ballier et al. 2021; Zhu et al. 2023) y MaTOS (Bénard et al. 2023)). Los datos alineados o paralelos están disponibles para cinco tipos de elementos: términos, colocaciones, definiciones (terminológicas y enciclopédicas), notas de traducción y tema o dominio. En el actual año académico 2025-2026, el marco ARTES se está ampliando para explorar la integración de LLM en el análisis terminológico. El protocolo tiene por objeto tener en cuenta las diversas fases del análisis de términos, es decir, para identificar términos y variantes terminológicas, encontrar colocaciones, términos equivalentes, contextos de definiciones, KRC y para redactar definiciones y notas. Para garantizar un enfoque crítico y experimental para evaluar la producción de GenAI, se seguirá haciendo hincapié en la adquisición de conocimientos sobre términos a través de un enfoque basado en corpus y en el desarrollo de las habilidades necesarias para producir definiciones de alta calidad. En el análisis terminológico, las definiciones juegan un papel central en el proceso de adquisición de conocimiento. En consecuencia, es importante explorar la eficacia de las herramientas GenAI para identificar las definiciones existentes relevantes y redactar definiciones terminológicas. Con el surgimiento de la terminología como una disciplina independiente tras la propuesta de Wüster (1968) para la redacción de diccionarios especializados, la definición asumió un papel central como elemento clave en el análisis de términos. En la introducción de su diccionario inglés-francés de máquinas herramienta, Wüster (1968: 2.15) identifica la definición como el primer y principal elemento esencial para lograr la precisión terminológica. La definición es también la columna vertebral del enfoque onomasiológico (desde el concepto a la unidad lingüística) en el análisis terminológico. La definición de conceptos especializados constituye un primer paso para adquirir conocimientos especializados y conocimientos terminológicos. En los programas de maestría ofrecidos en el departamento EILA, los futuros traductores, intérpretes e investigadores especializados en Lenguas para Propósitos Específicos (LSP) desarrollan esta habilidad a través de cursos de terminología. La recopilación y redacción de definiciones terminológicas para la base de datos ARTES es uno de los requisitos para el diseño de registros. Consiste en redactar una definición original con el fin de armonizar los datos almacenados en la base de términos y proporcionar definiciones para conceptos previamente no definidos o para los cuales los terminólogos utilizan ampliamente solo contextos de definición. Los estudiantes elaboran definiciones seleccionando la información available. The model for drafting definitions follows ISO standards 1087:2019 and 704:2022, 8 relevante proporcionada en contextos de definición y KRC, así como mediante el análisis de términos semánticamente relacionados y redes semánticas. También recopilan definiciones existentes cuando están disponibles en bases de términos de buena reputación (UNTERM, IATE, Termium, etc., véase la figura 7). La redacción de definiciones para conceptos o neologismos recién emergentes, específicamente en relación con los términos que exhiben inestabilidad semántica, es muy desafiante. En el proyecto ARTES, se presta especial atención a las situaciones en las que el uso de un término comienza a cambiar y a mostrar un cambio de significado, lo que conduce a la formación de un nuevo concepto. Se espera que la evaluación de la contribución de los LLM a su análisis sea una tarea compleja, como lo discute San Martín (2024), quien observa: "Si la elaboración de definiciones tradicionales es intensiva en mano de obra, la consideración de las limitaciones contextuales y funcionales hace que la tarea sea aún más lívida. Esta es una barrera importante para la creación de definiciones terminológicas flexibles. Las herramientas de Inteligencia Artificial Generativa (GenAI), especialmente las impulsadas por Modelos de Lenguaje Grandes (LLMs) como ChatGPT, pueden eliminar estas barreras al reducir el tiempo y el esfuerzo requeridos para crearlas. Sin embargo, el impacto de GenAI puede extenderse mucho más allá de esto, ya que puede transformar profundamente los métodos y propósitos subyacentes a la creación y el consumo de definiciones terminológicas. Para nuestro estudio, seleccionamos el término contaminación de datos que analizamos a través de un enfoque basado en corpus antes de las pruebas presentadas en este artículo sobre análisis terminológico asistido por IA. El término contaminación de datos es un término candidato valioso a los efectos del presente estudio porque exhibe un cambio semántico y está ausente de los recursos terminológicos actualmente disponibles. Además, el estudio de caso de este término permite una evaluación completa del marco ARTES para la gestión de términos, las ventajas del análisis terminológico basado en corpus y la eficacia de los LLM para apoyar este proceso. Como es bien sabido, los términos que experimentan un cambio semántico alteran sutilmente el paradigma de conocimiento subyacente, lo que hace particularmente difícil distinguir el significado recién emergente del original. Sin embargo, tales términos reflejan tendencias conceptuales más amplias y tienen una importancia terminológica considerable (véase Pecman 2012; 2014). Típicamente referido como neologismos semánticos (a diferencia de los neologismos formales) y a veces como neosemas (Renouf 2020), este tipo de términos resulta de una serie de fenómenos lingüísticos, como la polisemía y los microsenses, que los hacen particularmente difíciles de estudiar (L[…]Homme 2024a; 2024b). Como señalan Lombard et al. (2023): los sentidos de las palabras nuevas se llaman neologismos semánticos y son el resultado de la extensión semántica por medio de la polisemia. Además, L[…]Homme (2024a: 216) explica que la […]polisemía es un fenómeno frecuente con el que los terminólogos se enfrentan a menudo[…], lo que hace que la gestión de los términos polismáticos en los recursos terminológicos sea […]esencial para evitar la ambigüedad en la comunicación[…]. La siguiente sección presenta la metodología general utilizada para diseñar el protocolo experimental sobre la integración de las herramientas GenAI en la redacción de registros de términos, con énfasis en las definiciones terminológicas como elementos básicos proporcionados en los registros de términos. 9 Metodología para la integración de las herramientas Genai en las artes Marco basado en CORPUS Se espera que la integración de los LLM en el proceso de búsqueda y redacción de registros de términos y definiciones en particular ahorre tiempo y mejore la calidad de las definiciones (véase San Martín 2024). Sin embargo, en nuestro enfoque, se lleva a cabo un análisis basado en el corpus antes de introducir los LLM para poder integrarlos y evaluarlos de manera efectiva. (2025) Davies explica, en su evaluación crítica de "lo bien que las predicciones de los grandes modelos lingüísticos (o LLM, como ChatGPT y Gemini) coincidieron con los datos reales del corpus", que "un corpus es mucho más inmersivo y es una experiencia mucho más conectada que lo que a menudo se muestran sólo en los LLM". Por lo tanto, para permitir una interacción corpora provide an immersive learning environment with extensive links between words.‛ Moreover, Davies suggest: ‚both LLMs and corpora have their advantages and the best is efectiva con los LLM y apoyar una evaluación crítica de su producción, es esencial una comprensión completa de los datos lingüísticos en análisis. Consequently, in our experimental approach, the interaction with LLMs relies on corpus-based terminology, combined with prompt engineering for terminology. According Para Boonstra (2025: 7), la ingeniería de instrucciones es el proceso de diseñar instrucciones de alta calidad que guían a los LLM para producir resultados precisos. Este proceso implica arreglar para encontrar el mejor aviso, optimizar la longitud del aviso y evaluar el estilo y la estructura de escritura del aviso en relación con la tarea. En el contexto del procesamiento del lenguaje natural y los LLM, un prompt es una entrada proporcionada al modelo para generar una respuesta o predicción.Para la ingeniería de prompt, usamos las plantillas propuestas por Boonstra (2025) originalmente desarrolladas para Gemini-pro, y por Schulhoff et al (2025), que adaptamos para atender un enfoque crítico de los LLM y para servir a nuestro objetivo de compilar una colección de prompt efectivos para la gestión de términos. Por lo tanto, excluimos los parámetros que están diseñados para influir en el comportamiento del modelo, como la "temperatura", que controla el grado de aleatoriedad en la selección de tokens, porque no son soportados por las herramientas GenAI probadas aquí. 9 Sin embargo, se pueden ajustar con una formulación rápida: por ejemplo, "Sea creativo e inesperado" fomenta el comportamiento a alta temperatura, mientras que "Sea conciso y preciso" fomenta el comportamiento a baja temperatura. En la gestión de términos, para encontrar datos auténticos relevantes, se puede esperar que el comportamiento a baja temperatura produzca mejores resultados. Para nuestros propósitos experimentales, añadimos una serie de campos a la plantilla de Boonastra, a saber: técnica de instrucciones, 10 fecha, comentario y relevancia. También adoptamos la posibilidad de definir el límite de manera diversa, por un número de caracteres, fichas o artículos. 9 Están soportados por la interfaz de programación de aplicaciones (API), que permite personalizar las aplicaciones utilizando LLM. 10 Los diferentes tipos de instrucciones de acuerdo con Boonastra (2025) incluyen: cero disparo (un aviso sin ejemplos proporcionados), un disparo (con un ejemplo proporcionado), pocos disparos (con varios ejemplos proporcionados), sistema 16 Figura 6 El Consejo de Administración y el Consejo de Administración Las herramientas GenAI más frecuentes utilizadas por los estudiantes de Master 1 y Master 2 para redactar registros de términos En este estudio, nos centramos en probar ChatGPT de OpenAI, así como DeepSeek desarrollado por la compañía china del mismo nombre y Perplexity desarrollado por Perplexity AI que utiliza diferentes LLM, a saber GPT desarrollado por OpenAI y Claude por Anthropic. En las siguientes secciones, presentamos un protocolo secuencial sistemático para su integración en el flujo de trabajo de gestión de términos de ARTES. Utilizar la terminología basada en el corpus para probar la eficiencia de las herramientas GenAI Como se hizo hincapié en la sección anterior, en el protocolo experimental que proponemos, el análisis terminológico mediante el enfoque basado en el corpus se lleva a cabo antes de interactuar con los LLM para garantizar la capacidad de evaluar críticamente la salida de GenAI. Por lo tanto, llevamos a cabo el análisis a través de todas las etapas del marco ARTES, es decir, las etapas 1 a 7, enumeradas en la sección anterior, a saber, utilizando SketchEngine (Kilgarriff et al. 2014) para el diseño y la exploración de corpus especializados, junto con corpora integrados en el SketchEngine y dos 12 herramientas más con corpora integrados, Google Books Ngram Viewer (Michel et al. 2011) y 13 Netspeak 14 (Riehmann y otros 2012). La figura 7 ilustra los resultados de la fase 1, que consiste en verificar si el término se registra en las bases de términos existentes. El término contaminación de datos rara vez se registra en bases de términos bien conocidas, ya que solo se encontró una entrada en IATE, creada en 2021, para el significado original del término. TERMINO de búsqueda: contaminación de datos DATAS de RELEVANCIA del comentario del registro básico de términos búsqueda: 25 de mayo de 2025 Termium Plus ninguno NA NA Vitrine linguistique ninguna NA NA 12 Disponible en el siguiente enlace: https: www.sketchengine.eu. 13 Disponible en el siguiente enlace: httpsbooks.google.com/ngrams. 14 Disponible en el siguiente enlace: https://netspeak.org. 17 Registro IATE 1 Campos y Fecha de creación del registro: 2.3.2021, Significado: el primer significado del término. información fuentes (a partir de 2018 y 2019), equivalentes en 20 idiomas (entre los cuales el francés: pollution des proporcionados: definición, contextos, medio données) WIPO ninguno NA NA UNTERM ninguno NA NA IGI Global Dicnone NA Figura 7 El Consejo de Administración y el Consejo de Administración Resultados de la búsqueda del término contaminación de datos en las bases de términos existentes Dado que el contenido del registro se dedica al significado original del término, se considera que este hallazgo es de relevancia media para el diseño del registro objetivo. La figura 8 muestra el contenido de los registros en IATE. Figura 8. El número de personas que trabajan en el sector de la construcción Registro del término contaminación de datos en IATE que muestra información sobre el significado original del término No obstante, los datos proporcionados pueden utilizarse para crear un registro de términos para la contaminación de datos con su significado original (que podría glosarse como "el acto de contaminar los datos") a fin de contrastarlo con el registro dedicado a la contaminación de datos utilizado con el nuevo significado (que podría glosarse como "la contaminación causada por los datos"). La complejidad de definir la contaminación de datos con su significado recién surgido (a veces reformulado por contaminación por datos) es particularmente compleja porque no solo se superpone con el significado del término contaminación digital, sino también debido a la existencia simultánea de su significado original (a veces reformulado por contaminación de datos, datos contaminados). La recopilación de información de los recursos existentes y su replicación en registros de términos redactados en ARTES da coherencia al análisis, teniendo en cuenta el amplio alcance de la información sobre un término (figura 9). 18 INJECCIÓN de muestras de datos de entrenamiento elaboradas maliciosamente en un conjunto de entrenamiento, haciendo que el sistema de IA aprenda un modelo incorrecto y posteriormente clasifique erróneamente las muestras de prueba SOURCE IATE, Council-EN, basado en Yinzhi Cao et al. 2018: 1 SOONYME COMMENT el primer significado del término SOURCE Mori et al. 2024: 155 COMMENT el nuevo significado del término, encontrado en literatura más reciente SOURCE COELBACH et al. Hass 2022: 9[…]10MMENT el nuevo significado del término, encontrado en literatura reciente RELEVANCE RELEVANCE RELEVANCE RELEVANCE RELEVANCE RELEVANCE RELATE RELEVANCE RELATE RELEVANCE RELATE RELEVANCE RELATE RELEVANCE RELATE RELATE RELEVANCE RELATE RELEVANCE based approach. Figure 10 shows the definitions retrieved from corpora by using discourse markers for definitional contexts (such as ‚is a‛, ‚is the‛, ‚refer to‛, etc.): 1 DEF. ¿Qué es esto? KRC (Congreso de las Repúblicas de Corea del Sur) La contaminación de datos es el conjunto de daños generados por las actividades digitales tiene en nuestro entorno natural, la recopilación social, el almacenamiento entorno personal. Es el manejo insostenible, los entornos. distribución y RELATE RELATE RELEVANCE RELATE RELATE RELATE RELEVANCE RELATE RELATE RELATE RELEVANCE RELATE RELATE RELATE RELATE RELEVANCE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELEVANCE high 2 DEF. ¿Qué es esto? KRC (Congreso de las Repúblicas de Corea del Sur) La contaminación de datos es el impacto adverso interrelacionado que la económicas relacionadas con el manejo de datos, y el procesamiento de datos y el uso, que impacta transversalmente en los individuos y su entorno de vida y generación de recursos de datos. RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE RATE Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Rate Información seleccionada de IATE para la base de datos ARTES La ausencia del término en las bases de términos existentes ilustra la utilidad de los corpus 3 generación, almacenamiento, DEF. KRC 4 DEF. ¿Qué es esto? KRC (Congreso de las Los contenidos de Internet (documentos, correos electrónicos, chats, imágenes, videos, referirse a la acumulación de todo Internet que a menudo se difunde y se replica en de trabajar con datos en la generación de lo que llamamos contaminación de datos. Repúblicas de Corea del Sur) etc.) que se publican en lo que sigue, el término "contaminación de datos" se toma para diferentes pares o servidores, "contaminación" o "distorciones" que pueden resultar campo de la tecnología de la información. 19 El primer significado del término, encontrado en documentos menos recientes SOURCE Ben-Shahar 2018: 133 RELEVANCE alta SOURCE Ben-Shahar 2018: 104 RELEVANCE medio COMMENT el nuevo significado del término, encontrado en literatura reciente Figura 10. Contextos de definición recuperados del corpus Aunque se encontraron varios contextos de definición, solo La segunda definición relevante para la redacción del registro de términos objetivo proviene de un libro blanco (Hasselbalch 2022), publicado posteriormente a una monografía (Hasselbalch 2021), donde se aborda la cuestión de la contaminación de datos en el marco de una iniciativa independiente. 15 Se considera que el contexto de la definición 3 y 4 es de relevancia media, ya que apuntan al significado original del término. En el siguiente paso, la adquisición de conocimientos sobre el concepto de contaminación de datos a través de corpus consistió en analizar las concordancias del término y, más específicamente, en identificar los KRC. El análisis de corpus nos permitió recuperar múltiples contextos de los que seleccionamos los más relevantes para la comprensión del término y su relación semántica con otros términos característicos de este discurso. Estos contextos también son útiles para proporcionar ejemplos sobre el uso del término. La figura 11 muestra una muestra de los KRC recopilados (con las partes seleccionadas en negrita para interactuar con los LLM, presentadas en la última sección): 1 KRC (Congreso de las Repúblicas de Corea del Sur) El reconocimiento de que la contaminación de datos es también un problema público que degrada todo un ecosistema y no simplemente las esferas individuales de los donantes de datos, ofrece una nueva y rica perspectiva sobre las soluciones los dos primeros se refieren al significado reciente ocurrido por el cambio semántico. Estos contextos de definición proporcionados en la comunicación de experto a experto son de gran relevancia para el diseño de registros de términos dirigidos. El primero es particularmente relevante ya que proviene de un documento publicado en las actas de una conferencia 2 KRC (Congreso de las Repúblicas de Corea del Sur) La información digital es el combustible de la nueva economía. Pero como el combustible de carbono de la vieja economía, también contamina. Las "emissiones de datos" perjudiciales se filtran en el ecosistema digital, perturbando las instituciones sociales y los intereses públicos. Este artículo desarrolla un nuevo marco de "contaminación de datos" para repensar los daños que crea la economía de datos y la forma en que existentes e introduce nuevas. tienen que ser regulados. internacional. 15 La Iniciativa de contaminación de datos y energía. Disponible en el siguiente enlace: https: www.datapollution.eu. 20 COMMENT the new meaning of the term, found in recent literature RELEVANCE high 3 KRC (Congreso de las Repúblicas de Corea del Sur) Por lo tanto, se pueden combinar dos usos tradicionales del término contaminación de datos. En primer lugar, la contaminación de datos puede entenderse como el impacto adverso en los entornos personales y sociales, por ejemplo, en los derechos individuales, como la protección de datos o el derecho a la vida privada, y en las instituciones ser causada por la creciente generación de datos que está transformando el entorno manera que parece no estar de acuerdo con la huella de big data. el término con sus SOURCE Hasselbalch 2022: 22 COMMENT the new meaning and the original meaning of the term, put in contrast RELEVANCE alto 4 KRC y el impacto ambiental adverso material de los grandes datos en estos entornos. Al como un tipo de impacto ambiental, sino más bien como los efectos adversos interrelacionados en los delicados equilibrios de nuestros ecosistemas y entornos naturales, sociales y personales. Como se ha descrito, el término contaminación de datos se utiliza actualmente para enfatizar lo muy real siguiente: el objetivo de un nuevo igual que en el libro blanco, la contaminación de datos se aborda de manera similar no solo "movimiento verde" para los grandes datos es la "sostenibilidad de los datos", que atraviesa los ODS con consideraciones de sostenibilidad conectadas a los diversos cambios ambientales causados por el volumen y la diversidad de los grandes datos, desde sus efectos en el paisaje natural hasta nuestras decisiones y democracia. SOURCE Hasselbalch 2022: 22–25 Comentario de la Comisión profesional, social y todo lo que se entiende como los efectos adversos materiales en capacidades o necesidades para obtener información relevante (295 caracteres) RELEVANCE alto Figura 11 El Consejo de Administración y el Consejo de Administración Recuperación de contextos ricos en conocimientos (KRC) en un corpus especializado Los KRC 1 a 4 ilustran el 16 término utilizado con un nuevo significado. En el siguiente paso, sobre la base de los contextos de definición recopilados y los KRC (Figuras 10-11), podemos hacer una propuesta de definición terminológica, presentada en la Figura 12: Proyecto de tipo específico de contaminación relacionada con las tecnologías de la nuestro entorno natural, por ejemplo, el carbono. El ejemplo muestra el enredo del nuevo información y la era digital democráticas y los equilibrios de poder. En segundo lugar, la contaminación de datos puede significado y el significado original de la vida diaria de los individuos y su entorno de una Nombre del autor, basado en Mori et al. 2024, Hasselbalch et al. 2022 y Ben16 También recogimos los KRC pertinentes que ilustran el primer significado del término para redactar el registro del término concurrente con el fin de vincular los dos registros y proporcionar una nota sobre el vínculo semántico entre los dos términos. 21 Shahar 2018 RELEVANCE alto objetivo búsqueda de KRC y referencias relevantes MODEL ChatGPT-4-turbo LIMIT 3 definiciones Figura 12. En esta etapa de nuestro análisis experimental, observamos un sesgo cognitivo: la restricción a interactuar con los LLM antes de finalizar el Los LLM. Introducir las herramientas GenAI en el proceso de análisis de términos Encontrar contextos ricos en conocimiento (KRC) y fuentes relevantes Primero probamos la capacidad de los LLM para encontrar contextos de definición. El objetivo era escribir un mensaje que devolviera los contextos de definición más relevantes en comillas seguidos de una referencia. Después de varios intentos, la técnica de estímulo ilustrada en la Figura 13 produjo resultados útiles. Sin embargo, no devolvió específicamente contextos de definición, lo que en el caso en cuestión no es sorprendente. El análisis basado en corpus mostró que los contextos de definición para la contaminación de datos son raros. El mensaje devolvió KRC útiles y referencias relevantes para el diseño del corpus. Al utilizar una combinación de instrucciones del sistema y instrucciones de retroceso, not only the results relevant for the new meaning of the term, but also in the desired format. By restricting the search to specific type of literature (scientific) and limiting obtenemos el número de definiciones a buscar (tres), restringimos LLM para producir la salida más relevante (ver instrucciones 2 en la Figura 13). Además, primero hicimos una pregunta para permitir que el LLM activara el conocimiento general (Prompt 1 en la Figura 13), antes de pedirle que encontrara los ejemplos más relevantes. La figura 13 presenta la prueba realizada en ChatGPT: análisis basado en el corpus se convirtió en un obstáculo ya que resultó requerir un auto-control sustancial. En el siguiente paso, introdujimos LLM para encontrar KRC y fuentes relevantes, redactar definiciones informadas por KRC, revisar definiciones de términos (humanos) y redactar definiciones a través de una interacción de "bucle" con DATE 13/05/2025 TECHNIQUE generación de datos que está Step-back prompting, system prompting cotidiana de los individuos PROMPT ¿Cuál es la 1 diferencia entre la "contaminación de datos" definida en estos términos "tipo específico de pollution related to information technologies and digital era characterised by the increasing transformando la vida profesional, social y 22 y su entorno de una manera que no parece estar de acuerdo con sus comparación de tablas lado a lado para mayor claridad? PROMPT las fuentes de cada definición encontrada. Devolver las definiciones datos" y "contaminación digital" están relacionados pero distintos de la lista con el resultado exacto Los términos "contaminación de en enfoque y capacidades. ¿o las necesidades de recuperación de la información Encuentre las tres definiciones más relevantes del término 1 ámbito de aplicación: La contaminación de los datos Foco: Los efectos perjudiciales de la recopilación, almacenamiento, procesamiento y uso de datos excesivos o mal gestionados. Principales preocupaciones: Sobrecarga de datos irrelevantes, sesgados o dañinos Costos ambientales y sociales de las infraestructuras de big data Impacto en la atención humana, la privacidad y la toma de decisiones Disrupción de los ecosistemas sociales e informativos Analogía: Comparable a la contaminación química […] Contaminación del entorno de la información con subproductos dañinos. La contaminación digital Enfoque: El impacto más amplio de las tecnologías digitales en el medio ambiente y los recursos. Principales preocupaciones: Consumo de energía y huella de carbono de dispositivos, servidores y redes Desechos electrónicos de hardware y dispositivos Impacto del ciclo de vida de la producción y eliminación de herramientas digitales Analogía: Comparable a la contaminación industrial: daños físicos y ecológicos causados por la infraestructura digital. Resumen de las diferencias La contaminación de los datos se refiere al contenido y a las consecuencias de los datos en sí mismos y a sus efectos socioambientales. La contaminación digital se refiere al costo ambiental de los sistemas digitales que almacenan, pertinente y la "contaminación digital"? La dirección URL. ¿Quiere una "contaminación de datos" en la literatura científica y proporcione transmiten y sacan información. La información digital es el combustible de la nueva economía. "emissiones de datos" perjudiciales se filtran en el ecosistema digital, perturbando las Pero al igual que el combustible de carbono de la vieja economía, 2 también contamina. Las instituciones sociales y los intereses públicos. Ben-Shahar O. 2018: Data Pollution 679, University of Chicago Public Law & Legal Theory Paper Series. Available at: La contaminación de datos es el impacto adverso interrelacionado que la generación, almacenamiento, manejo y procesamiento de datos digitales tiene en nuestro entorno natural, social y personal. Es el manejo, la distribución y la generación no sostenibles de los recursos de datos. […] Hasselbalch G. et al. 2022: Contaminación de datos y energía […] Libro blanco para un mundo sostenible https: www.researchgate.net Development Agenda on AI. Available at: publication2174889_Data_Pollution_PowerWhite_Paper_for_a_Global_Sustainable_Development_Agenda_Data_on_AI_Gry_by_Hasselbalch _with_contributions_from_the_Pollution_Power_PDP_Group_at_Bonn_Sustainable_AI - Laboratorio 23 El concepto de contaminación de datos incluye la contaminación de la información o la "influción" (Özdemir 2016), tal como fue acuñado por Oram 1984. Sin embargo, la contaminación de la información es diferente en cierta medida; "La contaminación de las fuentes de información con información irrelevante, redundante, no solicitada y de bajo valor" o como citan Cai y Zhang (1996): "... es un montón de mensajes generalizados pero no deseados y que un no un contexto de definición, un KRC, una cita, engañoso (consiste en dos definiciones de www.academia.edu.76896486 Data_Pollution_and_Taxation VANCE COM-1st no un contexto de día, estos mensajes podrían influir profundamente en la vida social con MENT 2o un contexto de definición, una cita, una fuente proporcionada y resultados negativos bien construidos". 3o contaminación de datos y impuestos 2022)." Disponible en: RELEhigh https: definición, un KRC, una cita, fuente proporcionada y bien construida otro término), fuente proporcionada pero mal construida, no un registro científico (registro académico) Figura 13 El Consejo de Administración y el Consejo de Administración Ingeniería rápida para la gestión de términos: encontrar KRC y referencias relevantes con ChatGPT Aunque solo se devolvió uno de los cuatro contextos de definición encontrados por el enfoque basado en corpus, junto con dos KRC, la salida es relevante para el análisis del concepto de contaminación de datos. En primer lugar, la salida muestra que el enfoque basado en el corpus no puede ser omitido para seleccionar los mejores contextos de definición y KRC, así como para evaluar eficazmente la salida del LLM. En segundo lugar, ChatGPT devolvió una fuente que no se identificó durante la fase de diseño del corpus. Aunque pertenece a un registro académico más 17 que científico, puede resultar útil en el análisis posterior de términos semánticamente relacionados, y ser utilizado para aumentar el corpus: el marcador discursivo ‚include‘ infiere que la contaminación de la información es un merónimo de contaminación de datos, y los marcadores ‚or‛ y las citas simples que infollución es un sinónimo de contaminación de la información. Sin embargo, esta tercera propuesta hecha por ChatGPT como contexto de definición es engañosa porque contiene dos definiciones de otro concepto (contaminación de la información) y ninguna definición del concepto buscado. Además, en un aviso anterior, utilizamos la misma instrucción sin especificar que la salida esperada son las cotizaciones, lo que resultó en cotizaciones reformuladas y datos engañosos (véase la Figura 24 en el Apéndice). Redacción de definiciones basadas en el KRC La siguiente prueba consistió en pedir a los LLM que redactaran una definición apoyada por una selección de KRC. Seleccionamos tres KRC: el contexto de definición 1 (en la figura 10) y los extractos de los KRC 1 y 4 (que aparecen en negrita en la figura 11). La figura 14 muestra este ensayo con ChatGPT, DeepSeek y Perplexity. ¿Qué es esto? 17 En el marco de ARTES, las disertaciones de maestría se consultan cuando faltan fuentes especializadas. En general, no se utilizan para la construcción de corpora especializados. Se consideran pertenecientes al registro académico en lugar del científico. 24 115b bG115a Definición DATE 13/05/2025 informada NIQUE 4. El por el KRC LIMIT 300 caracteres PROMPT Proyectar la definición terminológica del término "contaminación de datos" en no más de 300 caracteres sobre la base de estos contextos ricos en conocimientos: La contaminación de datos es el conjunto de daños generados por las actividades económicas relacionadas con la recopilación, almacenamiento y uso de datos, que impactan transversalmente en las personas y su entorno de vida. La contaminación de los datos es también un problema público que degrada a todo un ecosistema y no simplemente a las esferas individuales de los donantes de datos. La contaminación de datos se aborda no solo como un tipo de impacto ambiental, sino más bien como los efectos adversos interrelacionados en los delicados equilibrios de nuestros ecosistemas y entornos naturales, sociales y personales. El término contaminación de datos se utiliza actualmente para enfatizar el impacto ambiental adverso muy real y material de los grandes datos. MODEL ChatGPT-4-- turbo DeepSeek-V3 Perplejidad La contaminación de datos se refiere a los daños relacionadas con los datos, actividades económicas, la uso, que interrumpen la sociales, personales y adversos. Es un problema colectivo, con un entorno individuales que se más allá de la mera ambiental. las sistemáticos causados por como la recopilación, el recopilación, el degradación de los personales, afectando público, individual y adverso interconectado en extienden más allá de la privacidad de los individuos a preocupaciones. (298 caracteres) El número de caracteres que se indican en el cuadro siguiente es el número de caracteres que se indican en el cuadro siguiente: Características clave capturadas: 1.Daño sistémico […] Hace hincapié en la degradación a gran escala, no sólo en los efectos individuales. 2. Raíz económica […] Enlaces a la recopilación, almacenamiento y uso de datos. 3. Impacto transversal […] Afecta a los entornos naturales, sociales y para la redacción de las medidas TECH-Zero. número de miembros del Consejo de Administración de la Comisión es el número de miembros del Consejo de Administración de la Comisión. Más allá de la privacidad […] Posilas actividades económicas almacenamiento, las almacenamiento y el uso, y el ecosistemas naturales, tanto a través de temas ambiental más amplio, formas y efectos comparable a la tradicional toda la contaminación 25 personales como un problema ecológico o público. Esto se alinea con el encuadre de la adicional (por la elección de clara), con lenge. Hazme COM formulado MENT relativamente adecuadamente, claro, bastante formulado conciso contaminación de datos información mental y social adecuadamente, formulado inadecuadamente relativamente claro, bastante (dos enunciados), complejo como un enviconcise, con hipernímica que es menos saber si tienes alta alineación a KRC RELE alta alta baja TECH-Zero disparó como cualquier ajuste! ejemplos, bastante Figura 14 El Consejo de Administración y el Consejo de Administración Ingeniería rápida para la gestión de términos: redacción de definiciones informadas por KRC con ChatGPT, DeepSeek y Perplexity Los tres resultados parecen relevantes para la gestión de términos, y este método puede considerarse adecuado para redactar definiciones terminológicas con la ayuda de LLM. De hecho, el suministro de KRC guía a los LLM para producir una definición del significado recién emergente del término. Las salidas de ChatGPT y DeepSeek parecen más apropiadas, en comparación con Perplexity. En el apéndice, en la Figura 25, proporcionamos un ejemplo de los riesgos de usar instrucciones insuficientemente restringidas al administrar términos que sufren un cambio semántico with LLMs. Revising and improving bio-definition by LLMs En la siguiente prueba, pedimos a las herramientas GenAI que mejoraran la definición que redactamos sin la ayuda de herramientas de IA, sobre las bases de la información recopilada, a saber, varios KRC, y que proponemos llamar "bio-definición" (figura 15): Objetivo Mejorar la biodefinición DATE 13/05/2025 concisos VANCE NIQUE LIMIT 300 characters PROMPT Improve this definition of the term ‚data pollution‛: specific type of pollution related to Las tecnologías de la información y la era digital se caracterizan por la creciente generación de datos que están transformando la vida profesional, social y cotidiana de los individuos y su entorno de una manera que parece no estar de acuerdo con sus capacidades o necesidades para recuperar información relevante. 32 Para resaltar el doble significado del término, ARTES proporciona dos registros separados: uno para el significado original y otro para el recién emergente (Figura 21-22), y una extensa nota sobre los términos concurrentes (Figura 22). Figura 21. El número de personas que trabajan en el sector de la construcción es de La interfaz de ARTES DB que muestra los dos registros de contaminación de datos para distinguir el original del nuevo significado Figura 22 El número de personas que trabajan en el sector de la construcción es muy elevado. La interfaz de ARTES DB que muestra la entrada para la contaminación de datos 2, el concepto recién surgido, junto con la información sobre la contaminación de datos 1 definida como un término (y concepto) concurrente, incluida una nota explicativa Por último, la Figura 23 muestra los siguientes elementos del esquema concebido para crear una colección de instrucciones eficientes para la gestión de términos asistida por LLM en el marco de ARTES mediante un enfoque experimental: la página de inicio de la interfaz de recopilación de instrucciones, un campo de texto para registrar la instrucción diseñada, un campo de texto para proporcionar un ejemplo de la salida producida, el tamaño de salida requerido (en caracteres o palabras), una evaluación de la calidad de la instrucción (basada en la salida obtenida). 33 Figura 23. El número de personas que trabajan en el sector de la construcción es de Un esquema diseñado para crear una colección de instrucciones eficientes para la gestión de períodos asistida por LLM Observaciones de conclusión Este estudio ha explorado el potencial de integrar las herramientas GenAI en el análisis terminológico, específicamente para redactar registros de términos dentro de la base de conocimientos ARTES y el marco pedagógico utilizado para la enseñanza de terminología a estudiantes de máster en traducción en la Université Paris Cité. Seleccionamos el término contaminación de datos que exhibe cambio semántico, como estudio de caso, para realizar un análisis exploratorio y construir un protocolo para una interacción eficiente con LLM y herramientas GenAI. Este protocolo se está integrando ahora en el plan de estudios de formación en terminología dentro del programa de maestría. También realizamos una encuesta entre 50 estudiantes de maestría en traducción, que mostró que la mitad de los estudiantes están utilizando LLM para la redacción de registros semestrales, lo que aumenta aún más la necesidad de guiarlos en su uso eficiente. Los hallazgos experimentales de nuestro estudio destacan el valor de las herramientas corpus-lingüísticas en la asistencia al análisis terminológico, permitiendo la construcción y organización del conocimiento conceptual, así como la evaluación de la calidad de la salida de las herramientas GenAI. El protocolo diseñado para la integración de la IA en el análisis terminológico mostró que las herramientas de GenAI pueden ser útiles para revisar y mejorar las definiciones terminológicas biológicas, pero que la intervención humana es primordial. Estos hallazgos se alinean con trabajos recientes sobre la integración de la IA en la enseñanza y la investigación (cf. Kübler et al. 2024; Raus, Mattioda 2024; San Martín 2024; Kübler, Pecman 2025) y refuerzan las 34 recomendaciones clave que surgen de ellos, a saber, la necesidad de fomentar un enfoque crítico de las tecnologías de IA y desarrollar métodos eficientes para evaluar la producción generada por máquinas. Los hallazgos teóricos de nuestro estudio destacan el papel crucial de los análisis exploratorios en el panorama actual de las herramientas de IA en rápida evolución, particularmente en el diseño de esquemas efectivos para la integración de GenAI y LLM. En el centro de este proceso está la necesidad de un análisis humano preliminar. El dominio del conocimiento específico del dominio y los datos lingüísticos es esencial para evaluar la calidad de la salida de GenAI y para elaborar instrucciones efectivas para abordar las respuestas inexactas. En el contexto de la terminología, esto requiere conocimientos especializados en conceptos especializados y la aplicación de enfoques basados en corpus al análisis de términos. El cuerpo linguistics emerges as a key method for informed interaction with GenAI tools and prompt engineering. Un desafío notable que se encontró durante nuestro estudio fue el sesgo cognitivo introducido por limitar deliberadamente las interacciones de LLM, que exigía una considerable autodisciplina. En respuesta, el protocolo propuesto en este documento aboga por una integración secuencial de las herramientas GenAI en varias etapas de recuperación de información y análisis terminológico. Future research will focus on testing and refining this protocol with translation estudiantes en cursos de terminología. Nuestro objetivo es ampliar la metodología para cubrir todas las etapas de redacción de registros de términos, con el objetivo de mejorar la recuperación y generación de información terminológicamente relevante en interacción con las herramientas GenAI. Uno de los objetivos centrales del protocolo es desarrollar una colección curada de instrucciones altamente efectivas para la creación de registros de términos. Nuestro estudio ha sentado las bases para esto, al ofrecer un modelo para la construcción y evaluación inmediata, adaptado para abarcar diferentes modelos de lenguaje, tipos de tareas y conjuntos de datos lingüísticos, y que continuaremos probando, adaptando y refinando en estudios adicionales. REFERENCES Altameemi Yaser M. 2024: State-of-the-art Review of the Corpus Linguistics Field from the Beginning Until the Development of ChatGPT. – Theory and Practice in Language Studies 14(2), 423–431. Available at: https://doi.org/10.17507/tpls.1402.13. ARTES. Available at: https://artes.app.univ-paris-diderot.fr/artes-symfony/web/app.php. Ballier Nicolas, Cho Dahn, Faye Bilal, Ke Zong-You, Martikainen Hanna, Pecman Mojca, Wisniewski Guillaume, Yunès Jean-Baptiste, Zhu Lichao, Zimina-Poirot Maria 2021: The SPECTRANS System Description for the WMT21 Terminology Task. – ACL Rolling Review, a New Initiative of the Association for Computational Linguistics, 818– 825. Available at: http://www.statmt.org/wmt21/pdf/2021.wmt-1.80.pdf. Bénard Maud, Mestivier Alexandra, Kubler Natalie, Zhu Lichao, Bawden Rachel, de la Clergerie Eric, Romary Laurent, Huguin Mathilde, Nominé Jean-Francois, Peng Ziqian, Yvon François 2023: MaTOS: Traduction automatique pour la science ouverte [MaTOS: Machine Translation for Open Science]. – Actes de l'atelier 35 “Analyse et Recherche de Textes Scientifiques” (ARTS)@TALN 2023, 8–15. Available at: https://aclanthology.org/2023.jeptalnrecital-arts.2.pdf. Boonstra Lee 2025: Prompt Engineering. White paper. Available at: https://www.kaggle.com/whitepaper-prompt-engineering. Bourigault Didier, L’Homme Marie-Claude, Jacquemin Christian 2001: Recent Advances in Computational Terminology, Amsterdam/Philadelphia: John Benjamins. Bourigault Didier, Slodzian Monique 1999: Pour une terminologie textuelle [Towards a Textual Terminology]. – Terminologies nouvelles 19, 29–32. Casal J. Elliott, Kessler Matt 2023: Can Linguists Distinguish Between ChatGPT/AI and Human Writing? A Study of Research Ethics and Academic Publishing. – Research Methods in Applied Linguistics 2(3), 100068. Available at: https://doi.org/10.1016/j.rmal.2023.100068. ChatGPT, based on GPT-4-turbo, released on the 6th November 2023, OpenAI. Available at: https://chatgpt.com. Condamines Anne 2005: Linguistique de corpus et terminologie [Corpus Linguistics and Terminology]. – Langages 157. La terminologie: nature et enjeux, ed. L. Depecker, 36– 47. Condamines Anne 2022: Terminologie, Intelligence Artificielle et Psychologie cognitive: réflexions sur les interactions possibles dans l’étude de la variation en langues spécialisées [Terminology, Artificial Intelligence and Cognitive Psychology: Reflections on Possible Interactions in the Study of Variation in Specialised Languages]. – De Europa. European and Global Studies Journal, Special Issue on Multilingualism and Language Varieties in Europe in the Age of Artificial Intelligence, Università di Torino, 131–148. Condamines Anne, Rebeyrolle Josette 2001: Searching for and Identifying Conceptual Relationships via a Corpus-Based Approach to a Terminological Knowledge Base (CTKB). – Recent Advances in Computational Terminology, ed. D. Bourigault, M.- C. L’Homme, C. Jacquemin, Amsterdam/Philadelphia: John Benjamins, 127–148. Davies Mark 2025: Corpora and AI/LLM: Comparison of the Predictions of LLMs (ChatGPT and Gemini) to Actual Corpus Data (mainly from English-Corpora.org). White paper. Available at: https://www.english-corpora.org/ai-llms/english-corpora-with-aillms.pdf, alongside a video posted on the 18th of March 2025. Available at: https://youtu.be/WAzWoNzhZ9A?si=JT6TAhOMLkXjUoa4. DeepSeek, based on DeepSeek-V3-0324, 深度求索 (DeepSeek). Available at: https://chat.deepseek.com. EMT Competence Framework 2022. Available at: https://commission.europa.eu/system/files/202211/emt_competence_fwk_2022_en.pdf. 36 Falgas Julien, Robert Pascal 2023: Présenter l’IA comme une évidence, c’est empêcher de réfléchir au numérique (repris sur le titre: Comment le discours médiatique sur l’IA empêche d’envisager d’autres possibles) [Presenting AI as a Fact Prevents Reflection on Digital Technologies (based on the title: How Media Discourse on AI Prevents Considering Other Possibilities)]. – The conversation, 19 octobre 2023. Available at: https://theconversation.com/comment-le-discours-mediatique-sur-lia-empechedenvisager-dautres-possibles-211766. Finardi Kyria 2023: The Paradox of our Time and Role of Applied Linguists in it: Conférence donnée à l’occasion du webinaire 2023 de l’AFLA. Available at: http://www.aflaasso.org/webinaire-2023. Gledhill Christopher, Kübler Natalie 2015: How Trainee Translators Analyse LexicoGrammatical Patterns. – Journal of Social Sciences 11(3): Special issue on Phraseology, Phraseodidactics and Construction Grammar(s), ed. M. I. González-Rey, 162–178. Humbley John 2022: The Reception of Wüster’s General Theory of Terminology. – Theoretical Perspectives on Terminology: Explaining Terms, Concepts and Specialized Knowledge, ed. P. Faber, M.-C. L’Homme, Book coll. ‚Terminology and Lexicography Research and Practice‛, Amsterdam/Philadelphia: John Benjamins, 15–36. IATE. Available at: http://iate.europa.eu. IGI Global Dictionary. Available at: https://www.igi-global.com/dictionary. ISO – TC 37 Language and Terminology – ISO Standard 1087:2019(en) Terminology Work and Terminology Science: Vocabulary. Available at: https://www.iso.org/obp/ui/#iso:std:iso:1087:ed-2:v1:en. ISO – TC 37 Language and Terminology – ISO Standard 704:2022(en) Terminology Work – Principles and Methods. Available at: https://www.iso.org/obp/ui/en/#iso:std:iso:704:ed-4:v1:en. ISO/TC 37/SC 3/WG 6 Terminology Management and Artificial Intelligence – ISO Standard 5078:2025(en) Management of Terminology Resources – Terminology Extraction. Available at: https://www.iso.org/obp/ui/en/#iso:std:iso:5078:ed1:v1:en. ISO/TC 37/SC 3/WG 6 Terminology Management and Artificial Intelligence – ISO Standard 12620-1:2022 Management of Terminology Resources – Data Categories – Part 1: Specifications. Available at: https://www.iso.org/obp/ui/en/#iso:std:iso:12620:-1:ed-1:v1:en. Kilgarriff Adam, Baisa Vít, Bušta Jan, Jakubíček Miloš, Kovář Vojtěch, Michelfeit Jan, Rychlý Pavel, Suchomel Vít 2014: The Sketch Engine: Ten Years On. – Lexicography 1, 7–36. 37 Kübler Natalie, Martikainen Hanna, Mestivier Alexandra, Pecman Mojca 2024: Post-editing Neural Machine Translation in Specialised Languages: the Role of Corpora in the Translation of Phraseological Structures. – Recent Advances in Multiword Units in Machine Translation and Translation Technology, ed. I. J. Monti, G. Corpas Pastor, R. Mitkov, C. Manuel Hidalgo-Ternero, Current Issues in Linguistic Theory 366, Amsterdam/Philadelphia: John Benjamins, 57–78. Kübler Natalie, Pecman Mojca 2012: The ARTES Bilingual LSP Dictionary: from Collocation to Higher Order Phraseology. – Electronic Lexicography, ed. S. Granger, M. Paquot, Oxford: Oxford University Press, 187–209. Kübler Natalie, Pecman Mojca 2025: Corpus Linguistics: a Dinosaur or an Elephant in the IA Room? A Word from Terminology and Translation Studies Perspective: Phd Seminar – Winter school – Foreign Literatures and Languages school, 5–6 February 2025, Università di Verona, Italy. Leonardi Natascia 2025: Terminology Science, International Languages, and Knowledge Communication. – Terminology Throughout History. A discipline in the Making, ed. K. Warburton, J. Humbley, Terminology and Lexicography Research and Practice 24, Amsterdam/Philadelphia: John Benjamins Publishing Company, 148– 166. L’Homme Marie-Claude 2024a: Managing Polysemy in Terminological Resources. – Terminology 30(2), 216–249. L’Homme Marie-Claude 2024b: Seven Good Reasons for a Better Account of Fine-grained Polysemy in Terminological Resources. – Terminologija 31, 6–23. Available at: https://journals.lki.lt/terminologija/article/view/2407/2408. Lombard Alizée, Huyghe Richard, Barque Lucie, Gras Doriane 2023: Regular Polysemy and Novel Word-sense Identification. – The Mental Lexicon 18(1), 94–119. Lommel Arle 2024: The Rise of Large Language Models Informed by not so Large Corpora of Training Data. – Digital Translation 11/1, 73–84. Available at: https://doi.org/10.1075/dt.24006.lom. Meyer Ingrid 2001: Extracting Knowledge-Rich Contexts for Terminography: A Conceptual and Methodological Framework. – Recent Advances in Computational Terminology, ed. D. Bourigault, Ch. Jacquemin, M.-C. L’Homme, Amsterdam/Philadelphia: John Benjamins, 279–302. Meyer Ingrid, Bowker Lynne, Eck Karen 1992: Cogniterm: An Experiment in Building a Terminological Knowledge Base. – Proceedings of 5th EURALEX International Congress on Lexicography, Tampere, Finland. Tampere: Studia Translatologica, 159– 172. Michel Jean-Baptiste, Shen Yuan Kui, Aiden Aviva Presser, Veres Adrian, Gray Matthew K., Brockman William, The Google Books Team, Pickett Joseph P., Hoiberg Dale, 38 Clancy Dan, Norvig Peter, Orwant Jon, Pinker Steven, Nowak Martin A., Aiden Erez Lieberman 2011: Quantitative Analysis of Culture Using Millions of Digitized Books. – Science 331(6014), 176–82. Available at: https://pubmed.ncbi.nlm.nih.gov/21163965. Pecman Mojca 2012: Tentativeness in Term Formation: a Study of Neology as a Rhetorical Device in Scientific Papers. – Neology in Specialized Communication, ed. M. Teresa Cabré Castellví, Rosa Estopá Bagot, Maria C. Vargas Sierra. – Special issue of Terminology 18(1), 27–58. Pecman Mojca 2014: Variation as a Cognitive Device: How Scientists Construct Knowledge Through Term Formation. – Terminology 20(1), 1–24. Pecman Mojca 2018: Langue et construction de connaisSENSes. Energie lexico-discursive et potentiel sémiotique des sciences [Language and the Construction of Meaning and Knowledge: Lexico-Discursive Energy and the Semiotic Potential of Science]: monographie, préface de M.-C. L’Homme. Paris: Editions L’Harmattan. Pecman Mojca 2021: 10th Anniversary of the ARTES Terminological and Phraseological Database. – Svijet od riječi: terminološki i terminografski ogledi (“The world of words: Terminological and terminographic discussions), ed. I. Brač, A. Ostroški Anić, Izdavalacko izdanje Instituta za hrvatski jezik i jezikoslovlje (Publication of the Institut of Croatian language and linguistics, Zagreb), 301–324. Pecman Mojca, Kübler Natalie 2011: ARTES: An Online Lexical Database for Research and Teaching in Specialized Translation and Communication. – Proceedings from International Workshop on Lexical Resources (WoLeR) 2011 at ESSLLI, 1–5 August 2011, Ljubljana, Slovenia, 87–93. Available at: http://alpage.inria.fr/~sagot/pub/WoLeR_2011_proceedings.pdf. Pecman Mojca, Kübler Natalie 2022: Text Genres and Terminology. – Theoretical Perspectives on Terminology: Explaining Terms, Concepts and Specialized Knowledge, ed. P. Faber, M.-C. L’Homme, Book coll. Terminology and Lexicography Research and Practice, Amsterdam/Philadelphia: John Benjamins, 263–289. Perplexity, based on GPT-4o/Claude 4.0 Sonnet, released on the 6th of May 2025, Perplexity AI. Available at: https://www.perplexity.ai. Ptasznik Bartosz, Robert Lew 2025: Dictionaries Versus AI Tools Through the Eyes of English Majors: International Journal of Lexicography 38(2), 140–158. Available at: https://doi.org/10.1093/ijl/ecaf005. Rastier François 2021: Data vs corpora. – L’intelligence artificielle des textes. Des algorithmes à l’interprétation [The Artificial Intelligence of Texts: From Algorithms to Interpretation] 15, ed. D. Mayaffre, L. Vanni, coll. Lettres numériques, Paris: Éditions Honoré Champion, 203–246. 39 Raus Rachele, Mattioda Maria Margherita 2024: L’intelligence artificielle en salle de classe: la perception des étudiantes et des étudiants [Artificial Intelligence in the Classroom: Students’ Perceptions]. – Multilinguisme européen et IA: entre droit, traduction et didactique des langues/Multilinguismo europeo e IA tra diritto, traduzione e didattica delle lingue/European Multilingualism and Artificial Intelligence: The Impacts on Law, Translation and Language Teaching, ed. R. Raus, F. Bisiani, M. M. Mattioda, M. Tonti, De Europa, Special Issue, 221–231. Renouf Antoinette 2020: Semantic Neology. Challenges in Matching Corpus-based Semantic Change to Real-world Change. – Corpora and the Changing Society. Studies in the Evolution of English, ed. P. Rautionaho, A. Nurmi, J. Klemola, Amsterdam/Philadelphia: John Benjamins, 79–112. Riehmann Patrick, Gruendl Henning, Potthast Martin, Trenkmann Martin, Stein Benno, Fröhlich Bernd 2012: WORDGRAPH: Keyword-in-Context Visualization for NETSPEAK’s Wildcard Search. – IEEE Transactions on Visualization and Computer Graphics 18(9), 1411–1423. Available at: https://downloads.webis.de/publications/papers/riehmann_2012.pdf. San Martín Antonio P. 2024: What Generative Artificial Intelligence Means for Terminological Definitions. – Proceedings of the 3rd International Conference on Multilingual Digital Terminology Today (MDTT 2024), Granada: CEUR-WS. Available at: https://ceur-ws.org/Vol-3703/paper1.pdf. de Schryver Gilles-Maurice 2023: Generative AI and Lexicography: The Current State of the Art Using ChatGPT. – International Journal of Lexicography 36(4), 355–387. Schulhoff Sander, Michael Ilie, Nishant Balepur, Konstantine Kahadze, Amanda Liu, Chenglei Si, Yinheng Li, Aayush Gupta, HyoJung Han, Sevien Schulhoff, Pranav Sandeep Dulepet, Saurav Vidyadhara, Dayeon Ki, Sweta Agrawal, Chau Pham, Gerson Kroiz, Feileen Li, Hudson Tao, Ashay Srivastava, Hevander Da Costa, Saloni Gupta, Megan L. Rogers, Inna Goncearenco, Giuseppe Sarli, Igor Galynker, Denis Peskoff, Marine Carpuat, Jules White, Shyamal Anadkat, Alexander Hoyle, Philip Resnik 2025: The Prompt Report: A Systematic Survey of Prompt Engineering Techniques. Available at: https://arxiv.org/pdf/2406.06608. Termium Plus. Available at: https://www.btb.termiumplus.gc.ca. UNTERM. Available at: https://unterm.un.org/unterm2/en. Vezzani Federica, Di Nunzio Giorgio, Maria Costa Rute 2023: ISO Standards for Terminology Resources Management. Are They FAIR Enough? – Digital Translation 10/2, Amsterdam/Philadelphia: John Benjamins, 233–252. Available at: https://doi.org/10.1075/dt.00009.vez. Vitrine Linguistique. Available at: https://vitrinelinguistique.oqlf.gouv.qc.ca. 40 Wilkinson Mark D., Dumontier Michel, Aalbersberg IJsbrand Jan, Appleton Gabrielle 2016: The FAIR Guiding Principles for Scientific Data Management and Stewardship. – Scientific Data 3, 160018. Available at: https://doi.org/10.1038/sdata.2016.18. WIPO. Available at: https://wipopearl.wipo.int/fr/linguistic. Wüster Eugen 1968: The Machine Tool./La Machine-Outil. An Interlingual Dictonary of Basic Concepts Comprising an Alphabetcal Dictonnary and a Classified Vocabulary With Definitons and Illustrations: English-French Master Volume, Londres, Technical Press. Aslib, 173 p. Zhu Lichao, Zimina Maria, Bénard Maud, Namdar Behnoosh, Ballier Nicolas, Wisniewski Guillaume, Yunès Jean-Baptiste 2023: Investigating Techniques for a Deeper Understanding of Neural Machine Translation (NMT) Systems Through Data Filtering and Fine-tuning Strategies. – Proceedings of the Eighth Conference on Machine Translation, Singapore, Association for Computational Linguistics, 275–281. References of the texts on data pollution (used for the corpus and/or appearing in the outputs of GenAI tools) Ben-Shahar Omri 2018: Data Pollution. – University of Chicago Public Law & Legal Theory Paper Series 679, 104–159. Cao Yinzhi, Fangxiao Yu Alexander, Aday Andrew, Stahl Eric, Merwine Jon, Yang Junfeng 2018: Efficient Repair of Polluted Machine Learning Systems via Causal Unlearning. – Proceedings of 2018 ACM Asia Conference on Computer and Communications Security, Incheon, Republic of Korea, 4–8 June 2018 (ASIA CCS ’18). Castelluccia Claude, Kaafar Mohamed Ali 2009: Owner-Centric Networking (OCN): Toward a Data Pollution-Free Internet. – Proceedings of the 2009 Ninth Annual International Symposium on Applications and the Internet, 169–172. Gertsen Fred 2022: Data Pollution and Taxation: Master’s Thesis, Executive Master Cyber Security, Defended on the 31st of March 2022, Universiteit Leiden, Netherlands. Hasselbalch Gry 2021: Data Ethics of Power: A Human Approach in the Big Data and AI Era, Glos (UK): Edward Elgar. Hasselbalch Gry 2022: Data Pollution & Power, White Paper for a Global Sustainable Agenda on AI, The Sustainable AI Lab, Bonn University. Mori Leonardo, Francey Alizée, Mettler Tobias 2024: Data Pollution: Definition and Policy Responses. – Proceedings of the 16th IFIP WG 8.5 International Conference, Electronic Participation (ePart 2024), Ghent, Belgium, September 3–5 2024, 147–162. Zimmerli Walther Ch. 1986: Who is to Blame for Data Pollution? On Individual Moral Responsibility With Information Technology. – Philosophy and Technology II: 41 Information Technology and Computers in Theory and Practice, ed. C. Mitcham, A. Huning, Dordrecht/Boston: D. Reidel, 291–305. APPENDIX Figure 24 shows a prompt without the specification ‚with the exact wording found in the texts‛, and the output consisting of two erroneous, made-up contexts, where the definition of information pollution is credited to data pollution. Nevertheless, the proposal by ChatGPT that ‚data pollution encompasses the contamination of information sources…‛, can be regarded as true, if we take into account the semantic relation between data pollution and information pollution revealed by the discursive marker of meronymy ‚encompasses‛, and according to which information pollution is a part of data pollution. The reformulation by LLMs ‚The concept of data pollution includes information pollution‛ into ‚data pollution encompasses [definition of information pollution] …‛ is respectful of knowledge representation. However, in terminological analysis, it is paramount to distinguish semantically related terms, all the more so when they are near-like synonyms. GOAL Finding definitional contexts and their references MODEL ChatGPT-4-turbo DATE 13/05/2025 TECHNIQUE System prompting LIMIT 3 definitions PROMPT Find three most relevant definitions of the term ‚data pollution‛ in scientific literature and provide the sources for each definition found. Return the definitions in the list followed by the bibliographical reference of the source and its URL. OUTPUT Data pollution refers to the harmful ‚data emissions‛ leaked into the digital ecosystem, disrupting social institutions and public interests. This concept rethinks the harms the data economy creates and the way they have to be regulated. Ben-Shahar O. 2018: Data Pollution 679, University of Chicago Public Law & Legal Theory Paper Series. Available at: https://chicagounbound.uchicago.edu/public_law_and_legal_theory/699 Data pollution is the interrelated adverse impact that the generation, storing, handling, and processing of digital data has on our natural environment, social environment, and personal environment. It is the unsustainable handling, distribution, and generation of data resources. Hasselbalch G. et al. 2022: Data Pollution & Power - White Paper for a Global Sustainable Development Agenda on AI. Available at: https://www.researchgate.net/publication/362174889_Data_Pollution_Power__White_Paper_for_a_Global_Sustainable_Development_Agenda_on_AI_by_Gry_Hasselbalc h_with_contributions_from_the_Data_Pollution_Power_DPP_Group_at_Bonn_Sustainable_ AI_Lab