scieee AI-readable full text Open interactive document viewer

La elaboración de corpus lingüísticos

Santalla del Río, María Paula

Abstract

En este trabajo se comienza con una aproximación a la definición de corpus lingüístico y se realiza a continuación un recorrido por las fases de elaboración del mismo: el diseño del corpus, la adquisición de los datos, su codificación y su anotación.

Full text

La elaboración de corpus lingüísticos María Paula Santalla del Río Universidad de Santiago de Compostela 0. RESUMEN 1. Definición de corpus 2. Diseño de corpus 2.1. Tamaño del corpus 2.2. Límites y proporciones temporales, geográficos, lingüísticos y de niveles de lengua 2.3. Temática y forma 3. Adquisición de los datos 3.1. Corpus textuales 3.2. Corpus orales 3.2.1. Transcripción ortográfica 3.2.2. Transcripción fonética 4. Codificación del corpus 4.1. Documentación del corpus y de los textos 4.2. Esquema de referencia 4.3. Esquema de representación textual 5. Anotación lingüística 5.1. Anotación ortográfica 5.2. Anotación fonética, fonológica o prosódica 5.3. Anotación morfosintáctica 5.4. Anotación sintáctica 5.5. Anotación semántica 5.6. Anotación discursiva 5.7. Anotación morfosintáctica en detalle 5.7.1. El esquema de anotación 5.7.2. El proceso de etiquetación 6. Ejercicios BIBLIOGRAFIA 0. Resumen La presente contribución comienza con una aproximación a la definición de corpus lingüístico y realiza un recorrido por las fases de elaboración del mismo: el diseño del corpus, la adquisición de los datos, su codificación y su anotación. 1. Definición de corpus Aunque atendiendo a diversos investigadores puedan apreciarse diferencias en cuanto a la concepción de lo que es un corpus, si sacamos factor común de un subconjunto, creemos que significativo, de las varias definiciones propuestas, podemos —así lo haremos en este trabajo— asumir la siguiente definición: un corpus es un conjunto de textos de lenguaje natural e irrestricto, almacenados en un formato electrónico homogéneo, y seleccionados y ordenados, de acuerdo con criterios explícitos, para ser utilizados como modelo de un estado o nivel de lengua determinado, en estudios o aplicaciones relacionados en mayor o menor medida con el análisis lingüístico. Veamos ahora de un modo un poco más detallado cada uno de los elementos que configuran esta definición: 1. Textos de lenguaje natural e irrestricto: esto es, textos que recojan emisiones genuinas de los hablantes en las situaciones comunicativas en que se encuentren1 (el libro escrito por un autor literario, el texto de una noticia leída por un locutor, la transcripción de una entrevista o conversación, etc.). 2. Textos en un formato electrónico homogéneo: aunque, en sentido estricto, había corpus, y ya se utilizaban en la investigación lingüística, antes de haber ordenadores, la irrupción de la informática ha tenido tal repercusión en el volumen, la organización y la explotación de los datos —permitiendo el acceso a la información de manera cada vez más sofisticada (concordancias, colocaciones, etc.)— de que podemos disponer en un corpus que hoy los corpus son, necesariamente, corpus electrónicos2. En ellos, además, los textos que los integran se guardan en un formato compartido, de manera que es posible acceder a toda la información extraíble del corpus como si todos los textos fueran sólo uno. 3. Textos seleccionados y ordenados, de acuerdo con criterios explícitos, para ser utilizados como modelo de un estado o nivel de lengua determinado, en estudios o aplicaciones relacionados en mayor o menor medida con el análisis lingüístico: es decir, que los corpus responden a un diseño preconcebido, porque han de ser representativos, esto es, deben reflejar fielmente el uso de lengua del que pretenden ser modelo, de modo que puedan ser útiles para la función para la que se han creado. Si esta función es la pura investigación lingüística, la descripción basada en la observación3 del corpus debe, obviamente, poder proponerse como descripción, no del corpus, sino del uso lingüístico del que éste pretende ser representativo. Si, en cambio, la función para la que se ha creado el corpus es una aplicación concreta (corpus para entrenar sistemas de síntesis o reconocimiento de habla, corpus para entrenar sistemas de clasificación o redireccionamiento de documentos, etc.), dicha aplicación deberá comportarse adecuadamente no sólo ante las propias secuencias del corpus, sino ante otras secuencias que, aunque correspondientes al mismo uso lingüístico del que el corpus pretende ser ilustrativo, puedan producirse en las situaciones reales en las que la aplicación en cuestión tenga que trabajar, secuencias que no estarán, como tales, contenidas en el corpus. El grado en que un corpus es representativo con respecto al uso lingüístico del que se pone como modelo es, de todos modos, y como puede deducirse de lo anterior, una cuestión que no se cierra tras el primer proceso de elaboración del corpus: es, de hecho, la utilización del mismo por sus usuarios lo que habrá de determinar en qué medida el corpus es representativo, sugiriendo las correcciones que pueden mejorarlo en este sentido. 2. Diseño de corpus El diseño del corpus es la primera fase de su elaboración. Sobre ella, y enlazando con lo dicho al final del párrafo anterior, podemos comenzar afirmando lo siguiente: cuanto más acotado sea el estado o nivel de lengua del que pretendemos que el corpus sea representativo, menos esfuerzo tendremos que poner en su diseño, y a la inversa, cuanto menos acotado sea el nivel de lengua del que pretendemos que el corpus sea representativo, más esfuerzo tendremos que poner en el diseño del mismo. Lo más o menos acotado que sea el estado o nivel de lengua del que pretendemos que el corpus sea representativo, por otra parte, depende de la finalidad con la que lo elaboremos. Así, si, por ejemplo, vamos a utilizar un corpus para entrenar un servicio de conexión automática con un número de teléfono dicho por un usuario, necesitaremos un corpus que registre cómo suenan por teléfono los números dichos por muchas personas muy diferentes (en edad, sexo, etc.), y a esto será, prácticamente, a lo que se reducirá la fase de diseño del corpus. En casos como éste, en los que la finalidad para la que se construye el corpus es muy concreta, suele ocurrir que, en la práctica, son los propios usuarios del corpus quienes lo elaboran, de manera que coinciden las figuras del desarrollador y el usuario del corpus. Si, en cambio, lo que queremos es construir un corpus para poner al alcance de la comunidad investigadora en lengua española datos reales que les sirvan para contrastar sus hipótesis acerca de cómo funciona el español actual, necesitaremos un corpus lingüístico muy amplio, que recoja datos equilibradamente proporcionados de las distintas variedades, idealmente de todo tipo (geográficas, sociales y estilísticas) del español utilizado para hablar de toda clase de cosas: la fase de diseño del corpus tendrá que determinar i) el tamaño del corpus en general, ii) qué partes deben integrarlo (teniendo en cuenta los referidos parámetros geográfico, social, estilístico y temático) y en qué proporciones, y iii) qué textos en concreto se seleccionarán y en qué condiciones entrarán a formar parte del corpus, es decir, si se incluirán los textos íntegros o muestras de los mismos, y en este último caso de qué longitud. En planteamientos como éste, en los que lo que se pretende es construir corpus de propósito general, quienes elaboran el corpus lo hacen para ponerlo a disposición de usuarios distintos, en principio, de ellos mismos: las figuras del desarrollador y el usuario del corpus, pues, no coinciden, al contrario de lo que ocurría en el planteamiento anterior. Para los propósitos de este trabajo, nos situaremos en una situación del tipo de la segunda de las dos mencionadas, ya que es un entorno semejante el que requiere la inversión de más esfuerzo durante la fase de diseño del corpus: los aspectos concretos a los que en planteamientos como éste vemos que el diseño del corpus concierne son los que examinamos en las subsecciones siguientes. 2.1. Tamaño del corpus En primer lugar, tamaño total del corpus: en general, se ha asumido, dadas las posibilidades de recopilación, manipulación y explotación hoy existentes, que «cuanto más grande, mejor». Sin embargo, concebir un corpus sin delimitar su extensión, dejándolo crecer constantemente, aunque sea guardando las proporciones entre sus partes, acaba por tener consecuencias negativas tanto para el mantenimiento del corpus como para su explotación (pues sabemos que el desbordamiento de información acaba por asimilarse a la carencia de ella), por lo que la aproximación habitual hoy es la de elaborar corpus monitor, esto es, corpus que mantienen un volumen textual constante, pero en continua actualización —así, el conjunto de textos que componen un corpus monitor se va renovando cada cierto tiempo, de manera que siempre se van incluyendo nuevos textos a la vez que se van excluyendo otros, que suelen pasar, por su parte, a engrosar un corpus diacrónico. El problema, en consecuencia, pasa ahora a ser determinar cuál debe ser el «volumen textual constante» que deben tener los corpus monitor. Este problema permanece sin resolver. Sin duda no puede ser resuelto de modo general: no puede haber un número de palabras que sea adecuado para todos los corpus que puedan concebirse, ya que dicho número dependerá, obviamente, de la función para la que se elabore el corpus. Pero es que ni siquiera puede ser resuelto para cada corpus en concreto, porque, en efecto, nunca podemos estar seguros de que, aún en su ámbito, un hablante nativo no pueda encontrar que falta en un corpus algo que intuitivamente habría esperado encontrar en él —lo cual, siendo una afirmación (quizás la única que se ha dado) razonable a la hora de enfrentarse al problema de la determinación del tamaño que debe corresponder a un corpus, no constituye una solución práctica al problema (ya que no permite, mediante una fórmula, calcular el tamaño ideal del corpus), sino que, siendo una definición por negación, permanece en el nivel de la teoría. En segundo lugar: cantidad de texto que se recoge de cada documento: si se recogen íntegramente todos los textos de los documentos que los constituyen, tenemos corpus textuales, si se recogen fragmentos de esos textos, tenemos corpus de referencia. La idoneidad de una aproximación u otra ha sido tradicionalmente objeto de polémica: por un lado, los textos enteros hacen al corpus más apto para el estudio de ciertos aspectos lingüísticos, y además evitan los problemas de las posibles diferencias que puede haber entre distintas partes de un texto, que podrían desequilibrar el corpus; pero, por otro lado, a corto plazo es más fácil obtener un corpus equilibrado a partir de fragmentos de textos que de textos enteros. Evidentemente, si se decide elaborar un corpus de referencia, es muy importante en la fase de diseño del corpus el determinar cómo se seleccionan las partes de los textos que van a formar parte del corpus, y cuál va a ser su extensión: que sepamos, lo primero se ha hecho al menos de tres modos distintos: a) al azar, b) dividiendo los textos en partes similares (generalmente tres) y extrayendo de cada una de ellas porciones semejantes, y c) decidiendo, a partir de la estructura externa del texto, qué elementos jerárquicos se tendrán en cuenta (capítulos, apartados, párrafos, etc.) y qué se tomará de cada uno o de una selección de los mismos. En cuanto a la extensión de las muestras tomadas de cualquiera de estos modos, las unidades consideradas son bien las palabras bien las oraciones (entendidas como conjuntos de palabras comprendidos entre puntuación mayor), y la cantidad de unas u otras que de hecho se ha decidido tomar ha sido en los corpus que conocemos hasta ahora muy variable (entre 2.000 y 70.000 palabras). En cualquier caso, y por razones obvias, se suele respetar el que las muestras empiecen y terminen con punto y aparte. 2.2. Límites y proporciones temporales, geográficos, lingüísticos y de niveles de lengua En el caso de los límites y proporciones temporales, se trata de determinar una fecha de inicio y una de final entre las cuales deben haber sido escritos o emitidos los documentos recogidos en el corpus, así como de determinar si las fechas se van a referir a los documentos originales o a posibles copias transmisoras. Si en el período temporal abarcado se distinguen diferentes épocas (por ejemplo, en corpus diacrónicos) hay que determinar qué volumen de textos se recogerá de cada una de ellas. En el caso de los límites y proporciones geográficos, se trata obviamente de determinar las variedades diatópicas de lengua que estarán representadas en el corpus y en qué porcentajes: si emprendemos, por ejemplo, la elaboración de un corpus del español, debemos decidir previamente si, y en qué porcentajes, vamos a incluir textos de distintas zonas de la península, de Canarias o de distintas zonas de América. En el caso de los límites lingüísticos, nos referimos a qué lenguas estarán representadas en el corpus, porque aparte de los corpus monolingües, se pueden elaborar corpus paralelos, que recogen textos escritos originalmente en las distintas lenguas representadas en el corpus, así como sus traducciones a las restantes, corpus comparables, que recogen textos originalmente escritos en cada una de las distintas lenguas representadas en el corpus, cuidando de que esos textos sean de características similares en cuanto a nivel de lengua y temática abordada, y corpus simplemente multilingües, que recogen textos en las distintas lenguas representadas en el corpus sin que esos textos sean unos traducciones de otros y sin establecer en ellos ningún criterio de selección temático o de nivel de lengua. En el caso de los niveles de lengua, nos referimos en sentido amplio a cómo estará compuesto el corpus atendiendo a parámetros relacionados tanto con las características de los interlocutores (grupo social, edad) como, y especialmente, con la situación comunicativa (corpus escritos/orales o ambos, registros coloquial/culto/lenguaje especializado). 2.3. Temática y forma Obviamente, por lo primero, nos referimos a de qué se habla en el corpus (historia, arte, religión, cocina, deporte, vida cotidiana, etc.), y por lo segundo, a en qué forma se habla de ello (prosa literaria, poesía, prosa periodística, entrevista personal, debate, exposición individual, etc.). En conclusión, todo corpus debe proponerse ser representativo, esto es, estar equilibrado respecto a toda la variedad de cualquier tipo (temporal, geográfica, lingüística, de nivel de lengua, temática y forma) de la que, para ser útil para la finalidad para la que es recogido, debe dar cuenta. Y es el grado de consecución de esa finalidad (cómo funciona, de hecho, la aplicación telefónica de nuestro primer ejemplo, o en qué grado obtienen los usuarios los datos que buscan en nuestro segundo ejemplo) lo que dará la medida de hasta dónde se ha construido un corpus apto para tal finalidad, y proporcionará asimismo las directrices para el desarrollo y la transformación progresiva, en sucesivas aproximaciones, del corpus en cuestión. Finalmente, en esa búsqueda del «corpus idealmente representativo» para una determinada finalidad, tenemos que contar con la «cruda realidad»: los medios humanos (no deberíamos, por ejemplo, decidir hacer un corpus de un tamaño para el que con los medios humanos con los que contamos no podemos garantizar determinada calidad) y técnicos (hardware y software: no tendría sentido, por ejemplo, proponerse elaborar un corpus de un tamaño o un detalle en cuanto a diseño que no pudiera ser manejado fluidamente por el hardware y el software al que luego se podrá acceder) con los que cuenta el equipo (si es que se cuenta con un equipo) que desarrollará el corpus en cuestión, así como la disponibilidad real (¿contamos previamente con los documentos electrónicos?) y legal (en cualquier caso, ¿están protegidos esos documentos por derechos de autor?, ¿qué dice la legislación vigente en nuestro país y en el país de origen de cada documento respecto a una utilización como la que pretendemos hacer de él?) de los textos. 3. Adquisición de los datos 3.1. Corpus textuales Las principales vías para la captación de textos escritos en un corpus son bien conocidas: i) Aprovechamiento de textos codificados en sistemas de fotocomposición utilizados por las imprentas. Estos textos incluyen los códigos, referentes a la presentación tipográfica del texto (tipo de letra y justificación horizontal), a los símbolos utilizados en el texto que no están previstos en las tablas ASCII y a la justificación vertical, utilizados por la imprenta en cuestión, y es necesario manipularlos, bien para eliminarlos, bien para aprovechar la información que puedan aportar. El problema fundamental es que, al no existir un estándar de codificación generalizado para los sistemas de fotocomposición, cada imprenta, y en cada texto, utiliza códigos distintos, lo que obliga a tratar cada texto en particular. ii) Utilización de un escáner para convertir en una imagen texto impreso en papel, y de un programa de reconocimiento automático de caracteres para convertir esa imagen de texto en un texto electrónico manipulable. Se trata de escanear un texto página a página, obteniendo de cada una de ellas una imagen, y de luego procesar esa imagen con un programa que interpreta los caracteres que aparecen en ella, y devuelve un texto electrónico que ya podemos manipular como tal. iii) Textos en formato electrónico. Textos generalmente para su distribución en la web a través de Internet. Codificados en el lenguaje propio de la web, HTML (Hipertext Markup Language), es necesario eliminar o bien adaptar tales códigos. iv) Integración de corpus preexistentes. Requiere asimismo trabajo de adaptación, ya que los corpus incluyen los códigos con los que quienes los han desarrollado los han enriquecido. v) Tecleado manual. Obviamente ésta debe ser la última opción, sólo reservada a las transcripciones de material sonoro o para la recuperación de textos impresos en muy mal estado o de formato muy complicado. 3.2. Corpus orales En el caso de los corpus orales, la adquisición de los datos requiere la realización de grabaciones ad hoc de registros sonoros que pueden estar constituidos por combinaciones de segmentos, frases aisladas, textos leídos o habla espontánea, o bien la obtención de archivos sonoros procedentes casi siempre de la radio o la televisión. La calidad que se requiere de la grabación depende de la utilización que después se quiera hacer del corpus: si el objetivo es el análisis de la lengua oral (su especificidad sintáctica o discursiva, por ejemplo) bastará con que la grabación, que lo será de habla espontánea, permita una transcripción ortográfica, si lo que se pretende, por el contrario, es obtener un corpus para la descripción fonética de la lengua, o para el desarrollo de tecnologías del habla (síntesis y reconocimiento del habla, sistemas de diálogo), el material debe ser de alta calidad, para lo cual la grabación, que puede ser tanto de secuencias dirigidas como de habla espontánea, debe realizarse en entornos controlados y por procedimientos digitales. Una vez obtenidas las grabaciones, deben procesarse para su integración en el corpus. Para ello es necesario transcribirlas. Normalmente se lleva a cabo una transcripción ortográfica y, a veces, ésta se acompaña de una transcripción fonética. 3.2.1. Transcripción ortográfica Consiste en una transcripción de los enunciados emitidos por los hablantes utilizando la ortografía convencional, es decir, se trata de una transliteración (y así es también llamada). Parece, en principio, simple, pero hay que tomar decisiones. i) En torno a cuestiones estrictamente lingüísticas: -¿Se hará la transcripción ortográfica de acuerdo con las convenciones normativas? Esto es, si en un hablante se produce, por ejemplo, elisión de consonantes en tensión silábica, de modo que pronuncia casaos en lugar de casados, ¿cómo se transcribe esto, se recupera la consonante elidida o no? ¿Si se recupera, se conserva de algún modo la información de que había una elisión o no? -¿Cómo se utilizarán los signos de puntuación? ¿Se marcarán, por ejemplo, las pausas a través de ellos, o se utilizarán símbolos especiales? ¿Serán también los signos de puntuación los marcadores introductores del estilo indirecto, o se utilizarán también en este caso símbolos especiales? -¿Qué se hace con las formas reducidas de las palabras (boli, tele, súper)? ¿Se transcriben como tales o se recupera la forma íntegra? ¿En este último caso, se conserva de algún modo la información de que la palabra aparecía con su forma reducida o no? -¿Cómo se transcriben abreviaturas y siglas? Si un hablante dice, por ejemplo, e-te-ce o etcétera, ¿transcribiremos etc., e-te-ce o etcétera? Si dice pesoe, ¿transcribiremos PSOE o pe-s-o-e? -¿Cómo se transcriben las palabras deletreadas? ¿V-I-G-O o uve-i-ge-o, por ejemplo? -¿Cómo se transcriben las secuencias numéricas? ¿Como tales números, 1400, por ejemplo, o mil cuatrocientos? -¿Cómo se transcriben las interjecciones? Sobre todo, ¿cómo se transcriben las que no están recogidas en el Diccionario de la Real Academia Española o en otros diccionarios? -¿Se corrigen en la transcripción los errores de producción? Si alguien pronuncia Tres tristes trigues*, ¿transcribimos de este modo, o corregimos, y, en este último caso, mantenemos la información de que ahí se había producido un error de pronunciación o no? -¿Cómo se transcriben los titubeos y las rectificaciones del hablante? Con un ejemplo, ¿qué transcripción preferimos para el caso en que un hablante rectifica durante su emisión un posesivo de primera persona en singular por el correspondiente en plural: Quiero mucho a mi…mis padres, Quiero mucho a mi-mis padres, Quiero mucho a mis padres, etc.? -A nivel discursivo, ¿cómo se da cuenta, por ejemplo, de la simultaneidad de producciones de hablantes distintos en la transcripción, por ejemplo, de un debate? ¿Y de los cambios de turno? ii) En torno a cuestiones extralingüísticas: -¿Se da cuenta en la transcripción de los gestos o movimientos relevantes de los interlocutores? ¿Si el hablante guiña un ojo, por ejemplo, se deja constancia de ello? ¿De qué manera? -¿Se transcriben, y cómo, sonidos o fenómenos vocales semiléxicos del tipo de mmmm, eeeeh, etc.? -¿Se da cuenta en la transcripción de fenómenos externos, no vocales y no comunicativos, tales como ruidos de cualquier tipo (timbres, aplausos, etc.)? iii) En torno a incidencias de la propia grabación: -Fragmentos ininteligibles o poco claros. 3.2.2. Transcripción fonética Consiste en una transcripción de la secuencia sonora pronunciada por los hablantes utilizando un alfabeto fonético y una serie de marcas prosódicas. Se lleva a cabo en dos etapas: etiquetado, asociación a los segmentos o puntos de inflexión identificados en la onda sonora, que dependerán del nivel de detalle perseguido por la transcripción, de una etiqueta o marca que los caracteriza en términos fonéticos y/o prosódicos, y alineación, entre la señal sonora y las etiquetas. El resultado de todo ello es un corpus que contiene la señal sonora sincronizada con la transcripción ortográfica (si existe, y existe siempre) y la fonética, de modo que es posible consultar el corpus partiendo tanto de la transcripción ortográfica, como de las etiquetas segmentales o las marcas prosódicas, y acceder desde cualquiera de ellas a la grabación correspondiente. Como es esperable, el etiquetado fonético se puede llevar, y se ha llevado, de hecho, a cabo, en los corpus orales hasta ahora compilados, a distintos niveles. Mencionamos los tres más recurrentes, que se refieren al etiquetado segmental: i) Nivel de transcripción fonológica o formas canónicas Representa la forma de pronunciación de la palabra empleada aisladamente en estilo cuidado. Especialmente útil porque, a partir de ella, con un conjunto de reglas puede derivarse automáticamente una transcripción del nivel de la que presentamos a continuación, y porque a partir de un corpus etiquetado de este modo puede obtenerse un diccionario fonético: por un beso se transcribiría en este nivel [por un béso] porque esa es la pronunciación de las palabras por, un y beso cuando aparecen aisladas y en estilo cuidado. ii) Nivel de transcripción ancha En el que se transcriben realizaciones alofónicas condicionadas por la fonética sintáctica: por un beso se transcribiría [por um béso] en este nivel porque el archifonema nasal se realiza bilabializado cuando precede a una bilabial. ii) Nivel de transcripción estrecha En el que se representan los alófonos que corresponden a las realizaciones fonéticas de hecho de los hablantes: si un hablante sonoriza la consonante fricativa alveolar sorda en contexto intervocálico la transcripción de por un beso sería en este nivel [por um bézo]. Los dos primeros niveles de transcripción pueden obtenerse automáticamente a partir de la trascripción ortográfica, el último requiere el acceso a la grabación. Tenemos que referirnos también a los alfabetos fonéticos que se utilizan para la transcripción fonética almacenada en soporte electrónico. Aunque transcripciones codificadas en los alfabetos fonéticos convencionales, el Alfabeto Fonético Internacional (AFI), y, para el español el alfabeto fonético de la Revista de Filología española, han podido ser almacenadas en formatos electrónicos particulares, éstos hacen a los corpus más pesados, dificultan su explotación y hacen que sea más difícil reutilizarlos. Para evitar estos problemas y, sobre todo, para asegurar un fácil intercambio electrónico de textos consistentes en transcripciones fonéticas se han elaborado sistemas, hoy estándares bastante establecidos, que codifican los símbolos del AFI, de modo que para cada uno de los símbolos del AFI se ha definido un número, que además puede relacionarse con los códigos ASCII y los símbolos que se relacionan con éstos en la tabla ASCII: estos sistemas, recodificaciones del AFI, son SAMPA4 y su extensión X-SAMPA5, para la transcripción segmental, y SAMPROSA6, para la transcripción prosódica (así, por ejemplo, a la consonante fricativa bilabial sonora, representada en el AFI como [β] se le hace corresponder en la recodificación de SAMPA el número 66, que en la tabla ASCII se corresponde con el símbolo B). Por fin, respecto a la adquisición de datos, debemos insistir en que, cualquiera que sea la fuente, los textos o los registros sonoros pueden tener propietario y estar protegidos por derechos de autor, o bien, simplemente, no ser utilizables sin el permiso explícito de sus emisores, aspectos que se deben valorar antes de proceder a su integración en el corpus en construcción. En este sentido, la integración de corpus preexistentes, a los que los textos o registros ya fueron cedidos en determinadas condiciones, constituye una situación especial en la que se impone examinar primero esas condiciones para estudiar si el simple acuerdo de cesión con los poseedores del corpus integrado es suficiente para reutilizarlo en el nuevo corpus en proceso de elaboración, o si, por el contrario, continúa siendo necesario contactar con los propietarios de los textos. 4. Codificación del corpus Codificar un corpus consiste, conceptualmente, en i) documentar exhaustivamente tanto el corpus en su totalidad como los textos que lo constituyen, ii) establecer un esquema de referencia que permita acceder de manera selectiva a puntos concretos del corpus, y iii) establecer un esquema de representación de los textos, que pueden proceder de fuentes muy diversas, para almacenarlos de la manera lo más uniforme y consistente posible, al tiempo que fiel, también hasta el mayor grado posible, al original. 4.1. Documentación del corpus y de los textos La documentación del corpus en su totalidad comprende al menos la descripción del corpus como archivo electrónico (su título, quién es responsable de su elaboración, quién su propietario, en qué condiciones se accede a él, en qué fases de edición y revisión se encuentra, cuál es su extensión, etc.), así como la descripción de los esquemas de representación y referencia que se han utilizado en él. La documentación de cada texto del corpus debería comprender información sobre el archivo electrónico que lo contiene, sobre la fuente bibliográfica o grabación de la que se ha obtenido, sobre peculiaridades de su representación, si las hay, y, sobre todo, sobre su clasificación en el interior del corpus de acuerdo con el esquema de referencia que para aquél se haya diseñado. 4.2. Esquema de referencia Si, como mencionamos en la fase de diseño del corpus, los textos se han seleccionado buscando un equilibrio temporal, geográfico, lingüístico y de nivel de lengua, así como de temática, entre ellos, todos los textos deben estar clasificados con respecto a esos parámetros, y se debe elaborar un conjunto de códigos, el esquema de referencia, que permita, en el procesamiento del corpus, seleccionar a un usuario sólo las partes del corpus que respondan positivamente a sus requerimientos en cuanto a esos parámetros. Ese conjunto de códigos, no obstante, puede extenderse más allá de la clasificación del texto de acuerdo con el diseño del corpus, y alcanzar, por ejemplo, a niveles estructurales del mismo (capítulos, apartados, párrafos, turnos de intervención, etc.). El interés de alcanzar un mayor o menor grado de detalle en este sentido dependerá del uso que se prevea dar al corpus. 4.3. Esquema de representación textual El texto en sí mismo, para ser lo más fiel posible al original, debe incluir cuantas más marcas mejor que reflejen i) la estructura de la fuente bibliográfica o grabación (capítulos, apartados, párrafos, turnos de intervención, etc.), y ii) la forma en que el texto o grabación es leído o percibido por el lector u oyente (qué hacemos, por ejemplo, para señalar lo que en el texto aparece resaltado, conservamos o no, y, en el primer caso, cómo, las notas del texto, cómo damos cuenta de la presencia en el original de diagramas, listas, tablas, fórmulas o fotos incluidas en los originales pero que no pueden ser representados en texto plano, cómo damos cuenta de esos elementos externos, no vocales y no comunicativos —timbres, aplausos, etc.— que pueden aparecer en las grabaciones, cómo representamos, si la grabación incluye imagen, gestos o expresiones que tengan importancia para el desarrollo de la conversación registrada, etc.). No sólo eso, el esquema de representación, si está bien concebido, debe permitirnos, en determinados puntos, ampliar incluso la información ofrecida por el original, sin dejar de ser fieles a él (por ejemplo, el esquema de representación puede permitirnos, junto a las siglas o abreviaturas, dar su forma completa, junto a las erratas dar la forma correcta, junto a las marcas de texto resaltado, explicar por qué lo es, esto es, interpretar el resaltado —citas, nombres propios, palabras en lengua extranjera, etc.).