Multi-word patterns in the corpus of Information and Communication Technology. Terminological bundles in the genre – ‘Textbooks in ICT’
Full text
39Terminologie | 2012 | 19 Le terme "terminologie" est utilisé pour désigner l'ensemble des termes et expressions utilisés dans la terminologie. Multi-word patterns in the corpus of Information and Communication C'est une technologie. Ensembles terminologiques du genre […] […] Livres de texte dans les TIC[…] Je suis Marek Weber. Les mots-clés de l'université de technologie de Bialystok: linguistique du corpus, technologie de l'information et de la communication, paquets lexicaux, classification fonctionnelle des paquets lexicaux, paquets terminologiques, examen lexicaux. données pour l'étude, le corpus des technologies de l'information et de la communication. les données pour l'étude se composent d'un corpus électronique du domaine large des technologies de l'information et de la communication (TIC). Les textes ont été sélectionnés pour représenter une section transversale du domaine des TIC. Les textes ont été divisés en sept catégories qui peuvent être considérées comme des genres dans le domaine des TIC: Genre 1: Articles professionnels dans les TIC; Genre 2: Articles académiques dans le domaine des TIC; Genre 3: Documentation technique des applications logicielles dans les TIC; Genre 4: Documentation technique du matériel des TIC; Genre 5: Les manuels scolaires sur les TIC; Genre 6: Documentation technique des langages de programmation et des environnements de programmation; Genre 7: Documentation technique des technologies de réseau. Le corpus contient une collection de 973 textes totalisant près de 24 millions de mots. Le choix des données pour un corpus est l'une des préoccupations les plus importantes pour le chercheur, car le corpus doit être représentatif du domaine d'utilisation analysé. Comme le suggère Douglas Biber, la quantité de textes est cruciale pour la recherche dans laquelle l'érudit se concentre sur le texte en tant qu'unité principale d'examen. Un nombre suffisant de textes devrait être inclus dans chaque genre pour tenir compte de la variation entre les catégories et les auteurs. (Biber, 2006) Il a été constaté que les
40 Marek Weber Des modèles à plusieurs mots dans le corpus de l'information andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ tableau 1. Composition du genre du corpus des technologies de l'information et de la communication Nombre Nombre de jetons de textes (mots courants) Articles professionnels 391 à 22555 Articles académiques 95 1272001 Documentation technique des 2472839 en matière de télécommunications applications logicielles 92 Documentation technique du matériel des TIC 100 2471772 Les manuels scolaires 99 15315237 Documentation technique de la programmation 90 1282175 Documentation technique des technologies de réseau 106 langues et environnements de programmation 725418 Total des dépenses 973 23764993 Le terme est utilisé pour désigner les mots qui ont une signification particulière. Les séquences récurrentes de mots qui apparaissent ensemble plus fréquemment que prévu par hasard sont une partie importante de la production linguistique. Le terme " paquet lexicale " a été utilisé pour la première fois par Douglas Biber, Stig Johansson, Geoffrey Leech, Susan Conrad et Edward Finegan dans la grammaire Longman désormais classique de l'anglais parlé et écrit pour se référer à des combinaisons de plusieurs mots identifiées sur la base du seul critère de fréquence (Biber et al. 1999), tandis que Mike Scott les appelle des groupes de mots dans le manuel de l'application logicielle WordSmith Tools version 4 (1996) et WordSmith Tools version 5 (2010). La seule considération pour identifier les faisceaux lexicaux est leur fréquence. "Les clusters sont des mots qui se trouvent à plusieurs reprises ensemble en compagnie des autres, en séquence" clusters may involve semantic prosody i.e. the tendency for certain lexemes to co-occur with certain other lexemes (e.g. the tendency for cause to come (Scott 2010: 337). Scott souligne ce mot avec des effets négatifs tels que l'accident, les ennuis, etc.) (Scott 2010: 337). Biber, Johansson, Leech, Conrad et Finegan définissent les faisceaux lexicaux comme des expressions récurrentes indépendamment de leurs propriétés structurelles, c'est-à-dire qu'ils sont des séquences de formes de mots qui coexistent fréquemment dans le discours et soulignent que les faisceaux plus courts sont souvent incorporés dans plus d'un faisceau lexical plus long (Biber et al. 1999). Ils observent également que, dans la plupart des cas, les faisceaux lexicaux ne forment pas d'unités structurelles et que la plupart d'entre eux sont
41Terminologija | 2012 | 19 ne sont pas des expressions que les utilisateurs de la langue reconnaîtraient comme des idiomes ou d'autres expressions lexicales fixes. Biber, Johansson, Leech, Conrad et Finegan établissent les seuils de coupure suivants pour que les séquences à plusieurs mots soient qualifiées de faisceaux lexicales: elles doivent apparaître au moins 10 fois par million de mots et au moins dans cinq textes (Biber et al. 1999). Biber note qu'un résultat surprenant d'une approche basée sur la fréquence est que les faisceaux lexicaux ont deux caractéristiques inattendues (Biber 2006: 134). Tout d'abord, la plupart d'entre eux ne sont pas idiomatiques dans leur signification, mais les significations sont généralement transparentes par rapport aux formes de mots individuelles. Ken Hyland souligne également le fait que la plupart des paquets sont sémantiquement transparents et […]formellement réguliers, fournissant les éléments constitutifs d'un discours cohérent[…] (Hyland 2008: 6). Deuxièmement, la plupart des paquets ne sont pas des structures grammaticales complètes. Biber, Johansson, Leech, Conrad et Finegan ont observé qu'environ 15 % des paquets lexicales dans la conversation formaient des unités structurelles complètes, tandis que seulement environ 5 % des paquets lexicales dans la prose académique pouvaient être considérés comme des phrases ou des clauses complètes (Biber et al. 1999: 1000). Une découverte précieuse sur la nature syntaxique des faisceaux lexicales par Biber est qu'il s'agit d'unités lexicales qui traversent fréquemment des structures grammaticales, par exemple, elles peuvent relier deux phrases ou clauses de telle manière que les derniers mots d'un faisceau sont les parties initiales d'une deuxième structure syntaxique (Biber 2006: 135). Hyland souligne également que les faisceaux lexicaux identifiés uniquement en fonction de leur fréquence couvrent généralement des unités structurelles (Hyland 2008: 6) Il est à noter que l'article 2, paragraphe 1, du règlement (CE) n° 1072/2006 prévoit que l'article 2, paragraphe 1, du règlement (CE) n° 1083/2006 est applicable à l'ensemble de l'Union européenne. Une série d'études de corpus ont été consacrées à l'analyse de chaînes récurrentes de formes de mots ininterrompues et elles démontrent leur importance dans divers types de discours ainsi qu'elles montrent une variation considérable des faisceaux lexicales dans différents genres et registres (par exemple: Biber 2006; Biber, Conrad, Cortes 2004; Hyland 2008; Scott, Tribble 2006; et d'autres qui ont été publiés par la Commission. Gozdz-Roszkowski, publié en 2011). La décision a été prise de se concentrer sur l'analyse des faisceaux de quatre mots parce que, d'une part, les fréquences des faisceaux de quatre mots sont considérablement plus élevées que les séquences de cinq mots et, d'autre part, ils contiennent fréquemment des chaînes de trois mots et permettent d'identifier plus de modèles et de structures apparents que les expressions de trois mots. Listes de paquets de 4 mots dans chacun des
42 Marek Weber Des modèles multi-mots dans le corpus de l'information andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ sept genres des TIC ont été générés à l'aide des outils WordSmith v. […] le logiciel 5.0 pour la recherche de modèles dans les corpus. Les deux seuils suivants ont été fixés dans cette étude: une fréquence minimale d'apparition de 20 fois par million de mots et un autre critère selon lequel un paquet devrait apparaître dans au moins cinq textes. Le processus d'application des critères de coupure a nécessité des calculs appropriés dans chacun des sept fichiers contenant la liste des paquets d'un genre donné. Les calculs sont décrits dans les étapes suivantes: 1. Création d'une colonne supplémentaire nommée "Fréquence par million" dans le tableau de calcul obtenu à partir du logiciel WordSmith Tools. 2. Insérer la valeur des mots en cours d'exécution dans une cellule de feuille de calcul Excel libre dans une catégorie donnée. 3. Remplir la première cellule de la colonne "Fréquence par million" avec la formule suivante: 4. Copier la formule dans d'autres cellules en cliquant sur le coin inférieur droit de la cellule remplie et en faisant glisser vers le bas dans d'autres cellules. 5. Mettre en évidence la colonne "Nombre de textes". 6. Choisir le menu "Données" et sélectionner le champ "Sortir et filtrer" dans l'outil de tri. 7. Choisir l'ordre de tri décroissant. 8. Suppression de toutes les lignes du tableau pour lesquelles les valeurs du champ "Nombre de textes" sont inférieures à 5. 9. Mettre en évidence la colonne "Fréquence par million". 10. Choisir le menu "Données" et sélectionner le champ "Sortir et filtrer" dans l'outil de tri. 11. Choisir l'ordre de tri décroissant. 12. Suppression de toutes les lignes du tableau dont les valeurs dans le champ "Fréquence par million" sont inférieures à 20. 1886 faisceaux différents ont été trouvés dans le corpus après application des critères de coupure ci-dessus. Le nombre total de paquets identifiés dans l'ensemble des données s'élève à 197 553.
43Terminologija | 2012 | 19 le tableau 2. Distribution des paquets lexicales dans les genres de TIC Le nombre total Nombre de différences % de la course appliquant des critères de coupure des paquets après ent paquets après mots dans les paquets appliquant des critères de coupure Articles professionnels 1057 131 1,8 articles professionnels Articles académiques 5548 120 1,7 Les applications logicielles 44669 403 7,2 Le matériel 55296 672 8,9 Les manuels scolaires 72483 119 1,9 Programmation guages et environnements de programmation lan-10984 180 3,4 technologies de réseau 7516 261 4,1 Au total, il s'agit d'un total de 1975 à 53 ans. Le pourcentage de mots courants dans les paquets a été obtenu en multipliant le nombre total de cas pour un genre donné par 4 (les paquets de 4 mots sont analysés) et en divisant par le nombre de mots courants dans un genre donné, puis en multipliant par 100 % selon la formule suivante: À notre avis, deux paramètres: la gamme de différents paquets et le pourcentage de mots courants dans les paquets peuvent être considérés comme des indicateurs du degré de formalité et de répétition d'un genre donné. En d'autres termes, le degré de formalité et de répétitivité d'un genre peut être mesuré par la gamme de différents paquets utilisés dans un genre et le pourcentage de mots courants dans les paquets. Les genres des TIC peuvent être divisés en trois groupes selon le critère de la formalité et de la répétitivité. Le genre 3 […] […]documentation technique des applications logicielles dans les TIC[…] et le genre 4 […] […]documentation technique du matériel des TIC[…] se caractérisent par des degrés élevés de formalité et de répétitivité car ils présentent des modèles comparables en utilisant la plus grande portée de différents paquets (403 et 672 respectivement) et le pourcentage le plus élevé de mots courants dans les paquets (7,2 % et 8,9 % respectivement).
Par contre, le genre 1 […] […] articles professionnels dans les TIC[…], le genre 2 andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ […] […] articles académiques dans les TIC[…] et le genre 5 […] livres de texte dans les TIC[…] se caractérisent par des degrés relativement faibles de formalité et de répétitivité car ils utilisent la plus faible portée de différents faisceaux (11, 120 et 119 respectivement) et le plus faible pourcentage de mots courants dans les faisceaux (1,8 et 1,7%) 1,9 % respectivement). Les deux genres restants: le genre 6 […] […]documentation technique des langages de programmation et des environnements de programmation[…] et le genre 7 […] […]documentation technique des technologies de réseau[…] forment le troisième groupe avec les valeurs des deux paramètres au milieu de la fourchette (nombres de différents paquets: 180 et 261 respectivement; pourcentage de mots courants dans les paquets 3,4 % et 4,1 % respectivement). Cependant, il convient de garder à l'esprit que, comme Stanislaw Gozdz-Roszkowski le souligne à juste titre, les comparaisons directes ne peuvent être effectuées en toute sécurité qu'entre des genres avec un nombre de mots similaire. Afin de tenir compte de cette considération, le pourcentage de paramètres de mots courants dans les faisceaux est calculé pour chaque genre de manière à refléter le nombre de mots de chacun des sous-corps représentant les genres respectifs (Gozdz-Roszkowski 2011: 111). Classification fonctionnelle des faisceaux Un cadre pour l'analyse fonctionnelle des faisceaux obtenus dans ce corpus a été établi à partir des taxonomies de Biber (Biber 2006; Biber et al. 2004), de Hyland (2008) et de Gozdz-Roszkowski (2011). La classification de Biber est le résultat de l'examen minutieux d'un large corpus de registres parlés et écrits qui couvraient entre autres des types de discours tels que: conversations occasionnelles, enregistrements de sessions de classe, enseignement en classe, heures de bureau, groupes d'étude, rencontres de service sur le campus, manuels, paquets de cours, textes institutionnels (par exemple, catalogues universitaires, brochures).
45Terminologija | 2012 | 19 Il s'agit d'une étude réalisée par la société. Le corpus de l'étude de Hyland (2008) (taille de 3,5 millions de mots) comprend des articles de recherche, des thèses de doctorat et des thèses de disciplines: electrical engineering and microbiology from the applied and pure sciences, and business studies and applied linguistics from the social maîtrise ou de maîtrise dans quatre sciences. Gozdz-Roszkowski (2011) a analysé un corpus de droit américain contenant plus de 5,5 millions de mots et représentant sept genres au sein de la culture et de l'éducation juridiques américaines: articles académiques, mémoires, contrats, législation, opinions, articles professionnels et manuels. S'appuyant sur les taxonomies susmentionnées, les paquets lexicaux dans les TIC ont été fonctionnellement divisés en trois grandes catégories en fonction de leur signification dans les textes: centrés sur la recherche, centrés sur le texte et centrés sur le participant. Les paquets regroupés dans la première catégorie aident les écrivains à organiser leurs activités et leurs expériences dans le domaine des TIC. Les paquets centrés sur le texte sont utilisés pour indiquer l'organisation du texte et sa signification. Enfin, les paquets centrés sur les participants sont utilisés pour signaler différentes attitudes ou évaluations et ils sont axés sur l'auteur ou le lecteur du texte. Figure 2: Taxonomie fonctionnelle des faisceaux lexicaux Chacune des trois principales catégories fonctionnelles des faisceaux lexicaux a été subdivisée en un certain nombre de sous-catégories. Les paquets axés sur la recherche comprennent les sous-catégories suivantes: paquets de quantité (par exemple, l'un des plus grands; un grand nombre de; l'un des éléments suivants; le nombre d'éléments); paquets de référence temporels (par exemple au moment de; fin d'année; les prochaines semaines; dans les prochaines semaines); Placez les faisceaux de référence de direction (par exemple, aux États-Unis; de la fenêtre principale; en bas de la fenêtre; dans la barre d'état);
46 Marek Weber Des modèles à plusieurs mots dans le corpus des paquets de procédure andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ d'information […] utilisés pour décrire diverses fonctions relatives aux TIC (par exemple, l'utilisation d'un; l'utilisation d'un); Ensembles d'indicateurs thématiques […] relatifs au domaine de recherche (par exemple, les travaux de l'IEEE; les langages et systèmes de programmation; le menu déroulant; les options de configuration suivantes); Les faisceaux de référence multifonctions […] les faisceaux qui peuvent être utilisés comme référence textuelle de lieu et d'heure (par exemple, la fin du; le début du; la gauche du; au début du); Les faisceaux de description […] spécifient les caractéristiques du nom suivant (par exemple, la complexité du; la surface du; la portée du; la hauteur du). Les paquets centrés sur le texte comprennent les sous-catégories suivantes: Les paquets d'élaboration élaborent davantage le sujet analysé et le clarifient (par exemple, en même temps que le, cela signifie que le, dans ce cas le); Les faisceaux de transition fournissent des connexions additives ou contrastées entre des parties de textes (par exemple, d'autre part, par opposition à, en plus de, en contraste avec); L'encadrement des paquets d'attributs […] […] situe les arguments en spécifiant des conditions limitantes […] (Hyland 2008: 14) pour faire des affirmations ou des arguments (par exemple en termes de, dans le contexte de, en présence du contenu du); Des paquets de conditions […] expriment des conditions (par exemple, si vous voulez, si vous ne le voulez pas, si vous avez un, si vous avez un); Les faisceaux de résultats indiquent les liens logiques entre les éléments en termes de relations de cause à effet (par exemple, afin que vous puissiez, en conséquence de, en conséquence de, en fonction de); Les faisceaux de marqueurs de structure […] sont utilisés pour pointer vers d'autres parties du texte (par exemple, comme indiqué dans la figure, comme discuté dans la section, est montré en exemple, plus loin dans ce chapitre). Les paquets centrés sur les participants comprennent les sous-catégories suivantes: paquets d'engagement […] s'adressent directement aux lecteurs; […] s'adresser activement aux lecteurs en tant que participants au discours qui se déroule […] (Hyland 2008: 18) (par exemple, faire l'un des, sélectionner le type de, il est recommandé que vous, sélectionner l'un des); Les paquets de positions transmettent des émotions, des attitudes, des jugements de valeur et des évaluations. […] fournir un cadre pour l'interprétation de la proposition suivante […] (Biber, 2006: 139) (par exemple, il est nécessaire de, n'est pas une garantie que, il est important de, il n'est pas possible, il est
47Terminologija | 2012 | 19 Il a été créé en 2012 Les faisceaux de modalités […] expriment que quelque chose est probable, admissible ou nécessaire (par exemple, doit être rempli un, peut être utilisé pour, comme on peut le voir, dans lequel vous pouvez, ne peut pas être affiché, peut être reproduit ou, doit accepter toute interférence, interférence qui peut causer, qui peut causer indésirable); Les paquets de prédictions expriment la prédiction de l'écrivain d'une action future (par exemple, il est prévu d'être, vous serez invité, vous serez affiché dans, cela ouvrira le, vous sera demandé de). Table 3 shows the numbers of bundles belonging to the three major functional categories in each genre. possible de); tableau 3: Distribution des ensembles lexicaux par catégories fonctionnelles Recherces centré he-Text-- centré Participcentré ant-AutrArticles professionnels 45 23 13 45 Articles académiques 48 35 928 Les applications logicielles 123 55 122 83 Matériel matériel Les manuels scolaires 32 35 18 20 Langues de programmation programmation 39 39 26 62 et environnements de technologies de réseau 91 24 11 91 Figure 3: Classification des faisceaux axés sur la recherche