• Contenu principal
  • Menu
OpenEdition Books
  • Accueil
  • Catalogue de 16518 livres
  • Éditeurs
  • Auteurs
  • Facebook
  • X
  • Partager
    • Facebook

    • X

    • Accueil
    • Catalogue de 16518 livres
    • Éditeurs
    • Auteurs
  • Ressources numériques en sciences humaines et sociales

    • OpenEdition
  • Nos plateformes

    • OpenEdition Books
    • OpenEdition Journals
    • Hypothèses
    • Calenda
  • Bibliothèques

    • OpenEdition Freemium
  • Suivez-nous

  • Lettre d’information
OpenEdition Search

Redirection vers OpenEdition Search.

À quel endroit ?
  • Presses universitaires de Franche-Comté
  • ›
  • Les Cahiers de la MSHE Ledoux
  • ›
  • INTEX
  • ›
  • Applications en TAL
  • ›
  • Du Côté de Chez Swann, Analyse linguisti...
  • Presses universitaires de Franche-Comté
  • Presses universitaires de Franche-Comté
    Presses universitaires de Franche-Comté
    Informations sur la couverture
    Table des matières
    Liens vers le livre
    Informations sur la couverture
    Table des matières
    Formats de lecture

    Plan

    Plan détaillé Texte intégral Introduction 1 - Objectifs 2 - Le corpus 3 - Les outils utilisés pour la levée d’ambiguïté 4 - Le pre-traitement 5 – Les ressources linguistiques Conclusion Bibliographie Annexe Notes de bas de page Auteur

    INTEX

    Ce livre est recensé par

    Précédent Suivant
    Table des matières

    Du Côté de Chez Swann, Analyse linguistique automatique d’un texte littéraire

    Katia Zellagui

    p. 281-299

    Résumé

    The present study deals with the automatic and linguistic analysis of a literary French text Du Côté de Chez Swann by Marcel Proust. Our main aim is to tag completely and as “perfect” as possible every unit of the text. We consider two kinds of units : the simple forms and the compounds forms. As we know, the natural language has a characteristic : the ambiguity. We use the system Intex (the main tools are the local grammars and the electronic dictionaries) because it allows the user to introduce and use his own resources in the system, which is necessary if we want to create resources in order to resolve the ambiguity problems.

    Texte intégral Bibliographie Bibliographie : Annexe Annexe : Copie écran de Diatag Notes de bas de page Auteur

    Texte intégral

    1La tradition du Grelis réside dans l’étude linguistique des textes littéraires en utilisant des outils informatiques. Un des objectifs de notre laboratoire est l’étiquetage morpho-lexical et syntaxique des textes littéraires. Nous avons choisi d’utiliser le système Intex car il offre la possibilité à l’utilisateur d’insérer ses propres ressources linguistiques par le biais de grammaires locales sous formes de transducteurs (automates à états finis) et des dictionnaires électroniques. Nous avions présenté aux quatrièmes journées Intex des travaux relatifs à l’étiquetage du texte Aurélien d’Aragon. Nous tenons à préciser que nous n’avons pas été en mesure de poursuivre notre recherche sur ce texte suite à des problèmes liés aux droits de diffusion des résultats sur le web.

    Introduction

    1 - Objectifs

    2Les logiciels d’étiquetage performants actuellement disponibles sur le marché (nous avons testé Winbrill et Cordial qui sont les logiciels les plus utilisés actuellement) présentent trois défauts majeurs :

    • la levée d’ambiguïté et la correction d’erreurs éventuelles passent nécessairement par une recherche manuelle dans le texte étiqueté ;
    • les étiquettes assignées manquent souvent de précision ;
    • le traitement des formes composées est limité voir inexistant.

    3Nous avons choisi d’utiliser le logiciel INTEX parce que contrairement aux outils que nous avons décrits précédemment, il donne la possibilité à l’utilisateur d’insérer dans le système (de façon très souple) ses propres ressources linguistiques sous forme de dictionnaires électroniques ou de grammaires locales. Ainsi, nous proposons de mettre à la disposition des chercheurs des bases étiquetées de textes littéraires à des fins d’études lexicales et sémantiques de corpus.

    4Nous entendons par étiquetage l’opération qui consiste à remplacer les formes du texte - ce que nous appelons tokens dans le système Intex- par les unités linguistiques correspondantes. Ces unités linguistiques sont représentées entre accolades, par exemple :

    La{la, le, Det : fs}jeune{jeune, jeune, A : fs}
    femme{femme, femme, N : fs}

    5Notre premier souci réside dans la volonté d’exhaustivité, c’est-à-dire que nous avons crée des ressources de façon à passer sur tous les cas, condition nécessaire si nous voulons atteindre notre objectif prioritaire qui est d’effectuer un étiquetage aussi “parfait” que possible. Nous avons traité :

    • les formes simples, c’est à dire les séquences de lettres comprises entre deux séparateurs consécutifs, par exemples l’énoncé « je prends le train dans cinq minutes. » compte sept formes simples et six séparateurs (les blancs dans ce cas) ;
    • et les formes composées : séquences qui incluent au moins deux mots simples (et donc au moins un séparateur), par exemples : après-midi, pomme de terre.

    6Nous n’avons pas traité dans le cadre de la présente recherche les expressions figées. Cette catégorie fera l’objet d’une étude spécifique lors de nos futurs travaux.

    2 - Le corpus

    7Le texte sur lequel nous avons travaillé Du côté de chez Swann de Marcel Proust nous a été fourni par les Éditions Champions, Paris.

    8Nous avons effectué un certain nombre de corrections sur le texte fourni. Chaque modification apportée au texte sur support magnétique a été scrupuleusement effectuée après vérification et comparaison avec le texte sur support papier.

    9Nous avons pu repérer les erreurs en appliquant les dictionnaires du système Intex. En effet, lorsqu’une forme n’est pas reconnue par le système Intex, elle est répertoriée dans la liste de mots inconnus. Les erreurs que nous avons relevées sont généralement des coquilles, nous avons présenté quelques exemples tableau 1.

    Erreurs relevéesCorrections apportées
    baîllementbâillement ;
    déclanchaitdéclenchait ;
    mystérieuremystérieuse
    PasiphaêPasiphaé,
    RoussanvilleRoussainville.

    Tableau 1 : Coquilles relevées.

    10Nous avons également relevé tous les mots en début de phrase dont la première lettre est censée être une voyelle accentuée et nous avons rétabli toutes les voyelles accentuées en majuscule.

    Erreurs rencontréesCorrections apportées
    EvidemmentÉvidemment
    ElevéÉlevé
    A ce pointÀ ce point
    A ce signalÀ ce signal
    A ces motsÀ ces mots
    A intervallesÀ intervalles
    A la grandeÀ la grande
    A quoi SwannÀ quoi Swann
    EperduÉperdu

    Tableau 2 : Exemples de mots en début de phrase.

    11Le texte Du Côté de chez Swann compte 420 pages. Nous avons utilisé le texte sur support papier des éditions Gallimard, 1987, 1ère édition 1913. Après application du système Intex, nous avons relevé 219 551 formes (dont 15 732 formes différentes) ; 181 492 formes simples (16 338 formes simples différentes) ; 38 043 signes de ponctuation (le point, les points de suspension, le point d’interrogation et le point d’exclamation) et 5 572 formes composées ambiguës.

    3 - Les outils utilisés pour la levée d’ambiguïté

    12Nous avons utilisé deux types d’outils afin de créer les ressources nécessaires à l’étiquetage du texte : les dictionnaires électroniques et les grammaires locales sous formes de transducteurs.

    13Le système Intex possède un ensemble de dictionnaires : dictionnaire des formes simples et des formes composées dont chaque entrée possède une étiquette morphologique, syntaxique, flexionnelle et parfois sémantique.

    14Certaines formes identiques d’un point de vue graphique possèdent plusieurs entrées d’où ambiguïté. L’ambiguïté est définie par Fuchs [1996] de la façon suivante :

    « Est dite ambiguë une expression de la langue qui possède plusieurs significations distinctes et qui, à ce titre, peut être comprise de plusieurs façons différentes par un récepteur. ».

    3 .1 - Les dictionnaires électroniques

    15Nous avons en premier lieu utilisé les dictionnaires inclus dans le système Intex. Ces dictionnaires ont été construit par les membres du Ladl et sont nommés les DELA : Dictionnaires Electroniques du LAdl. Les trois groupes de dictionnaires sont :

    • Le DELAS : Dictionnaire Électronique du LAdl des formes simples ;
    • Le DELAC : Dictionnaire Électronique du LAdl des formes composées ;
    • Le DELAE : Dictionnaire Électronique du LAdl des expressions figées.
    • Le DELAS

    16Le Delas contient 80 000 entrées. Chaque entrée est associée à un lemme, à une catégorie grammaticale ; à des informations syntaxiques et sémantiques introduites par le signe "+", puis à des informations flexionnelles introduites par le signe " : " .

    17Nous avons présenté les premières entrées du DELAS.

    a, avoir. V+aux : P3s
    a, avoir. V+en+i+35R : P3s
    a, avoir. V+i+1 : P3s
    a, avoir. V+t+U+32NM : P3s
    a, . N : ms : mp
    abaissa, abaisser. V+se+i : J3s
    abaissa, abaisser. V+t+11 : J3s
    abaissa, abaisser. V+t+32RA : J3s
    abaissa, abaisser. V+t+38L : J3s

    – Le DELAF

    18Nous rappelons qu’il y a 900 000 entrées dans le dictionnaire DELAF, qui contient toutes les flexions des entrées du DELAS. Il y a cinq fois plus de noms composés que de noms toutes catégories confondues. Le Delaf morpho-syntaxique contient pour chaque entrée :

    • - la forme du texte ;
    • - le lemme correspondant ;
    • - la catégorie morpho-syntaxique en MAJUSCULES ;
    • - chaque information flexionnelle codée par un caractère après les « ... »

    19Les premières entrées du DELAF sont :

    a, . N : ms : mp
    a, avoir. V : P3s
    à, . PREP
    aa, . N : ms : mp
    aabam, . N : ms
    aalénien, . A : ms
    aalénien, . N : ms
    aalénienne, aalénien. A : fs
    aaléniennes, aalénien. A : fp

    - Le DELAC

    20Le DELAC (dictionnaire électronique du Ladl des formes composées) a été construit par Max Silberztein [1993b].

    21Les entrées sont associées à une catégorie grammaticale et quelquefois à un code flexionnel.

    22Le dictionnaire des formes composées contient des noms, des adverbes, des adjectifs et des conjonctions de subordination.

    3.2 - Les grammaires locales sous forme d’automates et de transducteurs

    23En second lieu, nous construit une vingtaine de graphes sous formes de transducteurs à des fins d’étiquetage.

    24Un transducteur contrairement à un automate (outil informatique utilisé afin de reconnaître de l’information, par exemple une séquence de lettres ou de mots, de façon booléenne) peut produire en plus de l’information. Silberztein [1997] définit le transducteur comme suit :

    “afin de produire des résultats plus complexes, on utilise des transducteurs. Formellement, un transducteur est un automate dont les transitions sont étiquetées par des couples de symbole (Sr/Sp), où Sr est un symbole reconnu, et Sp un symbole produit. On utilise Sr lors de la reconnaissance et Sp afin de produire un résultat, une interprétation du symbole reconnu. Les transducteurs peuvent aussi être représentés par des expressions rationnelles ; dont les symboles seront couples (Sr/Sp).”

    4 - Le pre-traitement

    25La segmentation est une étape nécessaire afin de préparer le texte à l’analyse morphologique et syntaxique. Elle consiste à appliquer un ou plusieurs transducteurs (construits par l’utilisateur) afin de diviser le texte en unités textuelles (en phrases). Le transducteur Phrases.fst a été construit de façon à insérer le symbole {S} à la fin de chaque phrase.

    26Nous avons utilisé la définition typographique de la phrase. Cette définition est représentée par la grammaire locale Phrases.grf qui prend en compte deux cas de figure, analogues à des règles.

    4.1 – Phrases.grf

    27Nous avons présenté ci-dessous le graphe Phrases.grf. Nous tenons à préciser que la grammaire locale Phrases.grf a été construite afin de segmenter le texte Du Coté de chez Swann et ne fonctionnera pas systématiquement sur d’autres textes du même auteur ou d’auteurs différents.

    Image

    Graphe 1 : Transducteur « Phrases.grf ».

    4.2 – Les Règles

    28Nous avons construit ce transducteur selon deux règles générales :

    - Règle 1

    29Les ponctuations « dites fortes » sont signes de fin de phrase ce qui revient à insérer le symbole de fin de phrase après :

    30Un changement de paragraphe (symbolisé par le signe <^> sous Intex) ;

    Un point ;
    Un point d’exclamation ;
    Un point d’interrogation ;
    Des points de suspension…

    31lorsque ces marques sont suivies d’un mot en majuscule ou d’un nombre.

    - Règle 2

    32Le point est ambigu : il peut être point de ponctuation, point d’abréviation ou point d’alignement. Afin de construire le chemin correspondant à la règle 2, nous avons repéré dans le texte toutes les occurrences du point et nous avons étudié le contexte gauche-droite de chacune des occurrences. Nous avons relevé 4 287 occurrences dont 27 points de suspension, soit 4 206 points simples. Dans les 4 206 occurrences, 3 877 points sont suivis d’un mot dont la première lettre est en majuscule, 269 sont suivis d’un signe de ponctuation (guillemets, tirets…). Nous avons constaté que le point est signe d’abréviation dans 209 cas : dont 149 cas où le point est suivi d’une forme dont la première lettre est en majuscule, et 60 cas où le point est suivi d’une forme dont la première lettre est en minuscule en l’occurrence nous avons relevé les formes de, des, et, le, par exemple, M. de Charlus, M. d’Orsan, M. et Mme Verdurin, M. le Curé.

    33Or, le séparateur de phrases ne doit pas être inséré dans les cas où le point est un signe d’abréviation. Nous avons donc recherché toutes les occurrences et nous avons constaté qu’il s’agissait toujours de séquences construites sur le modèle : M. <PRE>, c’est à dire la lettre M (abréviation de Monsieur) suivi d’un point suivi d’une forme dont la première lettre est en majuscule, et dans le texte il s’agit toujours d’un nom de personnage. Nous avons relevé 149 occurrences dans le texte ; nous avons présenté quelques exemples.

    s plus comprendre que la peinture de " M. Biche " .{S} Comme le public ne connaît prédicateur.{S} On peut dire que avec M. Bréchot, vous avez là deux numéros qui se
    avait ces mots : " de la collection de M. Charles Swann ", nous dit : " Vous avez
    Comment ça, M. Grévy ? vous connaissez M. Grévy ? dit-il à Swann de l’air stupide et
    parlé de cette plage de Balbec devant M. Swann {afin d’, afin de. PREP}apprendre de
    e. PRO+PPV : ms} était bien peu de chose, M. Verdurin acheta pour trois cents francs
    laquelle elle plaça le portrait, comme M. Vinteuil autrefois avait mis à côté de

    4.3 – Application de Phrases.grf

    34Le texte que nous avons obtenu après application du graphe Phrases.grf a été segmenté sans erreur. Nous avons vérifié en effet cas par cas et par le biais de la concordance que chaque symbole était inséré convenablement ce qui était effectivement le cas. Nous avons présenté les premières lignes du texte segmenté :

    35{S}Longtemps, je me suis couché de bonne heure.{S} Parfois, à peine ma bougie éteinte, mes yeux se fermaient si vite que je n’avais pas le temps de me dire : "Je m’endors. "{S} Et, une demi-heure après, la pensée qu’il était temps de chercher le sommeil m’éveillait ; je voulais poser le volume que je croyais avoir encore dans les mains et souffler ma lumière ; je n’avais pas cessé en dormant de faire des réflexions sur ce que je venais de lire, mais ces réflexions avaient pris un tour un peu particulier ; il me semblait que j’étais moi-même ce dont parlait l’ouvrage : une église, un quatuor, la rivalité de François 1er et de Charles Quint.{S}

    36Lors de la phase du pre-processing, Intex effectue trois étapes successives selon les besoins et les choix de l’utilisateur. Dans un premier temps, il segmente le texte, ce qui revient comme nous venons de le voir à insérer le symbole de phrase à la fin de phrase à la fin de chaque phrase. Dans un second temps, Intex traite les formes déviantes, c’est à dire les formes composées non ambiguës par exemple : aujoud’hui, parce que…

    37Dans un dernier temps, Intex peut normaliser le texte en appliquant des transducteurs, ce qui consiste à rétablir les formes contractées ou élidées sous leur forme pleine. Par souci de préserver un texte “original”, nous avons choisi de ne pas effectuer la dernière étape.

    5 – Les ressources linguistiques

    38Une fois le texte segmenté et les formes déviantes étiquetées, il s’agit d’appliquer les ressources lexicales au texte. Intex possède un certain nombre de dictionnaires électroniques (cf. chapitre 3.1) pour les formes simples et pour les formes composées. Nous avons appliqué le Delafm pour les formes simples et l’ensemble des dictionnaires des formes composées. Nous avons ainsi obtenu une liste de mots inconnus que nous avons traitée, c’est à dire que nous avons attribué une étiquette morpho-lexicale à chacune des formes de cette liste.

    5.1 - Traitement des formes composées

    39Nous avons traité en premier lieu les formes composées. Ce traitement s’est effectué en deux étapes : application des dictionnaires des formes composées inclus dans Intex et validation par rapport au contexte du figement de la forme.

    – Définition

    40Nous rappelons brièvement que nous définissons une forme composée comme étant une séquence de formes simples contenant au moins un séparateur et dont la signification générale n’est pas directement déductible de la somme des significations de chacun des constituants.

    41Une séquence est dite figée (donc composée) si elle répond à un certain nombre de contraintes de composition par exemple les pluriel obligatoires, l’institutionnalisation de l’usage [Gross, 1996].

    – Application des dictionnaires électroniques

    42Nous avons appliqué les dictionnaires des formes composées inclus dans Intex afin de reconnaître les formes composées. Le système Intex reconnaît des formes composées non-ambiguës (reconnaissance qui s’effectue lors du pre-processing et qui reconnaît les formes telles que : aujourd’hui, parce que) et les formes composées ambiguës : telles que cordon bleu, bassin est. Nous pouvons déterminer assez rapidement si une séquence de mots est ambiguë ou pas en étudiant son contexte.

    43Deux problèmes se sont alors présentés à nous. D’une part, il s’agissait de repérer toutes les formes candidates au statut de formes composées non-ambiguës dans le texte. Pour ce faire nous avons appliqué tous les dictionnaires inclus dans le système Intex. D’autre part, nous devions trouver un moyen de gérer et de stocker l’information obtenue.

    44L’application du DELAC a permis de reconnaître 5 572 formes composées ambiguës. L’inconvénient des dictionnaires des formes composées du système Intex réside dans le fait qu’ils contiennent des formes ambiguës. Intex ne propose pas un dictionnaire susceptible de reconnaître de façon certaine les formes composées non ambiguës et des formes composées ambiguës. Ce qui fait que le traitement des formes composées est long et fastidieux. Il faut en effet revenir systématiquement sur toutes les formes et étudier leur contexte de façon à déterminer leur degré de figement.

    45Afin de faciliter cette étape, nous avons mis en place un programme applicable au système Intex : Diatag Intex (cf. Figure 1). Ce programme de convivialité crée sous Visual Basic par Viprey (laboratoire Laseldi, Université de Franche-Comté)1 permet d’étudier la forme composée dans son contexte et de valider (en cochant ou non la case choisie – chaque case se réfère à une étiquette morpho-syntaxique) la bonne étiquette. Si la forme n’est pas composée, aucune case n’est validée donc la forme n’est pas étiquetée et est traitée comme une séquence de formes simples (cf. Annexe 1).

    46Nous avons donc effectué un traitement cas par cas des formes composées.

    47Nous avons validé 3 806 formes composées non-ambiguës qui ont dès lors été étiquetées. Voici quelques exemples.

    que il possède de bonté, d’ [abandon de soi, abandon de soi. N+NDN : ms/un ; Psy] Vitré dont l’ [accent aigu, accent aigu. N+NA+z1 : ms/un] losangeait sans être repris d’ [accès de jalousie, accès de jalousie. N+NDN : ms : mp/un ; Psy] il ne rencontre aucun [accident de terrain, accident de terrain. N+NDN+Conc : ms/] la détente de un [acte de foi, acte de foi. N+NDN : ms/un] aller à Pierrefonds était un [acte licite, acte licite. N+NA+E01+z3 : ms/un], si c’ était des [actions ordinaires, action ordinaire. N+NA+Conc+z2 : fp/un]

    48Nous avons dès lors obtenu un texte dont les formes composées non ambiguës sont étiquetées. Une fois cette phase de l’analyse effectuée, nous avons pu entamer la désambiguïsation des formes simples.

    49Nous avons appliqué le dictionnaire électronique morphologique des formes simples : le Delaf1 et le dictionnaire des chiffres romains. Le système a relevé 449 formes inconnues.

    50Le dictionnaire d’œuvre de Proust contient 16 338 occurrences de formes simples dont 449 occurrences de formes inconnues au DELAS. Nous avons relevé :

    51des mots étrangers, par exemple : a cup of tea ;

    52des transcriptions du parler d’un personnage, par exemple : « esprimer » ;

    53des formes non incluses dans les DELA, par exemple : bourgeoisisme.

    5.2 - Dictionnaire Swann.dic

    54Nous avons construit le dictionnaire Swann.dic qui contient 463 entrées. Il a été construit suivant le format des dictionnaires électroniques du LAdl [Courtois, 1990]. Nous avons attribué à chacune des formes un code flexionnel et syntaxique. Ci dessous les dix premières entrées du dictionnaire Swann.dic.

    Abbattucci, Abbattucci. N+Hum : ms
    aboutonnez, aboutonner. V+t+z1 : P2p
    Abraham, Abraham. N+Hum : ms
    Adam, Adam. N+Hum : ms
    Adolphe, Adolphe. N+Hum : ms
    Aladin, Aladin. N+Hum : ms
    Albert, Albert Dürer. N+Hum : ms
    Alexandre, Alexandre Dumas. N+Hum : ms
    Alfred, Alfred de Vigny. N+Hum : ms
    Alger, Alger. N+Top

    5.3 – Les grammaires locales pour la levée d’ambiguïté

    55Il est possible de lever un grand nombre d’ambiguïtés à l’aide de transducteurs. Nous avons construit une vingtaine de grammaires afin de lever certaines ambiguïtés : nous avons traité par exemple les ambiguïtés relatives aux formes : le, la, les, en, son, ton, pas, . Nous avons choisi de présenter deux grammaires locales : pas.grf et l’.grf.

    - La forme pas

    56Nous avons relevé 1 850 occurrences de la forme pas dans le texte. Cette forme est ambiguë. En effet, il peut s’agir :

    • de la forme adverbiale, par exemple : je ne le veux pas !
    • ou de la forme nominale : N+Abst : ms : mp, par exemple : il recula de deux pas !

    57Nous avons effectué une concordance de la forme de façon à étudier le contexte et afin de relever les cas où la forme pas est un substantif et où elle est un adverbe. Nous avons ainsi construit le graphe pas.grf afin de lever les ambiguïtés de cette forme.

    Image

    Graphe 2 : Transducteur pas.grf.

    58Après application de pas.grf et par le biais de la concordance, il est possible de vérifier si des erreurs ont été commises. Nous avons constaté que les étiquettes ont été attribuées de façon correcte dans tous les cas. Nous avons levé les 1 850 ambiguïtés. Nous avons présenté quelques exemples de la concordance.

    ur longtemps encore à l’âge où on ne l’a {pas, pas. ADV+Dadv} encore abstrait ce plaisir de l
    due {jusqu’à, jusque. PREP} ce jour, si s’abstenir n’était {pas, pas. ADV+Dadv} faire preuve d’i
    e Verdurin, c’est-à-dire à s’éloigner à chaque {pas, pas. N+Abst : ms : mp} d’Odette, qui descenda
    r les petits avantages qu’elle m’avait donnés non {pas, pas. ADV+Dadv} en eux-mêmes et comme
    dications du texte ; puis il s’éloignait du même {pas, pas. N+Abst : ms : mp} saccadé.{S} Et rien ne
    i toutes les raisons qu’elle avait de ne {pas, pas. ADV+Dadv} mentir ; elles auraient pu ruin
    avait pas : " Oh ! pas de catleyas ce soir, {pas, pas. ADV+Dadv} moyen de me livrer à mes petits

    - Levée d’ambiguïté de l’

    59La forme l’ qui possède 2 616 occurrences dans le texte présente une double ambiguïté, ce qui complexifie l’étape de désambiguïsation. L’ambiguïté est d’une part d’ordre morphologique : le ou la et d’autre part d’ordre syntaxique : pronom préverbal ou déterminant.

    60Dans l’énoncé, sans la proposition P1 il serait difficile de savoir si le l’ se réfère à la forme le ou à la forme la :

    […] elle redescendait si vite, que le moment où je l’entendais monter, […]

    P1P2

    61Le transducteur traite le cas où l’ est un pronom et un cas où l’ est un déterminant.

    Image

    Graphe 3 : Transducteur l’.grf.

    62Le cadre l’autre renvoie à un transducteur qui gère les séquences de type : l’ suivi de la forme autre, selon qu’il s’agisse d’une séquence libre (déterminant plus adjectif) ou d’une séquence figée (pronom) .

    63Nous avons relevé 79 séquences, par exemple :

    au champion des duchesses, au moins {l’autre, le autre. PRO+z1 : ms} a son
    titre ; il est touj
    re la manière que {l’un, l’un. PRO : ms} ou {l’autre, le autre. PRO+z1 : ms} avait de débiter, de
    e l’humanité chez qui la curiosité qu’à {l’, le. DET+Ddef+z1 : fs}
    l’{autre, autre. A : fs} moitié

    64Le transducteur l’.grf remplace la forme contractée l’ par sa forme correspondante et permet de spécifier sa catégorie grammaticale.

    65Nous avons procédé de la même manière que précédemment afin de construire le graphe l’.grf, c’est à dire que nous avons effectué une concordance de la forme l’ et nous avons observé ses contextes gauche-droite. Nous avons constaté par exemple que la forme l’ renvoie au déterminant le lorsque cette dernière est suivie d’un nom au masculin singulier, lui-même précédé ou non d’un ou plusieurs adjectifs qualificatifs au masculin singulier coordonné(s) par une conjonction de coordination, par exemple :

    ette, dont il avait eu, à ce moment-là, le brusque et impuissant soupçon, il la tenait là, écla
    té dont un réseau d’ombre noire cernait le factice et tremblant contour.{S}
    Quand un rayon de s

    66Le transducteur l’ a permis de lever 2 600 ambiguïtés, par exemple.

    balance des devoirs et des exigences de {l’, le. DET+Ddef+z1 : fs} amitié sur un simple mouvement
    ait toute la tendresse naturelle, toute {l’, le. DET+Ddef+z1 : fs} ample douceur qu’elles réclamaient à
    re inviter chez ces deux grandes dames, {l’, le. DET+Ddef+z1 : fs} ancienne concierge et la cocotte
    l’avait pas trouvée chez les Verdurin - { l, le. PRO+PpvLE+z1 : 3ms : 3fs } aideraient à arriver, sans avoi
    he n’est pas en lui, mais en moi.{S} Il { l, le. PRO+PpvLE+z1 : 3ms : 3fs } y a éveillée, mais ne la connaît
    geait la conversation si je cherchais à {l, le. PRO+PpvLE+z1 : 3ms : 3fs} y amener.{S} Je me rabattais
    me avec lui ; puis tant j’avais peur que {LOC} d’une seconde à l’autre mon grand-père et mon père

    67Cependant, le graphe l’ n’a pas pu lever toutes les ambiguïtés, ceci est généralement lié au fait que la forme qui suit le l’ est elle-même ambiguë, dans l’exemple qui suit la forme allée est considérée comme un verbe au participe passé alors qu’il s’agit du nom

    de l’arrêter pour qu’elle pût descendre {l, le. PRO+PpvLE+z1 : 3ms : 3fs} allée à pied.{S} Et les jours où je me

    68Le cas du l’ est très représentatif des problèmes que nous avons rencontrés lors de la construction des grammaires locales de levée d’ambiguïté. Car une telle forme ne peut être désambiguïsée si la forme qui la suit ou qui la précède l’a été au préalable.

    Conclusion

    69À ce stade de notre recherche, nous avons obtenu un texte segmenté dont les formes composées sont étiquetées. Les grammaires locales construites ont permis de lever plus de 10 000 ambiguïtés. Nous avons traité 10 des 50 formes simples les plus fréquentes. Nous complétons actuellement la bibliothèque de grammaires locales afin d’atteindre notre objectif qui est, rappelons-le, d’obtenir un texte étiqueté sans erreur.

    Bibliographie

    Des DOI sont automatiquement ajoutés aux références bibliographiques par Bilbo, l’outil d’annotation bibliographique d’OpenEdition. Ces références bibliographiques peuvent être téléchargées dans les formats APA, Chicago et MLA.

    Format

    Silberztein, M. (1993). Les Groupes Nominaux Productifs et les Noms Composés Lexicalisés. John Benjamins Publishing Company. https://doi.org/10.1075/li.17.2.06sil
    Silberztein, Max. “Les Groupes Nominaux Productifs Et Les Noms Composés Lexicalisés”. Lingvisticæ Investigationes. International Journal of Linguistics and Language Resources. John Benjamins Publishing Company, January 1, 1993. doi:10.1075/li.17.2.06sil.
    Silberztein, Max. “Les Groupes Nominaux Productifs Et Les Noms Composés Lexicalisés”. Lingvisticæ Investigationes. International Journal of Linguistics and Language Resources, vols. 17, nos. 2, John Benjamins Publishing Company, 1 Jan. 1993, pp. 405-2. Crossref, https://doi.org/10.1075/li.17.2.06sil.

    Cette bibliographie a été enrichie de toutes les références bibliographiques automatiquement générées par Bilbo en utilisant Crossref.

    Bibliographie :

    Fuchs Catherine, 1996, Les ambiguïtés du français, Collection l’Essentiel français.

    Gross Gaston, 1996, Les expressions figées en français : noms composés et autres locutions, Collection L’essentiel français.

    Gross Maurice, 1986, grammaire transformationnelle du Français, Syntaxe du nom, éditions Cantilène.

    Silberztein Max, 1990, “Le dictionnaire électronique des noms composés”, Dictionnaires Électroniques du Français, Langue française, n° 87, Paris : Larousse, 71-84.

    Silberztein Max, 1990, « Le dictionnaire électronique des noms composés », Dictionnaires Électroniques du Français, Langue française, n° 87, Paris : Larousse, 71-84.

    Silberztein Max, 1993a, Dictionnaires électroniques et analyses automatiques de textes : le système INTEX, Paris : Masson.

    10.1075/li.17.2.06sil :

    Silberztein Max, « Les Groupes Nominaux productifs et les noms composés lexicalisés », Linguisticae Investigationes, XVII : 2, Laboratoire d’Automatique Documentaire et Linguistique, Paris VII, 1993b.

    Annexe

    Annexe : Copie écran de Diatag

    Image

    Notes de bas de page

    1 http// www.univ-fcomte.fr

    Auteur

    • Katia Zellagui

      LASELDI, Université de Franche-Comté

    Précédent Suivant
    Table des matières

    Le texte seul est utilisable sous licence Licence OpenEdition Books. Les autres éléments (illustrations, fichiers annexes importés) sont « Tous droits réservés », sauf mention contraire.

    Voir plus de livres
    La pensée de la race en Italie

    La pensée de la race en Italie

    Du romantisme au fascisme

    Aurélien Aramini et Elena Bovo (dir.)

    2018

    La formation d’une opinion démocratique

    La formation d’une opinion démocratique

    Le cas du Jura, de la révolution de 1848 à la « république triomphante » (vers 1895)

    Pierre Merlin

    2017

    Les mutations récentes du foncier et des agricultures en Europe

    Les mutations récentes du foncier et des agricultures en Europe

    Gérard Chouquer et Marie-Claude Maurel (dir.)

    2018

    Deux frontières aux destins croisés ?

    Deux frontières aux destins croisés ?

    Étude interdisciplinaire et comparative des délimitations territoriales entre la France et la Suisse, entre la Bourgogne et la Franche-Comté (xive-xxie siècle)

    Benjamin Castets Fontaine, Maxime Kaci, Jérôme Loiseau et al. (dir.)

    2019

    Un mousquetaire du journalisme : Alexandre Dumas

    Un mousquetaire du journalisme : Alexandre Dumas

    Sarah Mombert et Corinne Saminadayar-Perrin (dir.)

    2019

    Libertaire ! Essais sur l’écriture, la pensée et la vie de Joseph Déjacque (1821-1865)

    Libertaire ! Essais sur l’écriture, la pensée et la vie de Joseph Déjacque (1821-1865)

    Thomas Bouchet et Patrick Samzun (dir.)

    2019

    Les encyclopédismes en France à l'ère des révolutions (1789-1850)

    Les encyclopédismes en France à l'ère des révolutions (1789-1850)

    Vincent Bourdeau, Jean-Luc Chappey et Julien Vincent (dir.)

    2020

    Le verre du VIIIe au XVIe siècle en Europe occidentale

    Le verre du VIIIe au XVIe siècle en Europe occidentale

    Inès Pactat et Claudine Munier (dir.)

    2020

    Les révolutions du commerce. France, xviiie-xxie siècle

    Les révolutions du commerce. France, xviiie-xxie siècle

    Jean-Claude Daumas (dir.)

    2020

    Le patrimoine industriel au prisme de nouveaux défis

    Le patrimoine industriel au prisme de nouveaux défis

    Usages économiques et enjeux environnementaux

    Marina Gasnier

    2018

    La petite entreprise au péril de la famille ?

    La petite entreprise au péril de la famille ?

    L’exemple de l’Arc jurassien franco-suisse

    Laurent Amiotte-Suchet, Yvan Droz et Fenneke Reysoo

    2017

    Une imagination républicaine, François-Vincent Raspail (1794-1878)

    Une imagination républicaine, François-Vincent Raspail (1794-1878)

    Jonathan Barbier et Ludovic Frobert (dir.)

    2017

    Voir plus de livres
    1 / 12
    La pensée de la race en Italie

    La pensée de la race en Italie

    Du romantisme au fascisme

    Aurélien Aramini et Elena Bovo (dir.)

    2018

    La formation d’une opinion démocratique

    La formation d’une opinion démocratique

    Le cas du Jura, de la révolution de 1848 à la « république triomphante » (vers 1895)

    Pierre Merlin

    2017

    Les mutations récentes du foncier et des agricultures en Europe

    Les mutations récentes du foncier et des agricultures en Europe

    Gérard Chouquer et Marie-Claude Maurel (dir.)

    2018

    Deux frontières aux destins croisés ?

    Deux frontières aux destins croisés ?

    Étude interdisciplinaire et comparative des délimitations territoriales entre la France et la Suisse, entre la Bourgogne et la Franche-Comté (xive-xxie siècle)

    Benjamin Castets Fontaine, Maxime Kaci, Jérôme Loiseau et al. (dir.)

    2019

    Un mousquetaire du journalisme : Alexandre Dumas

    Un mousquetaire du journalisme : Alexandre Dumas

    Sarah Mombert et Corinne Saminadayar-Perrin (dir.)

    2019

    Libertaire ! Essais sur l’écriture, la pensée et la vie de Joseph Déjacque (1821-1865)

    Libertaire ! Essais sur l’écriture, la pensée et la vie de Joseph Déjacque (1821-1865)

    Thomas Bouchet et Patrick Samzun (dir.)

    2019

    Les encyclopédismes en France à l'ère des révolutions (1789-1850)

    Les encyclopédismes en France à l'ère des révolutions (1789-1850)

    Vincent Bourdeau, Jean-Luc Chappey et Julien Vincent (dir.)

    2020

    Le verre du VIIIe au XVIe siècle en Europe occidentale

    Le verre du VIIIe au XVIe siècle en Europe occidentale

    Inès Pactat et Claudine Munier (dir.)

    2020

    Les révolutions du commerce. France, xviiie-xxie siècle

    Les révolutions du commerce. France, xviiie-xxie siècle

    Jean-Claude Daumas (dir.)

    2020

    Le patrimoine industriel au prisme de nouveaux défis

    Le patrimoine industriel au prisme de nouveaux défis

    Usages économiques et enjeux environnementaux

    Marina Gasnier

    2018

    La petite entreprise au péril de la famille ?

    La petite entreprise au péril de la famille ?

    L’exemple de l’Arc jurassien franco-suisse

    Laurent Amiotte-Suchet, Yvan Droz et Fenneke Reysoo

    2017

    Une imagination républicaine, François-Vincent Raspail (1794-1878)

    Une imagination républicaine, François-Vincent Raspail (1794-1878)

    Jonathan Barbier et Ludovic Frobert (dir.)

    2017

    Voir plus de chapitres

    21. Les groupes nominaux du texte. Du côté de chez Swann

    Katia Zellagui

    Voir plus de chapitres

    21. Les groupes nominaux du texte. Du côté de chez Swann

    Katia Zellagui

    Accès ouvert

    Accès ouvert freemium

    ePub

    PDF

    PDF du chapitre

    Suggérer l’acquisition à votre bibliothèque

    Acheter

    Édition imprimée

    Presses universitaires de Franche-Comté
    • decitre.fr
    • mollat.com
    • leslibraires.fr
    • placedeslibraires.fr
    • lcdpu.fr
    ePub / PDF

    1 http// www.univ-fcomte.fr

    INTEX

    X Facebook Email

    INTEX

    Ce livre est diffusé en accès ouvert freemium. L’accès à la lecture en ligne est disponible. L’accès aux versions PDF et ePub est réservé aux bibliothèques l’ayant acquis. Vous pouvez vous connecter à votre bibliothèque à l’adresse suivante : https://freemium.openedition.org/oebooks

    Suggérer l’acquisition à votre bibliothèque Acheter ce livre aux formats PDF et ePub

    Si vous avez des questions, vous pouvez nous écrire à access[at]openedition.org

    INTEX

    Vérifiez si votre bibliothèque a déjà acquis ce livre : authentifiez-vous à OpenEdition Freemium for Books.

    Vous pouvez suggérer à votre bibliothèque d’acquérir un ou plusieurs livres publiés sur OpenEdition Books. N’hésitez pas à lui indiquer nos coordonnées : access[at]openedition.org

    Vous pouvez également nous indiquer, à l’aide du formulaire suivant, les coordonnées de votre bibliothèque afin que nous la contactions pour lui suggérer l’achat de ce livre. Les champs suivis de (*) sont obligatoires.

    Veuillez, s’il vous plaît, remplir tous les champs.

    La syntaxe de l’email est incorrecte.

    Référence numérique du chapitre

    Format

    Zellagui, K. (2004). Du Côté de Chez Swann, Analyse linguistique automatique d’un texte littéraire. In C. Muller, J. Royaute, & M. Siberztein (éds.), INTEX. Besançon: Presses universitaires de Franche-Comté. https://doi.org/10.4000/books.pufc.30087
    Zellagui, Katia. « Du Côté de Chez Swann, Analyse linguistique automatique d’un texte littéraire ». In INTEX, édité par Claude Muller, Jean Royaute, et Max Siberztein. Besançon: Presses universitaires de Franche-Comté, 2004. doi:10.4000/books.pufc.30087.
    Zellagui, Katia. « Du Côté de Chez Swann, Analyse linguistique automatique d’un texte littéraire ». INTEX, édité par Claude Muller et al., Presses universitaires de Franche-Comté, 2004, https://doi.org/10.4000/books.pufc.30087.

    Référence numérique du livre

    Format

    Muller, C., Royaute, J., & Siberztein, M. (éds.). (2004). INTEX. Besançon: Presses universitaires de Franche-Comté. https://doi.org/10.4000/books.pufc.29912
    Muller, Claude, Jean Royaute, et Max Siberztein, éd. INTEX. Besançon: Presses universitaires de Franche-Comté, 2004. doi:10.4000/books.pufc.29912.
    Muller, Claude, et al., éditeurs. INTEX. Presses universitaires de Franche-Comté, 2004, https://doi.org/10.4000/books.pufc.29912.
    Compatible avec Zotero Zotero

    1 / 3

    Presses universitaires de Franche-Comté

    Presses universitaires de Franche-Comté

    • Plan du site
    • Se connecter

    Suivez-nous

    • LinkedIn
    • Flux RSS

    URL : http://pufc.univ-fcomte.fr

    Email : Presses-pufc@univ-fcomte.fr

    OpenEdition
    • Candidater à OpenEdition Books
    • Connaître le programme OpenEdition Freemium
    • Commander des livres
    • S’abonner à la lettre d’OpenEdition
    • CGU d’OpenEdition Books
    • Accessibilité : partiellement conforme
    • Données personnelles
    • Gestion des cookies
    • Système de signalement