Du Côté de Chez Swann, Analyse linguistique automatique d’un texte littéraire
p. 281-299
Résumé
The present study deals with the automatic and linguistic analysis of a literary French text Du Côté de Chez Swann by Marcel Proust. Our main aim is to tag completely and as “perfect” as possible every unit of the text. We consider two kinds of units : the simple forms and the compounds forms. As we know, the natural language has a characteristic : the ambiguity. We use the system Intex (the main tools are the local grammars and the electronic dictionaries) because it allows the user to introduce and use his own resources in the system, which is necessary if we want to create resources in order to resolve the ambiguity problems.
Texte intégral
1La tradition du Grelis réside dans l’étude linguistique des textes littéraires en utilisant des outils informatiques. Un des objectifs de notre laboratoire est l’étiquetage morpho-lexical et syntaxique des textes littéraires. Nous avons choisi d’utiliser le système Intex car il offre la possibilité à l’utilisateur d’insérer ses propres ressources linguistiques par le biais de grammaires locales sous formes de transducteurs (automates à états finis) et des dictionnaires électroniques. Nous avions présenté aux quatrièmes journées Intex des travaux relatifs à l’étiquetage du texte Aurélien d’Aragon. Nous tenons à préciser que nous n’avons pas été en mesure de poursuivre notre recherche sur ce texte suite à des problèmes liés aux droits de diffusion des résultats sur le web.
Introduction
1 - Objectifs
2Les logiciels d’étiquetage performants actuellement disponibles sur le marché (nous avons testé Winbrill et Cordial qui sont les logiciels les plus utilisés actuellement) présentent trois défauts majeurs :
- la levée d’ambiguïté et la correction d’erreurs éventuelles passent nécessairement par une recherche manuelle dans le texte étiqueté ;
- les étiquettes assignées manquent souvent de précision ;
- le traitement des formes composées est limité voir inexistant.
3Nous avons choisi d’utiliser le logiciel INTEX parce que contrairement aux outils que nous avons décrits précédemment, il donne la possibilité à l’utilisateur d’insérer dans le système (de façon très souple) ses propres ressources linguistiques sous forme de dictionnaires électroniques ou de grammaires locales. Ainsi, nous proposons de mettre à la disposition des chercheurs des bases étiquetées de textes littéraires à des fins d’études lexicales et sémantiques de corpus.
4Nous entendons par étiquetage l’opération qui consiste à remplacer les formes du texte - ce que nous appelons tokens dans le système Intex- par les unités linguistiques correspondantes. Ces unités linguistiques sont représentées entre accolades, par exemple :
| La{la, le, Det : fs} | jeune | {jeune, jeune, A : fs} |
| femme{femme, femme, N : fs} |
5Notre premier souci réside dans la volonté d’exhaustivité, c’est-à-dire que nous avons crée des ressources de façon à passer sur tous les cas, condition nécessaire si nous voulons atteindre notre objectif prioritaire qui est d’effectuer un étiquetage aussi “parfait” que possible. Nous avons traité :
- les formes simples, c’est à dire les séquences de lettres comprises entre deux séparateurs consécutifs, par exemples l’énoncé « je prends le train dans cinq minutes. » compte sept formes simples et six séparateurs (les blancs dans ce cas) ;
- et les formes composées : séquences qui incluent au moins deux mots simples (et donc au moins un séparateur), par exemples : après-midi, pomme de terre.
6Nous n’avons pas traité dans le cadre de la présente recherche les expressions figées. Cette catégorie fera l’objet d’une étude spécifique lors de nos futurs travaux.
2 - Le corpus
7Le texte sur lequel nous avons travaillé Du côté de chez Swann de Marcel Proust nous a été fourni par les Éditions Champions, Paris.
8Nous avons effectué un certain nombre de corrections sur le texte fourni. Chaque modification apportée au texte sur support magnétique a été scrupuleusement effectuée après vérification et comparaison avec le texte sur support papier.
9Nous avons pu repérer les erreurs en appliquant les dictionnaires du système Intex. En effet, lorsqu’une forme n’est pas reconnue par le système Intex, elle est répertoriée dans la liste de mots inconnus. Les erreurs que nous avons relevées sont généralement des coquilles, nous avons présenté quelques exemples tableau 1.
| Erreurs relevées | Corrections apportées |
| baîllement | bâillement ; |
| déclanchait | déclenchait ; |
| mystérieure | mystérieuse |
| Pasiphaê | Pasiphaé, |
| Roussanville | Roussainville. |
Tableau 1 : Coquilles relevées.
10Nous avons également relevé tous les mots en début de phrase dont la première lettre est censée être une voyelle accentuée et nous avons rétabli toutes les voyelles accentuées en majuscule.
| Erreurs rencontrées | Corrections apportées |
| Evidemment | Évidemment |
| Elevé | Élevé |
| A ce point | À ce point |
| A ce signal | À ce signal |
| A ces mots | À ces mots |
| A intervalles | À intervalles |
| A la grande | À la grande |
| A quoi Swann | À quoi Swann |
| Eperdu | Éperdu |
Tableau 2 : Exemples de mots en début de phrase.
11Le texte Du Côté de chez Swann compte 420 pages. Nous avons utilisé le texte sur support papier des éditions Gallimard, 1987, 1ère édition 1913. Après application du système Intex, nous avons relevé 219 551 formes (dont 15 732 formes différentes) ; 181 492 formes simples (16 338 formes simples différentes) ; 38 043 signes de ponctuation (le point, les points de suspension, le point d’interrogation et le point d’exclamation) et 5 572 formes composées ambiguës.
3 - Les outils utilisés pour la levée d’ambiguïté
12Nous avons utilisé deux types d’outils afin de créer les ressources nécessaires à l’étiquetage du texte : les dictionnaires électroniques et les grammaires locales sous formes de transducteurs.
13Le système Intex possède un ensemble de dictionnaires : dictionnaire des formes simples et des formes composées dont chaque entrée possède une étiquette morphologique, syntaxique, flexionnelle et parfois sémantique.
14Certaines formes identiques d’un point de vue graphique possèdent plusieurs entrées d’où ambiguïté. L’ambiguïté est définie par Fuchs [1996] de la façon suivante :
« Est dite ambiguë une expression de la langue qui possède plusieurs significations distinctes et qui, à ce titre, peut être comprise de plusieurs façons différentes par un récepteur. ».
3 .1 - Les dictionnaires électroniques
15Nous avons en premier lieu utilisé les dictionnaires inclus dans le système Intex. Ces dictionnaires ont été construit par les membres du Ladl et sont nommés les DELA : Dictionnaires Electroniques du LAdl. Les trois groupes de dictionnaires sont :
- Le DELAS : Dictionnaire Électronique du LAdl des formes simples ;
- Le DELAC : Dictionnaire Électronique du LAdl des formes composées ;
- Le DELAE : Dictionnaire Électronique du LAdl des expressions figées.
- Le DELAS
16Le Delas contient 80 000 entrées. Chaque entrée est associée à un lemme, à une catégorie grammaticale ; à des informations syntaxiques et sémantiques introduites par le signe "+", puis à des informations flexionnelles introduites par le signe " : " .
17Nous avons présenté les premières entrées du DELAS.
a, avoir. V+aux : P3s
a, avoir. V+en+i+35R : P3s
a, avoir. V+i+1 : P3s
a, avoir. V+t+U+32NM : P3s
a, . N : ms : mp
abaissa, abaisser. V+se+i : J3s
abaissa, abaisser. V+t+11 : J3s
abaissa, abaisser. V+t+32RA : J3s
abaissa, abaisser. V+t+38L : J3s
– Le DELAF
18Nous rappelons qu’il y a 900 000 entrées dans le dictionnaire DELAF, qui contient toutes les flexions des entrées du DELAS. Il y a cinq fois plus de noms composés que de noms toutes catégories confondues. Le Delaf morpho-syntaxique contient pour chaque entrée :
- - la forme du texte ;
- - le lemme correspondant ;
- - la catégorie morpho-syntaxique en MAJUSCULES ;
- - chaque information flexionnelle codée par un caractère après les « ... »
19Les premières entrées du DELAF sont :
a, . N : ms : mp
a, avoir. V : P3s
à, . PREP
aa, . N : ms : mp
aabam, . N : ms
aalénien, . A : ms
aalénien, . N : ms
aalénienne, aalénien. A : fs
aaléniennes, aalénien. A : fp
- Le DELAC
20Le DELAC (dictionnaire électronique du Ladl des formes composées) a été construit par Max Silberztein [1993b].
21Les entrées sont associées à une catégorie grammaticale et quelquefois à un code flexionnel.
22Le dictionnaire des formes composées contient des noms, des adverbes, des adjectifs et des conjonctions de subordination.
3.2 - Les grammaires locales sous forme d’automates et de transducteurs
23En second lieu, nous construit une vingtaine de graphes sous formes de transducteurs à des fins d’étiquetage.
24Un transducteur contrairement à un automate (outil informatique utilisé afin de reconnaître de l’information, par exemple une séquence de lettres ou de mots, de façon booléenne) peut produire en plus de l’information. Silberztein [1997] définit le transducteur comme suit :
“afin de produire des résultats plus complexes, on utilise des transducteurs. Formellement, un transducteur est un automate dont les transitions sont étiquetées par des couples de symbole (Sr/Sp), où Sr est un symbole reconnu, et Sp un symbole produit. On utilise Sr lors de la reconnaissance et Sp afin de produire un résultat, une interprétation du symbole reconnu. Les transducteurs peuvent aussi être représentés par des expressions rationnelles ; dont les symboles seront couples (Sr/Sp).”
4 - Le pre-traitement
25La segmentation est une étape nécessaire afin de préparer le texte à l’analyse morphologique et syntaxique. Elle consiste à appliquer un ou plusieurs transducteurs (construits par l’utilisateur) afin de diviser le texte en unités textuelles (en phrases). Le transducteur Phrases.fst a été construit de façon à insérer le symbole {S} à la fin de chaque phrase.
26Nous avons utilisé la définition typographique de la phrase. Cette définition est représentée par la grammaire locale Phrases.grf qui prend en compte deux cas de figure, analogues à des règles.
4.1 – Phrases.grf
27Nous avons présenté ci-dessous le graphe Phrases.grf. Nous tenons à préciser que la grammaire locale Phrases.grf a été construite afin de segmenter le texte Du Coté de chez Swann et ne fonctionnera pas systématiquement sur d’autres textes du même auteur ou d’auteurs différents.

Graphe 1 : Transducteur « Phrases.grf ».
4.2 – Les Règles
28Nous avons construit ce transducteur selon deux règles générales :
- Règle 1
29Les ponctuations « dites fortes » sont signes de fin de phrase ce qui revient à insérer le symbole de fin de phrase après :
30Un changement de paragraphe (symbolisé par le signe <^> sous Intex) ;
Un point ;
Un point d’exclamation ;
Un point d’interrogation ;
Des points de suspension…
31lorsque ces marques sont suivies d’un mot en majuscule ou d’un nombre.
- Règle 2
32Le point est ambigu : il peut être point de ponctuation, point d’abréviation ou point d’alignement. Afin de construire le chemin correspondant à la règle 2, nous avons repéré dans le texte toutes les occurrences du point et nous avons étudié le contexte gauche-droite de chacune des occurrences. Nous avons relevé 4 287 occurrences dont 27 points de suspension, soit 4 206 points simples. Dans les 4 206 occurrences, 3 877 points sont suivis d’un mot dont la première lettre est en majuscule, 269 sont suivis d’un signe de ponctuation (guillemets, tirets…). Nous avons constaté que le point est signe d’abréviation dans 209 cas : dont 149 cas où le point est suivi d’une forme dont la première lettre est en majuscule, et 60 cas où le point est suivi d’une forme dont la première lettre est en minuscule en l’occurrence nous avons relevé les formes de, des, et, le, par exemple, M. de Charlus, M. d’Orsan, M. et Mme Verdurin, M. le Curé.
33Or, le séparateur de phrases ne doit pas être inséré dans les cas où le point est un signe d’abréviation. Nous avons donc recherché toutes les occurrences et nous avons constaté qu’il s’agissait toujours de séquences construites sur le modèle : M. <PRE>, c’est à dire la lettre M (abréviation de Monsieur) suivi d’un point suivi d’une forme dont la première lettre est en majuscule, et dans le texte il s’agit toujours d’un nom de personnage. Nous avons relevé 149 occurrences dans le texte ; nous avons présenté quelques exemples.
s plus comprendre que la peinture de " M. Biche " .{S} Comme le public ne connaît prédicateur.{S} On peut dire que avec M. Bréchot, vous avez là deux numéros qui se
avait ces mots : " de la collection de M. Charles Swann ", nous dit : " Vous avez
Comment ça, M. Grévy ? vous connaissez M. Grévy ? dit-il à Swann de l’air stupide et
parlé de cette plage de Balbec devant M. Swann {afin d’, afin de. PREP}apprendre de
e. PRO+PPV : ms} était bien peu de chose, M. Verdurin acheta pour trois cents francs
laquelle elle plaça le portrait, comme M. Vinteuil autrefois avait mis à côté de
4.3 – Application de Phrases.grf
34Le texte que nous avons obtenu après application du graphe Phrases.grf a été segmenté sans erreur. Nous avons vérifié en effet cas par cas et par le biais de la concordance que chaque symbole était inséré convenablement ce qui était effectivement le cas. Nous avons présenté les premières lignes du texte segmenté :
35{S}Longtemps, je me suis couché de bonne heure.{S} Parfois, à peine ma bougie éteinte, mes yeux se fermaient si vite que je n’avais pas le temps de me dire : "Je m’endors. "{S} Et, une demi-heure après, la pensée qu’il était temps de chercher le sommeil m’éveillait ; je voulais poser le volume que je croyais avoir encore dans les mains et souffler ma lumière ; je n’avais pas cessé en dormant de faire des réflexions sur ce que je venais de lire, mais ces réflexions avaient pris un tour un peu particulier ; il me semblait que j’étais moi-même ce dont parlait l’ouvrage : une église, un quatuor, la rivalité de François 1er et de Charles Quint.{S}
36Lors de la phase du pre-processing, Intex effectue trois étapes successives selon les besoins et les choix de l’utilisateur. Dans un premier temps, il segmente le texte, ce qui revient comme nous venons de le voir à insérer le symbole de phrase à la fin de phrase à la fin de chaque phrase. Dans un second temps, Intex traite les formes déviantes, c’est à dire les formes composées non ambiguës par exemple : aujoud’hui, parce que…
37Dans un dernier temps, Intex peut normaliser le texte en appliquant des transducteurs, ce qui consiste à rétablir les formes contractées ou élidées sous leur forme pleine. Par souci de préserver un texte “original”, nous avons choisi de ne pas effectuer la dernière étape.
5 – Les ressources linguistiques
38Une fois le texte segmenté et les formes déviantes étiquetées, il s’agit d’appliquer les ressources lexicales au texte. Intex possède un certain nombre de dictionnaires électroniques (cf. chapitre 3.1) pour les formes simples et pour les formes composées. Nous avons appliqué le Delafm pour les formes simples et l’ensemble des dictionnaires des formes composées. Nous avons ainsi obtenu une liste de mots inconnus que nous avons traitée, c’est à dire que nous avons attribué une étiquette morpho-lexicale à chacune des formes de cette liste.
5.1 - Traitement des formes composées
39Nous avons traité en premier lieu les formes composées. Ce traitement s’est effectué en deux étapes : application des dictionnaires des formes composées inclus dans Intex et validation par rapport au contexte du figement de la forme.
– Définition
40Nous rappelons brièvement que nous définissons une forme composée comme étant une séquence de formes simples contenant au moins un séparateur et dont la signification générale n’est pas directement déductible de la somme des significations de chacun des constituants.
41Une séquence est dite figée (donc composée) si elle répond à un certain nombre de contraintes de composition par exemple les pluriel obligatoires, l’institutionnalisation de l’usage [Gross, 1996].
– Application des dictionnaires électroniques
42Nous avons appliqué les dictionnaires des formes composées inclus dans Intex afin de reconnaître les formes composées. Le système Intex reconnaît des formes composées non-ambiguës (reconnaissance qui s’effectue lors du pre-processing et qui reconnaît les formes telles que : aujourd’hui, parce que) et les formes composées ambiguës : telles que cordon bleu, bassin est. Nous pouvons déterminer assez rapidement si une séquence de mots est ambiguë ou pas en étudiant son contexte.
43Deux problèmes se sont alors présentés à nous. D’une part, il s’agissait de repérer toutes les formes candidates au statut de formes composées non-ambiguës dans le texte. Pour ce faire nous avons appliqué tous les dictionnaires inclus dans le système Intex. D’autre part, nous devions trouver un moyen de gérer et de stocker l’information obtenue.
44L’application du DELAC a permis de reconnaître 5 572 formes composées ambiguës. L’inconvénient des dictionnaires des formes composées du système Intex réside dans le fait qu’ils contiennent des formes ambiguës. Intex ne propose pas un dictionnaire susceptible de reconnaître de façon certaine les formes composées non ambiguës et des formes composées ambiguës. Ce qui fait que le traitement des formes composées est long et fastidieux. Il faut en effet revenir systématiquement sur toutes les formes et étudier leur contexte de façon à déterminer leur degré de figement.
45Afin de faciliter cette étape, nous avons mis en place un programme applicable au système Intex : Diatag Intex (cf. Figure 1). Ce programme de convivialité crée sous Visual Basic par Viprey (laboratoire Laseldi, Université de Franche-Comté)1 permet d’étudier la forme composée dans son contexte et de valider (en cochant ou non la case choisie – chaque case se réfère à une étiquette morpho-syntaxique) la bonne étiquette. Si la forme n’est pas composée, aucune case n’est validée donc la forme n’est pas étiquetée et est traitée comme une séquence de formes simples (cf. Annexe 1).
46Nous avons donc effectué un traitement cas par cas des formes composées.
47Nous avons validé 3 806 formes composées non-ambiguës qui ont dès lors été étiquetées. Voici quelques exemples.
que il possède de bonté, d’ [abandon de soi, abandon de soi. N+NDN : ms/un ; Psy] Vitré dont l’ [accent aigu, accent aigu. N+NA+z1 : ms/un] losangeait sans être repris d’ [accès de jalousie, accès de jalousie. N+NDN : ms : mp/un ; Psy] il ne rencontre aucun [accident de terrain, accident de terrain. N+NDN+Conc : ms/] la détente de un [acte de foi, acte de foi. N+NDN : ms/un] aller à Pierrefonds était un [acte licite, acte licite. N+NA+E01+z3 : ms/un], si c’ était des [actions ordinaires, action ordinaire. N+NA+Conc+z2 : fp/un]
48Nous avons dès lors obtenu un texte dont les formes composées non ambiguës sont étiquetées. Une fois cette phase de l’analyse effectuée, nous avons pu entamer la désambiguïsation des formes simples.
49Nous avons appliqué le dictionnaire électronique morphologique des formes simples : le Delaf1 et le dictionnaire des chiffres romains. Le système a relevé 449 formes inconnues.
50Le dictionnaire d’œuvre de Proust contient 16 338 occurrences de formes simples dont 449 occurrences de formes inconnues au DELAS. Nous avons relevé :
51des mots étrangers, par exemple : a cup of tea ;
52des transcriptions du parler d’un personnage, par exemple : « esprimer » ;
53des formes non incluses dans les DELA, par exemple : bourgeoisisme.
5.2 - Dictionnaire Swann.dic
54Nous avons construit le dictionnaire Swann.dic qui contient 463 entrées. Il a été construit suivant le format des dictionnaires électroniques du LAdl [Courtois, 1990]. Nous avons attribué à chacune des formes un code flexionnel et syntaxique. Ci dessous les dix premières entrées du dictionnaire Swann.dic.
Abbattucci, Abbattucci. N+Hum : ms
aboutonnez, aboutonner. V+t+z1 : P2p
Abraham, Abraham. N+Hum : ms
Adam, Adam. N+Hum : ms
Adolphe, Adolphe. N+Hum : ms
Aladin, Aladin. N+Hum : ms
Albert, Albert Dürer. N+Hum : ms
Alexandre, Alexandre Dumas. N+Hum : ms
Alfred, Alfred de Vigny. N+Hum : ms
Alger, Alger. N+Top
5.3 – Les grammaires locales pour la levée d’ambiguïté
55Il est possible de lever un grand nombre d’ambiguïtés à l’aide de transducteurs. Nous avons construit une vingtaine de grammaires afin de lever certaines ambiguïtés : nous avons traité par exemple les ambiguïtés relatives aux formes : le, la, les, en, son, ton, pas, . Nous avons choisi de présenter deux grammaires locales : pas.grf et l’.grf.
- La forme pas
56Nous avons relevé 1 850 occurrences de la forme pas dans le texte. Cette forme est ambiguë. En effet, il peut s’agir :
- de la forme adverbiale, par exemple : je ne le veux pas !
- ou de la forme nominale : N+Abst : ms : mp, par exemple : il recula de deux pas !
57Nous avons effectué une concordance de la forme de façon à étudier le contexte et afin de relever les cas où la forme pas est un substantif et où elle est un adverbe. Nous avons ainsi construit le graphe pas.grf afin de lever les ambiguïtés de cette forme.

Graphe 2 : Transducteur pas.grf.
58Après application de pas.grf et par le biais de la concordance, il est possible de vérifier si des erreurs ont été commises. Nous avons constaté que les étiquettes ont été attribuées de façon correcte dans tous les cas. Nous avons levé les 1 850 ambiguïtés. Nous avons présenté quelques exemples de la concordance.
ur longtemps encore à l’âge où on ne l’a {pas, pas. ADV+Dadv} encore abstrait ce plaisir de l
due {jusqu’à, jusque. PREP} ce jour, si s’abstenir n’était {pas, pas. ADV+Dadv} faire preuve d’i
e Verdurin, c’est-à-dire à s’éloigner à chaque {pas, pas. N+Abst : ms : mp} d’Odette, qui descenda
r les petits avantages qu’elle m’avait donnés non {pas, pas. ADV+Dadv} en eux-mêmes et comme
dications du texte ; puis il s’éloignait du même {pas, pas. N+Abst : ms : mp} saccadé.{S} Et rien ne
i toutes les raisons qu’elle avait de ne {pas, pas. ADV+Dadv} mentir ; elles auraient pu ruin
avait pas : " Oh ! pas de catleyas ce soir, {pas, pas. ADV+Dadv} moyen de me livrer à mes petits
- Levée d’ambiguïté de l’
59La forme l’ qui possède 2 616 occurrences dans le texte présente une double ambiguïté, ce qui complexifie l’étape de désambiguïsation. L’ambiguïté est d’une part d’ordre morphologique : le ou la et d’autre part d’ordre syntaxique : pronom préverbal ou déterminant.
60Dans l’énoncé, sans la proposition P1 il serait difficile de savoir si le l’ se réfère à la forme le ou à la forme la :
[…] elle redescendait si vite, que le moment où je l’entendais monter, […]
| P1 | P2 |
61Le transducteur traite le cas où l’ est un pronom et un cas où l’ est un déterminant.

Graphe 3 : Transducteur l’.grf.
62Le cadre l’autre renvoie à un transducteur qui gère les séquences de type : l’ suivi de la forme autre, selon qu’il s’agisse d’une séquence libre (déterminant plus adjectif) ou d’une séquence figée (pronom) .
63Nous avons relevé 79 séquences, par exemple :
au champion des duchesses, au moins {l’autre, le autre. PRO+z1 : ms} a son
titre ; il est touj
re la manière que {l’un, l’un. PRO : ms} ou {l’autre, le autre. PRO+z1 : ms} avait de débiter, de
e l’humanité chez qui la curiosité qu’à {l’, le. DET+Ddef+z1 : fs}
l’{autre, autre. A : fs} moitié
64Le transducteur l’.grf remplace la forme contractée l’ par sa forme correspondante et permet de spécifier sa catégorie grammaticale.
65Nous avons procédé de la même manière que précédemment afin de construire le graphe l’.grf, c’est à dire que nous avons effectué une concordance de la forme l’ et nous avons observé ses contextes gauche-droite. Nous avons constaté par exemple que la forme l’ renvoie au déterminant le lorsque cette dernière est suivie d’un nom au masculin singulier, lui-même précédé ou non d’un ou plusieurs adjectifs qualificatifs au masculin singulier coordonné(s) par une conjonction de coordination, par exemple :
ette, dont il avait eu, à ce moment-là, le brusque et impuissant soupçon, il la tenait là, écla
té dont un réseau d’ombre noire cernait le factice et tremblant contour.{S}
Quand un rayon de s
66Le transducteur l’ a permis de lever 2 600 ambiguïtés, par exemple.
balance des devoirs et des exigences de {l’, le. DET+Ddef+z1 : fs} amitié sur un simple mouvement
ait toute la tendresse naturelle, toute {l’, le. DET+Ddef+z1 : fs} ample douceur qu’elles réclamaient à
re inviter chez ces deux grandes dames, {l’, le. DET+Ddef+z1 : fs} ancienne concierge et la cocotte
l’avait pas trouvée chez les Verdurin - { l, le. PRO+PpvLE+z1 : 3ms : 3fs } aideraient à arriver, sans avoi
he n’est pas en lui, mais en moi.{S} Il { l, le. PRO+PpvLE+z1 : 3ms : 3fs } y a éveillée, mais ne la connaît
geait la conversation si je cherchais à {l, le. PRO+PpvLE+z1 : 3ms : 3fs} y amener.{S} Je me rabattais
me avec lui ; puis tant j’avais peur que {LOC} d’une seconde à l’autre mon grand-père et mon père
67Cependant, le graphe l’ n’a pas pu lever toutes les ambiguïtés, ceci est généralement lié au fait que la forme qui suit le l’ est elle-même ambiguë, dans l’exemple qui suit la forme allée est considérée comme un verbe au participe passé alors qu’il s’agit du nom
de l’arrêter pour qu’elle pût descendre {l, le. PRO+PpvLE+z1 : 3ms : 3fs} allée à pied.{S} Et les jours où je me
68Le cas du l’ est très représentatif des problèmes que nous avons rencontrés lors de la construction des grammaires locales de levée d’ambiguïté. Car une telle forme ne peut être désambiguïsée si la forme qui la suit ou qui la précède l’a été au préalable.
Conclusion
69À ce stade de notre recherche, nous avons obtenu un texte segmenté dont les formes composées sont étiquetées. Les grammaires locales construites ont permis de lever plus de 10 000 ambiguïtés. Nous avons traité 10 des 50 formes simples les plus fréquentes. Nous complétons actuellement la bibliothèque de grammaires locales afin d’atteindre notre objectif qui est, rappelons-le, d’obtenir un texte étiqueté sans erreur.
Bibliographie
Des DOI sont automatiquement ajoutés aux références bibliographiques par Bilbo, l’outil d’annotation bibliographique d’OpenEdition. Ces références bibliographiques peuvent être téléchargées dans les formats APA, Chicago et MLA.
Format
Bibliographie :
Fuchs Catherine, 1996, Les ambiguïtés du français, Collection l’Essentiel français.
Gross Gaston, 1996, Les expressions figées en français : noms composés et autres locutions, Collection L’essentiel français.
Gross Maurice, 1986, grammaire transformationnelle du Français, Syntaxe du nom, éditions Cantilène.
Silberztein Max, 1990, “Le dictionnaire électronique des noms composés”, Dictionnaires Électroniques du Français, Langue française, n° 87, Paris : Larousse, 71-84.
Silberztein Max, 1990, « Le dictionnaire électronique des noms composés », Dictionnaires Électroniques du Français, Langue française, n° 87, Paris : Larousse, 71-84.
Silberztein Max, 1993a, Dictionnaires électroniques et analyses automatiques de textes : le système INTEX, Paris : Masson.
10.1075/li.17.2.06sil :Silberztein Max, « Les Groupes Nominaux productifs et les noms composés lexicalisés », Linguisticae Investigationes, XVII : 2, Laboratoire d’Automatique Documentaire et Linguistique, Paris VII, 1993b.
Annexe
Annexe : Copie écran de Diatag

Notes de bas de page
1 http// www.univ-fcomte.fr
Auteur
-
Katia Zellagui
LASELDI, Université de Franche-Comté
Le texte seul est utilisable sous licence Licence OpenEdition Books. Les autres éléments (illustrations, fichiers annexes importés) sont « Tous droits réservés », sauf mention contraire.
La formation d’une opinion démocratique
Le cas du Jura, de la révolution de 1848 à la « république triomphante » (vers 1895)
Pierre Merlin
2017
Les mutations récentes du foncier et des agricultures en Europe
Gérard Chouquer et Marie-Claude Maurel (dir.)
2018
Deux frontières aux destins croisés ?
Étude interdisciplinaire et comparative des délimitations territoriales entre la France et la Suisse, entre la Bourgogne et la Franche-Comté (xive-xxie siècle)
Benjamin Castets Fontaine, Maxime Kaci, Jérôme Loiseau et al. (dir.)
2019
Un mousquetaire du journalisme : Alexandre Dumas
Sarah Mombert et Corinne Saminadayar-Perrin (dir.)
2019
Libertaire ! Essais sur l’écriture, la pensée et la vie de Joseph Déjacque (1821-1865)
Thomas Bouchet et Patrick Samzun (dir.)
2019
Les encyclopédismes en France à l'ère des révolutions (1789-1850)
Vincent Bourdeau, Jean-Luc Chappey et Julien Vincent (dir.)
2020
Le patrimoine industriel au prisme de nouveaux défis
Usages économiques et enjeux environnementaux
Marina Gasnier
2018
La petite entreprise au péril de la famille ?
L’exemple de l’Arc jurassien franco-suisse
Laurent Amiotte-Suchet, Yvan Droz et Fenneke Reysoo
2017
Une imagination républicaine, François-Vincent Raspail (1794-1878)
Jonathan Barbier et Ludovic Frobert (dir.)
2017
