Ressources numériques en sciences humaines et sociales OpenEdition Nos plateformes OpenEdition Books OpenEdition Journals Hypothèses Calenda Bibliothèques OpenEdition Freemium Suivez-nous

Utilisation de Voyant Tools sur les données de la BiblioBase : éléments de titrologie

Communication “L’Année 1824 dans la Bibliographie de la france“, matériel annexe. Partie 2.

Pour accéder à la Partie 1, suivez le lien.

Ce billet vient à l’appui d’une communication prononcée le 13 janvier 2024, intitulée « L’année 1824 dans la Bibliographie de la France », dans le cadre de la journée d’études 1824-2024 : Bicentenaire de l’Arsenal romantique de Charles Nodier, organisée par les Cahiers d’études nodiéristes à la bibliothèque de l’Arsenal (Paris)1. Cette communication donnera lieu à une publication. Mais compte tenu du format restreint de la communication et de l’article qui en sera tiré, ce billet publie les documents annexes qui en éclairent la compréhension et la lecture.

Voyant Tools2 est une boîte à outils d’humanités numériques en accès libre, conçue pour faciliter les travaux d’analyse lexicale. Comprenant pas moins de 28 outils de visualisation statistique, elle permet de réaliser simultanément plusieurs types de lectures distanciées de corpus pouvant contenir un ou plusieurs fichiers. Parmi ces outils, on compte le créateur de nuages de mots Cirrus, la ligne de temps Tendances ou le schématiseur de co-occurrences Grappes de termes.

Ces outils s’avèrent très utiles pour effectuer des analyses pointues sur les données de la BiblioBase. Ils ont été utilisés pour étudier les titres d’ouvrages à l’occasion d’une communication portée par l’ANR : “L’année 1824 dans la Bibliographie de la France3“.

Cet article poursuit deux objectifs :

  • montrer quels usages peuvent être faits des données brutes de la BiblioBase en libre accès sur Nakala4, à partir d’outils d’humanités numériques existants comme Voyant Tools ;
  • expliciter la méthodologie adoptée pour obtenir les résultats présentés lors de la communication (en voie de publication).

Sommaire

Principes généraux de titrologie dans la BiblioBase

Préparation du corpus

Outil Cirrus

Outil Tendances

Outil Grappes de termes

Perspectives et limites de l’utilisation de Voyant Tools sur les données de la BiblioBase

Principes généraux de titrologie dans la BiblioBase

L’un des intérêts de la BiblioBase, qui rassemble un très large corpus de données bibliographiques, est de mener à grande échelle des analyses lexicales pointues sur les titres d’ouvrages imprimés et vendus en France au XIXe siècle. Réaliser des statistiques lexicales à partir des titres est un moyen de repérer des tendances d’écriture, voire des modes littéraires.

Un point de vigilance est à soulever d’emblée, cependant : les mots employés dans les titres sont significatifs (sans quoi ils n’y figureraient pas), mais il le seront toujours moins pour des ouvrages de création littéraire que pour des usuels, dictionnaires, manuels ou traités. En ce sens, les ouvrages techniques seront souvent surreprésenté dans les statistiques, en nombres comme en fréquences relatives. Mais ceci n’empêche pourtant pas de mener avec pertinence des études statistiques sur les titres, qui peuvent enregistrer des tendances propres à l’emploi de mots fonctionnant comme des marqueurs génériques ou thématiques.

Il est à noter que l’ensemble des outils d’analyse statistique de Voyant Tools peuvent être employés pour réaliser des synthèses de données autres que les titres, par exemple des données de la colonne “Posture” de la BiblioBase (version abrégée) ou des colonnes “Lieux” d’impression ou d’édition (version détaillée, en cours d’édition). Notre objectif, dans le cadre de la communication sur “L’année 1824 […]”, étant d’abord de traquer les indices de la querelle romantique dans la Bibliographie de la France, ce point ne sera pas développé ici.

Retour au sommaire

Préparation du corpus

Pour réaliser une analyse lexicale des titres à partir de Voyant Tools, nous avons sélectionné un corpus fondé sur les titres d’ouvrages que nous avons copiés dans un fichier Excel par année.

Nous mettons à disposition des lecteurs les corpus suivants (CC-BY-NC5) :

  • Année 1819 (titres en version abrégée)
  • Année 1824 (titres en version abrégée)
  • Année 1824 (titres en version détaillée)
  • Année 1829 (titres en version abrégée).

Dans le chargement des données, il importe de bien sélectionner des fichiers homogènes, afin de ne pas fausser les résultats. Nous rappelons qu’en l’état, seule la version abrégée des titres de la Bibliographie de la France est publiée dans la BiblioBase (2023). Une version détaillée est en cours d’édition. Pour cette version détaillée, l’année 1824 a été traitée en priorité dans la perspective du colloque. Les données mises à disposition dans le cadre de cet article constituent une pré-publication de la seconde phase de la BiblioBase en version détaillée. Pour une analyse comparée sur trois “années repères”, l’année 1824 en version détaillée doit donc être exclue du téléchargement. En revanche, pour des analyses textuelles poussées sur l’année 1824, on utilisera le corpus des titres de l’année 1824 en version détaillée, à l’exclusion des trois autres.

Le chargement du corpus s’effectue ensuite directement sur Voyant Tools à partir du bouton “Charger”.

Le bouton “Révéler” permet de produire une analyse pré-configurée du corpus, enregistrable sous la forme d’un lien pérenne. Voici par exemple le lien permettant d’accéder aux analyses des données relatives aux titres des années 1819, 1824 et 1829 sous leur forme abrégée : https://voyant-tools.org/?corpus=cfea2771b7116bac21f075550c02dda4

Ce lien produit d’abord la page suivante :

Voyant Tools est préconfiguré pour mobiliser prioritairement cinq outils d’analyse lexicale, mais la liste des outils (décrits dans ces pages) est bien plus longue. C’est ensuite au chercheur de configurer les outils de visualisation choisis pour produire des résultats sur mesure.

Retour au sommaire

Outil Cirrus

L’outil Cirrus permet de réaliser des nuages lexicaux à partir des mots les plus fréquemment employés dans le corpus. Il est originellement pré-configuré de façon à exclure une liste de “Stop words” (mots vides). Cette liste peut être complétée. Voici la liste de mots vides employés pour produire les résultats présentés dans la communication “L’année 1824 […]” :

On remarque toutefois qu’à l’usage, il faut être attentif à vérifier dans le nuage de mots que la liste personnalisée a bien été prise en compte par le programme – ce qui ne semble pas toujours être le cas.

Si les nuages produits par Cirrus permettent de faire apparaître les mots les plus fréquemment employés par les titres, l’interprétation des résultats visuellement produits doit être guidée par la plus grande prudence. Certains principes énoncés ci-dessous peuvent sembler des évidences. Néanmoins, ils prennent une importance cruciale à l’usage des outils d’humanités numériques.

La pluralité du sens des mots

L’une des premières limitations de Cirrus concerne le lien entre statistique et sémantique. Certains mots dont les fréquences d’emploi sont apparemment remarquables rassemblent parfois sous une même bannière des titres dont les sens sont extrêmement divers.

Par exemple, pour l’année 1824, les termes relevant du radical “histo*” (dont le mot “histoire”) apparaissent dans les titres de romans et de contes, mais peuvent renvoyer à l’Histoire et au genre des romans historiques – comme le suggère la présence de Walter Scott dans les termes majoritaires (ex. Jean Bockelson, fragment historique, par Baston, catégorie “Romans et contes”, réf. 3728), tout comme à une dénomination large des genres narratifs en général (ex. Le Petit Savinien, ou histoire d’un jeune orphelin, par madame de Renneville, catégorie “Romans et contes”, réf. 663).

Extrait du contexte d’emploi du terme “histoire” – année 1824 (version détaillée). Image produite avec l’outil Contexte (Voyant Tools)
Le sens des mots en contexte

Un autre point problématique tient aux valeurs et emplois des mots dans le contexte des titres et selon le contenu des ouvrages.

Un des objectifs de la communication “L’année 1824 […]” visait à étudier les traces d’une mode romantique dans les titres de l’année. Or l’apparition du mot “romantique” dans les titres ne permet pas de confirmer ou d’infirmer le dynamisme des publications qui s’apparenteraient au romantisme à cette période car, dans le détail, les titres qui mentionnent le mot “romantique” en 1824 sont plutôt employés par des adversaires qui désignent et dénoncent une nouvelle mode littéraire jugée dangereuse.

Voici la liste des ouvrages en question, produite à partir du moteur de recherche de Nakala sur les données de la BiblioBase. Seule l’Apologie de l’école romantique (réf. 4017) est ouvertement en faveur du mouvement. Seule la consultation directe des ouvrages (qui n’est possible que sur des sous-corpus limités) permet de parvenir à cette conclusion.

De même, l’apparente forte représentation du terme « théâtre » dans les titres détaillés de l’année 1824 n’est pas à mettre au compte d’un plus grand nombre de pièces publiées, ni même d’une importance du théâtre comme thème d’analyse critique. Ce phénomène est grossi par le fait que les lieux de création des pièces étaient précisées dans les titres complets (ex. L’Héritière, comédie-vaudeville en un acte ; représentée sur le théâtre du Gymnase-Dramatique, le 20 décembre 1823, par Scribe et Delavigne, réf. 23). Or naturellement, Cirrus ne permet pas de déterminer quels sont les mots dont l’emploi est significatif dans les titres dont ils sont extraits.

Les mots propres aux études thématiques sont donc ceux qui sont les moins faciles à repérer visuellement dans les nuages produits par Cirrus. En ce qui concerne les termes génériques ou de catégorisation des ouvrages, il faudra toujours s’en référer à l’emploi en contexte, permis par l’outil Contextes (voir plus bas).

Ces difficultés se répercutent sur les usages de l’outil Tendances.

Retour au sommaire

Outil Tendances

L’outil Tendances permet d’élaborer simplement des graphiques à partir des statistiques de fréquences lexicales et en fonction de la structuration du corpus. Le nom des fichiers contenant les données apparaît alors en abscisse.

Par défaut, Tendances représente les fréquences d’emploi des cinq premiers mots les plus employés dans la totalité du corpus.

Mais n’importe lequel des mots du corpus peut faire l’objet d’une analyse dans Tendances. La configuration s’effectue dans la barre de saisie et permet un repérage à partir de mots ou de radicaux. Pour les radicaux, Tendances propose par défaut l’ajout d’un astérisque. Nous avons procédé ainsi pour repérer les emplois des mots relevant du radical “romant*”, incluant les mots “romantique(s)”, “romantisme”, “romanticisme” – mais excluant notamment les mots “roman”, “romance”, “romanesque”, etc.

En ne se basant que sur les trois années cible (1819, 1824, 1829), la courbe d’emploi de ces mots se présente comme ceci.

En revanche, une courbe d’emploi prenant en compte les titres de l’ensemble des années couvrant la période 1819 à 1829 offre un visage différent. Le lien vers l’analyse de ce corpus sur Voyant Tools est joint ci-dessous (CC-BY-NC6).

Voici la courbe d’emploi des mots relevant du radical “romant*” dans le corpus ainsi constitué :

On observe cette fois un premier pic autour des années 1824 et 1825, puis un regain d’intérêt autour de l’année 1829. Cette comparaison invite naturellement à vérifier les résultats produits sur des années sélectionnées pour échantillonnage, en les confrontant aux corpus les plus larges possibles. C’est précisément ce que permet un outil comme Tendances sur Voyant Tools.

Néanmoins, ni Cirrus ni Tendances ne permettent de rapprocher des termes relevant de la même isotopie, alors même qu’il pourrait être utile d’élaborer des sous-corpus fondés sur des thèmes généraux, auxquels se rattachent des mots indiscutablement appariés. Par exemple, pour l’année 1824 en version détaillée (comme pour n’importe quel autre corpus), les mots “funèbre”, “mort” et “tombeau” font l’objet d’un décompte distinct. Il n’est donc pas possible de se contenter d’utiliser Tendances pour visualiser sous la forme de graphiques le dynamisme de certains thèmes récurrents pouvant s’apparenter à des modes littéraires. Le décompte est grandement facilité par ces outils, mais doit faire l’objet de la constitution d’autres sous-corpus, ou d’histogrammes fondés sur les chiffres obtenus par le biais de Voyant Tools.

Retour au sommaire

Outil Grappes de termes

Sans résoudre le problème des isotopies, l’outil Grappes de termes offre toutefois des fonctionnalités intéressantes pour le corpus de la BiblioBase. Il s’agit d’un outil complémentaire de l’outil Collocations, qui représente la fréquence des co-occurrences de termes. Ces deux outils permettent d’affiner l’interprétation des termes particulièrement représentés – et dont Cirrus facilite le repérage.

Nous prenons cette fois pour objet le corpus de titres en version détaillée. En voici le lien d’analyse sur Voyant Tools :

On part du radical “Nouvelle*” identifié par Cirrus comme fortement représenté dans le corpus, pour un total de 366 occurrences.

En pointant le curseur sur le terme “Nouvelle”, on constate que la bulle la plus chaude concerne le terme “Edition”. L’outil Grappe de termes met en évidence un point paradoxal : la forte représentation du terme “Nouvelle” ne sert pas à signaler les productions d’une avant-garde littéraire, mais confirme le dynamisme des rééditions d’oeuvres antérieures, suggérée par le nuage de mots produit par Cirrus.

Co-occurrences du terme “Nouvelle” dans les titres de l’année 1824 (version détaillée). Image obtenue avec l’outil Grappe de termes.
Retour au sommaire

Outil Contexte

En dernière intention, l’outil Contexte permet de réaliser des vérifications en confrontant les analyses de mots isolés à leur emploi en contexte, dans les titres d’ouvrages. Il est à noter que si les outils Cirrus et Tendances sont inter-connectés (cliquer sur un mot dans Cirrus fera apparaître le graphique de ses emplois dans Tendances), ce n’est pas le cas de l’outil Contexte. Il faudra toujours taper le mot cible dans la barre de saisie dédiée à l’intérieur de l’outil. Contexte, qui complète l’outil Lecteur (simple module de visualisation des données brutes) s’avère nécessaire pour confronter des intuitions interprétatives aux données de recherche. Mais comme le montrent les exemples de “romant*” ou “nouvelle”, il oblige aussi fréquemment le chercheur à prolonger la liste des biais interprétatifs qui peuvent guider la compréhension des visualisations parfois spectaculaires produites par Voyant Tools.

Retour au sommaire

Perspectives et limites de l’utilisation de Voyant Tools sur les données de la BiblioBase

À l’usage, Voyant Tools s’avère un outil remarquablement performant pour analyser les données titrologiques de la BiblioBase, moyennant un travail préalable de formatage du corpus à partir des données brutes. L’outil Tendances peut également servir à comptabiliser d’autres jeux de données élaborés à partir du corpus initial. On peut par exemple très simplement isoler dans des fichiers Excel la colonne “posture” ou la colonne “Catégorie” afin de comptabiliser et de visualiser sous la forme d’histogrammes le nombre de références concernées par chacune des classes que ces colonnes recensent. Cette fonctionnalité existe naturellement dans Excel, mais s’avère bien plus facile à exploiter sur Voyant Tools, en particulier à partir de plusieurs tableaux.

Il importe toutefois de garder en tête les limites interprétatives inhérentes aux données de la BiblioBase pour poser un cadre critique ferme aux visualisations produites sur Voyant Tools. La lecture de loin est un outil formidable de repérage et de vérification d’intuitions critiques, mais elle ne saurait se substituer à la consultation des corpus. Pas plus que les éditions numériques n’ont pour vocation à remplacer les manuscrits, la lecture de loin ne saurait en aucun cas remplacer la lecture des ouvrages. Elle y invite, cependant, en attirant notre attention sur des phénomènes sous-estimés, ou surestimés.

Retour au sommaire

Elsa Courant & Jordi Brahamcha-Marin

  1. Voir le programme []
  2. Sinclair, Stéfan and Geoffrey Rockwell, 2016. Voyant Tools. Web. http://voyant-tools.org/. []
  3. E. Courant & J. Brahamcha-Marin, “L’année 1824 dans la Bibliographie de la France“, colloque “Bicentenaire de l’Arsenal romantique de Charles Nodier” organisé par Caroline Raulet-Marcet, Samantha Caretti, Marine Le Bail et Martha Sukiennicka, Bibliothèque de l’Arsenal, 13 janvier 1824 []
  4. ANR e-BdF (coord. E. Courant), E. Courant, J. Brahamcha-Marin, F. Guglielmi et G. Lafage, «BiblioBase. Tables littéraires de la Bibliographie de la France (1811-1900) – Version abrégée», en ligne sur NAKALA, https://doi.org/10.34847/nkl.586e98gl []
  5. Pour citer ces données, voici la formulation correcte : E. Courant & J. Brahamcha-Marin, titres littéraires de la BiblioBase, année(s) [ANNEE(S)], 2024. []
  6. Pour citer ces données, voici la formulation correcte : E. Courant & J. Brahamcha-Marin, support d’analyse des titres littéraires de la BiblioBase sur Voyant Tools (années 1819 à 1829), accessible en ligne dans Voyant Tools à l’adresse <https://voyant-tools.org/?corpus=8255595e744c4c238c72bd3dad875fbb>, 2024. []

OpenEdition vous propose de citer ce billet de la manière suivante :
Elsa Courant (11 janvier 2024). Utilisation de Voyant Tools sur les données de la BiblioBase : éléments de titrologie. ANR e-BdF. Une édition numérique de la Bibliographie de la France (1811-1900). Consulté le 27 juillet 2026 à l’adresse https://doi.org/10.58079/vxap


Vous aimerez aussi...

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

This site uses Akismet to reduce spam. Learn how your comment data is processed.