Ressources numériques en sciences humaines et sociales OpenEdition Nos plateformes OpenEdition Books OpenEdition Journals Hypothèses Calenda Bibliothèques OpenEdition Freemium Suivez-nous

Annoter des données en langue persane

L’un des participants du cours Initxm travaille sur des données en langue persane. À ce jour, cette langue ne figure pas dans l’offre de langues des modules d’annotation sur le site dédié à TreeTagger. Nous avons suggéré à notre spécialiste de persan d’annoter ses données à l’aide de XML-TEI (voir le livre de Lou Burnard publié en 2014 : What is the Text Encoding Initiative?. Traduit en français par Marjorie Burghart en 2015 : Qu’est-ce que la Text Encoding Initiative ?).

D’autres solutions existent : pour trouver des informations sur des outils d’annotation de langues variées, on peut consulter le document DKPro Core™ Tagset Reference. Il y figure des informations sur la Uppsala Persian Dependency Treebank. Il est également possible de consulter le système de gestion Sketch Engine qui se sert d’étiqueteurs variés dont TreeTagger et qui propose actuellement trois corpus annotés en langue persane.

Language Name Words
Persian CHILDES Farsi Corpus 120,527
Persian OPUS2 Persian 4,425,133
Persian TalkBank Persian (blog posts) 474,773,547

OpenEdition vous propose de citer ce billet de la manière suivante :
Eva Lacroix (22 novembre 2017). Annoter des données en langue persane. Initiation à TXM. Consulté le 26 juillet 2026 à l’adresse https://doi.org/10.58079/qcpb


Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

This site uses Akismet to reduce spam. Learn how your comment data is processed.