L’un des participants du cours Initxm travaille sur des données en langue persane. À ce jour, cette langue ne figure pas dans l’offre de langues des modules d’annotation sur le site dédié à TreeTagger. Nous avons suggéré à notre spécialiste de persan d’annoter ses données à l’aide de XML-TEI (voir le livre de Lou Burnard publié en 2014 : What is the Text Encoding Initiative?. Traduit en français par Marjorie Burghart en 2015 : Qu’est-ce que la Text Encoding Initiative ?).
D’autres solutions existent : pour trouver des informations sur des outils d’annotation de langues variées, on peut consulter le document DKPro Core™ Tagset Reference. Il y figure des informations sur la Uppsala Persian Dependency Treebank. Il est également possible de consulter le système de gestion Sketch Engine qui se sert d’étiqueteurs variés dont TreeTagger et qui propose actuellement trois corpus annotés en langue persane.
| Language | Name | Words |
| Persian | CHILDES Farsi Corpus | 120,527 |
| Persian | OPUS2 Persian | 4,425,133 |
| Persian | TalkBank Persian (blog posts) | 474,773,547 |
OpenEdition vous propose de citer ce billet de la manière suivante :
Eva Lacroix (22 novembre 2017). Annoter des données en langue persane. Initiation à TXM. Consulté le 26 juillet 2026 à l’adresse https://doi.org/10.58079/qcpb
