SIMBA est une application web d’analyse et de comparaison des activités journalières humaines. Ce développement informatique de recherche a été développé dans le cadre de deux projets dont MOBI’KIDS qui ont financé la Thèse de Clément Moreau. SIMBA permet à des experts d’analyser de large volume de données décrivant les activités humaines. Chaque activité est potentiellement décrite par plusieurs dimensions : type d’activités, lieu de l’activité, mode d’accompagnent, etc. Les activités sont ordonnées et ont une durée. Elles forment ainsi des séquences journalières. Elles sont issues des données brutes des capteurs GPS qui ont été enrichies automatiquement par la tablette et lors des entretiens. Elles ont alors un sens : une sémantique. Les séquences sémantiques journalières peuvent être comparées sans forcément utiliser les positions GPS des individus, mais en se focalisant sur l’ordre, la durée et le sens des actions réalisées. Cela permet de conserver l’anonymat tout en comparant des séquences réalisées dans des lieux différents.

SIMBA permet de répondre à la question suivante :
Parmi ce grand ensemble de séquences d’activités journalières, y a-t-il des groupes qui se dégagent et quels sont les éléments qui les caractérisent ?
Nous comparons :
- Les activités à l’aide d’ontologies. Une ontologie est une structure (graphe) qui regroupe les activités selon leurs relations, par exemple « faire du vélo » est une sous activité de « mobilité active »
- Les séquences à l’aide de nouvelles mesures de similarité proposées dans le cadre de ce projet
- Contextual Edit Distance : CED
Compte les modifications pour transformer une séquence en une autre en tenant compte de
l’ontologie, des répétitions et des activités proches - Fuzzy Temporal Hamming distance : FTH
Améliore CED en tenant compte de la durée des activités, mais oblige les deux séquences à avoir la
même durée, 24 h par exemple
- Contextual Edit Distance : CED

À l’aide de SIMBA, nous pouvons alors :
- Réaliser des analyses statistiques sur l’ensemble des séquences qui portent sur :
- Le nombre d’activités
- L’enchaînement des activités
- Les habitudes de déplacements (patterns)
- Définir des groupes de séquences d’activités similaires (clusters) pour extraire automatiquement des groupes de séquences proches, puis décrire ces groupes pour identifier leurs caractéristiques saillantes.


Dans cet exemple, 6 clusters ont été définis, les séquences du cluster 1 se caractérisent par un très grand pourcentage de transports motorisés (barres rouges) comparés aux autres clusters.
Cette application d’analyse et de comparaison des activités permet à des experts d’extraire automatiquement :
- des liens entre les comportements et les caractéristiques des individus,
- des formes d’habitudes familiales en termes d’usage des transports, d’occupations quotidiennes.