Lausanne Time Machine — Métiers


Notre projet

Les annuaires vaudois constituent une source historique riche permettant d'observer la société à travers les métiers exercés, les communes et l'évolution des activités professionnelles au fil du temps.

Ce projet vise à explorer ces données entre 1901 et 1940 afin de mieux comprendre l'organisation socio-professionnelle du canton de Vaud, et plus particulièrement de la région lausannoise.

Question de recherche

Notre travail s'articule autour de la question suivante :

« Comment les métiers et leur répartition géographique évoluent-ils dans le canton de Vaud entre 1901 et 1940 ? »

Sources des données

Nos sources viennent exclusivement des Annuaires vaudois des années 1901, 1910, 1920, 1930 et 1940. L'objectif était de transformer ces documents historiques bruts en données exploitables.


De l'OCR classique à l'Analyse Sémantique

Initialement, l'extraction reposait sur une méthode OCR (Tesseract). Cette approche a été abandonnée face à plusieurs limites techniques :

La solution finale s'appuie sur une analyse sémantique par LLM, permettant une conversion directe du format image (.jpg) au format structuré (.json) pour une exploitation immédiate.


Data Pipeline et Traitement

Notre chaîne de traitement s'articule en plusieurs étapes clés :

  1. Extraction (Gemini 3.5 Flash) : Conversion des pages JPG en structure hiérarchisée JSON.
  2. Gestion du Contexte : Un script Python gère les dépendances entre les pages. Quand le LLM détecte une information coupée, il ajoute le marqueur "CONTINUATION FROM PREVIOUS" et le script recolle les morceaux.
  3. Classification : Agglomération des métiers en catégories sémantiques cohérentes via des clusters LLM et des scripts par mots-clés.
  4. Géocodage : Résolution des coordonnées de manière automatisée avec Nominatim, couplée à un traitement manuel pour les communes non reconnues ou mal orthographiées