Atlas Index
Indexation assistée de fonds audiovisuels
First pass NLP + référentiels + file HITL: zéro publish sans validation

Plateforme audiovisuelle institutionnelle
Contexte
Pour une plateforme de diffusion de contenus académiques et culturels, le volume d'indexation manuelle ne tenait plus. On a conçu un service d'assistance: le système propose des métadonnées normalisées à partir des transcriptions et des référentiels métier. L'humain reste seul décisionnaire avant publication dans le catalogue.
Challenge
Volume en hausse, indexation hétérogène, faible découvrabilité. Objectif de design: réduire fortement le temps de first pass sans auto-publier des erreurs de référentiel (personnes, thèmes, droits).
Solution
Chaîne ingestion (transcripts existants ou ASR) → extracteurs NER/topics/embeddings → alignement sur listes contrôlées → score par champ → file HITL clavier → API publish uniquement après validation → log accept/reject pour retuner seuils et prompts.
Baseline
Sans assistance: indexation 100 % manuelle, temps variable selon le type d'œuvre, backlog qui grossit plus vite que la capacité éditoriale. La métrique utile n'est pas la latence NLP seule, c'est minutes médianes jusqu'à une fiche validable.
Résultats
- Suggestions avec score de confiance par champ
- Aucune métadonnée publiée sans validation humaine
- API OpenAPI réutilisable par le CMS / player
- Boucle d'apprentissage sur acceptations et rejets (seuils, pas forcément fine-tune J+1)
Décisions d'architecture
Choix: Extracteurs spécialisés + LLM pour normalisation
Pourquoi: Reproductibilité et coût sur le volume; le LLM ne porte pas tout le pipeline.
Rejeté: LLM seul bout-en-bout (coût, non-déterminisme, contrôle référentiel faible)
Choix: Alignement sur listes contrôlées
Pourquoi: Interop catalogue et qualité éditoriale; free-text tags pourrissent la recherche.
Choix: HITL obligatoire avant publish
Pourquoi: Faux positifs personnes/thèmes/droits = risque réputation et dette catalogue.
Rejeté: Auto-publish au-dessus d'un seuil global unique
Limites
- La latence NLP sur texte court n'est pas le temps bout-en-bout (ASR, file HITL, relecture).
- Multi-langues, diarisation et OCR de slides restent des cas durs: on les isole dans le backlog.
- Sans référentiel propre, l'IA accélère le chaos: on commence par l'inventaire des listes.
Checklist pour refaire chez toi
- Inventorier référentiels (personnes, thèmes, droits) et qualité actuelle des fiches
- Mesurer baseline: minutes médianes / ressource sur 50-100 items
- Choisir 1 type de contenu pour le POC (pas tout le fonds)
- Définir le schéma métadonnées et les champs à score
- Construire la file HITL avant tout fine-tune
- Logger accept/reject par champ
- API publish séparée de la suggestion
- Seuils par champ + politique de double validation


