Actualités / Intelligence artificielle et données
Condé Nast réduit le temps de recherche vidéo de 250 minutes à 2 minutes grâce à l'IA multimodale Publié le 29 septembre 2026 par Christ-loisele (2 min de lecture)
Condé Nast a déployé une solution d'intelligence artificielle basée sur Amazon Bedrock et OpenSearch pour indexer 140 000 vidéos. Les équipes éditoriales de Vogue, GQ et Vanity Fair gagnent désormais des heures de travail par tâche grâce à une recherche sémantique et visuelle.
Vidéo (Vimeo)
Un gain de productivité radical pour les médias
Avant l’adoption de cette solution, les équipes éditoriales de Condé Nast passaient en moyenne 250 minutes par tâche à fouiller une bibliothèque de plus de 140 000 vidéos, en s’appuyant uniquement sur les titres et descriptions, selon le blog AWS Machine Learning . Avec le nouveau système, ce temps est désormais ramené à moins de 2 minutes , grâce à une indexation multimodale combinant visuels, audio et transcriptions.
Les équipes éditoriales de Condé Nast gagnent désormais des heures de travail par tâche grâce à une recherche sémantique et visuelle qui tolère les fautes de frappe et se concentre sur l’intention.
Image : Two-plane architecture: an asynchronous ingestion and indexing pipeline and a synchronous query and serving tier (Amazon Web Services, image officielle)
Une architecture technique innovante
La solution repose sur deux piliers techniques : un pipeline d’ingestion asynchrone et un plan de service synchrone pour les requêtes, comme l’explique le blog AWS . Les vidéos, stockées dans Amazon S3, sont segmentées et leurs embeddings multimodaux générés via le modèle TwelveLabs Marengo sur Amazon Bedrock. Ces embeddings sont ensuite indexés dans Amazon OpenSearch Service pour permettre une recherche par similarité vectorielle.
Le pipeline utilise Amazon ECS avec AWS Fargate et un groupe Auto Scaling pour traiter les segments en parallèle, optimisant ainsi les performances.
Une recherche intuitive et précise
Les utilisateurs peuvent désormais formuler des requêtes en langage naturel, comme « contenu de yoga pour débutants », et obtenir des extraits pertinents avec des horodatages précis, précise Dataforcee Digital . La solution tolère les fautes de frappe et se concentre sur l’intention plutôt que sur des correspondances exactes de mots-clés. Elle permet aussi une recherche par image : un utilisateur peut télécharger une photo de référence pour trouver des contenus visuellement similaires dans l’archive.
Ce que cela change ici
Pour les médias et administrations béninoises ou ouest-africains gérant des archives vidéo volumineuses, une telle solution pourrait automatiser la recherche de contenus et réduire drastiquement les temps de production. Par exemple, les chaînes de télévision publiques ou les plateformes éducatives pourraient indexer leurs émissions ou cours en ligne pour faciliter l’accès aux extraits pertinents, tout en libérant du temps pour les équipes éditoriales ou pédagogiques. Les institutions gouvernementales, comme celles gérant des archives audiovisuelles historiques, pourraient aussi en tirer profit pour rendre leurs fonds accessibles via des requêtes naturelles ou visuelles , sans nécessiter de compétences techniques avancées.
Sources