INFOS

#Blog

[S2ep18] Patrimoine, données, énergie : la triple pression sur l’archiviste audiovisuel

Blog Image

Archiviste, media asset manager : longtemps reléguée au sous-sol des productions, la fonction se retrouve au centre du jeu. L’intelligence artificielle lui promet la puissance. Elle lui impose surtout de nouveaux comptes à rendre.


Il y a dix ans, personne ne se battait pour le poste. Aujourd’hui, quand un groupe audiovisuel découvre qu’il peut vendre davantage d’extraits en indexant automatiquement son fonds, c’est l’archiviste qu’on convoque en réunion de direction. Bonne nouvelle ? En partie. Car la même technologie qui revalorise le métier le somme aussi de justifier chaque téraoctet conservé, chaque métadonnée générée, chaque kilowattheure dépensé.


Allée de stockage de bobines de film dans un centre d’archives

Le fonds physique n’a pas disparu : il coexiste désormais avec des pétaoctets de fichiers, des index automatiques et des obligations contractuelles de conservation.

Un métier qu’on a longtemps pris pour un entrepôt

Une injustice ? Dans l’organigramme d’une production, l’archiviste ou le media asset manager a longtemps occupé la case des coûts fixes. On l’appelait quand un master avait disparu, quand une chaîne réclamait une version sans logo, quand un distributeur demandait un élément vingt ans après la première exploitation. Le reste du temps, il rangeait.


Cette lecture était fausse, et elle l'était déjà avant l'IA. La recommandation technique CST-RT-043, révisée en mai 2025 par la Commission supérieure technique de l'image et du son, le rappelle sans détour : depuis l'arrêté du 7 octobre 2016, un producteur français a l'obligation de rechercher l'exploitation suivie de son oeuvre, donc de garantir un accès pérenne au matériel fichier nécessaire a toute nouvelle exploitation, sans limite de temps et a une qualité au moins égale a la finition native. La conservation n'est pas une option de confort, c'est une obligation contractuelle. Et l'un des points saillants de la revision 2025 est explicite : rendre obligatoire un jeu minimal de métadonnées.


Autrement dit, bien avant que l'IA n'entre dans le vocabulaire courant du secteur, le législateur et la profession avaient déjà tranché. Un fichier sans métadonnée n'est pas un actif, c'est un coût de stockage. La Ficam a d'ailleurs relayé la publication du texte révisé auprès des prestataires techniques, signe que le sujet est sorti du cercle des documentalistes.


Ce qui a changé avec l'IA, ce n'est donc pas la nature du problème. C'est son échelle. On peut désormais décrire, transcrire, segmenter et taguer des volumes que personne n'aurait pu traiter à la main. Et quand une tâche devient possible à grande échelle, elle devient exigible.


Ce que l'IA a réellement débloqué

Le chiffre le plus parlant vient de l'Institut national de l'audiovisuel (INA), qui conserve plus de 27 millions d'heures de documents télévision et radio. Pour construire la plateforme data.ina.fr, l'Institut a traité 700 000 heures de contenus, un volume que son directeur éditorial Antoine Bayet décrivait comme n'étant tout simplement « pas analysable à l'échelle humaine ».


La mécanique est instructive parce qu'elle est sobre. Trois outils, pas plus : Whisper pour la transcription automatique de la parole, TextRazor pour l'extraction d'entités nommées, et InaSpeechSegmenter, développé en interne faute d'éditeur spécialisé sur ce besoin précis, pour segmenter les flux audio et identifier le genre des intervenants. Xavier Lemarchand, responsable de l'intégration de l'IA a l'INA, expliquait a Archimag que l'idée avait germé trois ans plus tôt, face à un data lake devenu ingérable et a un vrai problème de découvrabilité.


“Ce ne sont plus uniquement les archives qui nous intéressent, ce sont aussi les métadonnées.”

Camille Pettineo et Xavier Lemarchand, INA, dans Blog du Moderateur


C’est un basculement de doctrine. Pendant des décennies, la métadonnée était un moyen d'accéder au contenu. Elle devient un produit à part entière, exploitable, vendable, analysable. Un chiffre cité lors d'une étude de cas du MIFC donne la mesure du gain : la transcription complète des archives de l'INA passe à environ deux ans avec l'IA, contre une centaine de milliers d'années à l'échelle humaine. Le rapport est absurde à force d'être grainé, et c'est précisément pour cela qu'il a changé les arbitrages budgétaires.


Côté industrie, le discours est encore plus direct. Philippe Petitpont, cofondateur de Moments Lab (ex-Newsbridge), avançait en avril 2026 sur Advanced Television un constat commercial brutal : alors que plus de 80 % de la consommation vidéo se fait désormais sur les plateformes digitales et sociales, ses clients ne monétisent qu'entre 1 et 4 % de leur contenu. Ou encore l'exemple de Banijay Entertainment, qui vise le passage d'un modèle à 800 dollars par clip à un workflow à 10 dollars, avec des délais réduits de 75 % sur les contenus issus d'archives.


On peut trouver ces chiffres marketing. Ils sont probablement optimistes. Mais l'ordre de grandeur, lui, explique pourquoi les directions financières ont soudainement pris le sujet au sérieux, et pourquoi l'archiviste se retrouve invité à des réunions où il n'allait jamais.

Schema des composants d'un systeme de media asset management

Ingest, metadonnees, transcodage, recherche, workflow, archivage : la cartographie classique d'un MAM. L'IA ne remplace aucune de ces briques, elle s'insère dans chacune.



La capacité : passer de l'heure au million d'heures

Sur le papier, la question de la capacité est réglée. TwelveLabs annonce une ingestion multimodale a environ soixante fois le temps reel, soit une heure de vidéo indexée en une minute, et plus de 10 000 heures traitées par jour. Moments Lab revendique plus de 1,2 million d'heures indexées avec son modèle MXT-2. 


Ces volumes changent la nature du travail. Tant que l'indexation coutait cher, on sélectionnait. On décidait ce qui mérite d'être décrit. Ce tri était un acte éditorial, souvent le plus important de la journée d'un documentaliste. Quand l'indexation devient quasi gratuite à l'unité, la tentation est de tout indexer, puis de laisser la recherche faire le tri.


C'est là que la critique commence, et elle n'est pas technique. Elle est documentaire. Un fonds où tout est tagué au même niveau de confiance est un fonds où plus rien n'est hiérarchisé. Les lignes directrices de l'Archives and Records Association britannique sont limpides sur ce point : l'IA ne sera utile et fiable que si les collections sont préparées selon quatre dimensions, dont la complétude documentée. Il faut savoir dire si le corpus numérique est complet, partiel ou échantillonné, et pourquoi certains éléments manquent.


Traduit en langage de production : si votre index automatique couvre 100 % des rushes d'une saison, mais seulement 40 % de la saison précédente, et que rien ne le signale, votre moteur de recherche mentira par omission. Il ne se trompera pas, il répondra simplement à côté, avec l'assurance tranquille des systèmes qui ignorent ce qu'ils ignorent.


La vitesse et son revers : le contrôle qualité devient le métier

Il faut dire les choses clairement : l'IA d'indexation se trompe, et elle se trompe avec aplomb. L'étude Careless Whisper, menée par des chercheurs de Cornell et de l'Université de Virginie, a quantifié le phénomène sur le modèle le plus utilisé du secteur : environ 1,4 % des segments audio analysés ont produit une hallucination, c'est à dire du texte entièrement fabriqué qui n'existe nulle part dans la source. Et parmi ces transcriptions hallucinées, près de 40 % contenaient un élément problématique, de l'association inexacte à la fausse autorité.


1%, direz-vous. Sur une interview de cinquante minutes, c'est un incident. Sur 700 000 heures, c'est une industrie de la correction. L'INA ne s'y est pas trompée : le taux de confiance annoncé pour data.ina.fr est de 83 %, avec une méthode de « vérités terrain » et des contrôles humains systématiques, la reconnaissance des noms propres restant le point faible identifié.


La recherche académique confirme que ce contrôle qualité est devenu une activité en soi. Une enquête publiée dans Archival Science, fondée sur quinze entretiens d'archivistes en poste, décrit trois étapes désormais standard dans les workflows IA : le prétraitement, l'évaluation de qualité, puis la remédiation. Un des professionnels interrogés y résume sa parade avec une précision d'artisan : 

“le champ auteur est celui sur lequel le modèle hallucine le plus, alors en post-traitement, on vérifie que la valeur proposée apparait quelque part dans le document, et sinon on la marque pour relecture humaine. Nous devons vérifier, doublement vérifier, voire tripler la vérification que la transcription est exacte. Donc, nous devons y retourner et corriger les transcripts.”

Archiviste interrogée dans l'étude « Archivists' use of AI », Archival Science, 2026


Le paradoxe est savoureux. On a automatisé la saisie pour libérer du temps, et on a créé une charge de vérification que personne n'avait budgétée. Dans les faits, beaucoup de structures découvrent que le gain net dépend entièrement de la qualité de leur chaine de contrôle. Sans elle, l'IA ne produit pas de métadonnées, elle produit du bruit indexable.


Le biais, angle mort des fonds anciens

La reconnaissance de visages est le service le plus demandé par les producteurs. C'est aussi le plus fragile sur les fonds anciens. Les travaux du MIT et de Microsoft avaient établi des écarts spectaculaires : moins de 1 % d'erreur de classification de genre pour les hommes blancs, 35 % pour les femmes noires. Les modèles récents ont resserré l'écart, comme le notent les synthèses des évaluations du NIST, mais le taux d'erreur reste souvent environ deux fois supérieur pour les visages africains que pour les visages caucasiens.


Or, les archives audiovisuelles cumulent tous les facteurs aggravants : pellicule dégradée, éclairages d'époque, définitions faibles, cadrages larges, populations sous-représentées dans les corpus d'entrainement. Comme le rappelle Telecom Paris, ces algorithmes produisent des prédictions probabilistes à partir de données d'entrée incomplètes. Sur un master 4K contemporain, ça fonctionne. Sur un 16 mm des années 1970 numérisé en SD, on entre dans le domaine de la conjecture.


Le problème n'est pas seulement l'erreur. C'est sa persistance. Une métadonnée fausse inscrite dans un MAM devient, au bout de quelques années, une source. Elle est reprise dans un catalogue, citée dans un documentaire, republiée. Dans Archives and Records formule l'avertissement avec justesse : l'IA risque d'aggraver des difficultés anciennes autour de la description archivistique, du biais et du pouvoir, particulièrement la où les collections sont fragmentaires, mal décrites ou documentées avec une terminologie datée, voire préjudiciable.


Pour un producteur, le risque est prosaïque : une attribution erronée dans un extrait vendu, et c'est le contentieux. Pour un archiviste, c'est plus grave : c'est la fiabilité de son référentiel qui se dissout, silencieusement.


La compatibilité, ce sujet dont personne ne veut parler

Chaque éditeur promet une intégration transparente. La réalité du terrain est plus mesquine. Un MAM historique, un moteur IA tiers, une brique de sous-titrage, un outil de clipping, un stockage froid, et par-dessus un schéma de métadonnées maison hérité de trois réorganisations : c'est le paysage habituel.


La profession dispose pourtant d'un socle. L'European Broadcasting Union maintient EBUCorePlus, ontologie qui remplace désormais l'ancien EBUCore et le modèle CCDM, avec une précision qui compte : cette version n'est pas rétrocompatible. Elle peut être mappée vers ses prédécesseurs, mais le mapping se paie en temps d'ingénierie. Détail éloquent : cette spécification est maintenue par le groupe Metadata and Artificial Intelligence de l'EBU. Métadonnées et IA sont désormais un seul et même chantier normatif.


Le mouvement de consolidation du marché ajoute une couche d'incertitude. Dalet et Veritone ont noué un accord sur la monétisation des archives. Axle AI a racheté en mars 2026 la ligne de produits Portfolio a Extensis. Moments Lab s'appuie sur le réseau de partenaires AWS avec des tarifs d'indexation prénégociés. Chaque rapprochement simplifie une chaine et en verrouille une autre.


Mais, que se passe-t-il pour mes métadonnées enrichies le jour où je change de fournisseur ? 

Si la réponse implique un export propriétaire non documenté, l'IA n'a pas créé un actif. Elle a créé une dépendance.


Le coût, ou l'art de déplacer la ligne budgétaire

Sur la transcription, l'écart est documenté et considérable. Les comparatifs sectoriels situent la transcription humaine de qualité autour de 100 a 150 euros par heure audio, contre environ 10 euros par heure en automatique. Les tarifs européens de transcription IA tournent, entre 0,10 et 0,30 euro la minute, avec un fichier d'une heure traite en moins de cinq minutes.


Mais la transcription n'est qu'une ligne. Le vrai coût d'un projet d'archives, c'est le stockage, et là, le débat n'est pas tranché. Le comparatif d'Archiware chiffre S3 Standard a plus de 1,5 million de dollars sur dix ans pour un pétaoctet, contre 3,60 dollars par téraoctet et par mois pour Glacier Flexible. Mais il ne faut pas négliger les frais de désarchivage qui peuvent exploser... Une analyse Quantum conclut que la bande reste l'option la moins couteuse au bit sur trois ans, avec des restitutions de 2,5 à 50 fois plus rapides et gratuites.


Face à cela, les défenseurs du cloud, comme Imagen, rétorquent que les coûts cachés de gestion des bibliothèques LTO, les rafraichissements technologiques périodiques et la logistique annulent l'avantage initial. Les deux camps ont raison, mais pas sur la même question : le cloud gagne sur l'agilité des workflows actifs, la bande gagne sur la conservation froide de longue durée. Un cabinet spécialisé le formule en une phrase que tout producteur devrait afficher.


“Le calcul change quand on cesse de regarder la ligne mensuelle pour regarder le cycle de vie sur une décennie. En intégrant les frais de sortie, le cout des requêtes API et les inévitables ajustements tarifaires des fournisseurs, une librairie de bandes physiques s'amortit souvent en dix-huit mois sur un déploiement à l'échelle du pétaoctet.”

Tim Gerhard, cite par Magstor


Il faut ajouter la génération en cours. Le LTO-10 lancé en juin 2025 apportait 30 To natifs, et Le Monde Informatique rapportait l'annonce de cartouches LTO-10 de 40 To natifs, compatibles avec les mêmes lecteurs, disponibles. Pour un archiviste, cette continuité matérielle vaut mieux qu'un discours sur l'infini du cloud.

Librairie de bandes. Pour les archives froides, l'économie d'énergie de la bande sur le disque ou le cloud est estimée jusqu'a 90 % par les acteurs du secteur.


L'énergie : le sujet que l'IA a rendu inévitable

C'est probablement le point le plus inconfortable de cet épisode, et il concerne directement la profession. L'ADEME recense 352 centres de données actifs en France pour environ 10 TWh annuels, soit 2,2 % de la consommation électrique nationale, et projette une multiplication par 3,7 d'ici 2035 si les tendances se poursuivent. En intégrant les consommations importées, la demande liée aux usages français grimperait a 105 TWh en 2035 et près de 300 TWh en 2060, avec 23,5 puis 62,5 millions de tonnes équivalent CO2 associés. L'agence écrit qu'une forte expansion tendancielle serait incompatible avec l'accord de Paris.


À cela s'ajoute un effet local que la recherche vient de documenter. L'étude The data heat island effect, conduite par l'équipe d'Andrea Marinoni à partir de vingt ans de mesures satellitaires sur plus de 6 000 sites, estime que la température de surface augmente en moyenne de deux degrés après la mise en service d'un centre de données d'IA, avec des pics a 9,1 degrés, un effet encore mesurable a dix kilomètres, et plus de 340 millions de personnes potentiellement concernées. Le travail est en preprint et attend sa revue par les pairs. Marinoni parle néanmoins d'impacts potentiellement dramatiques sur la société.


Le rapprochement avec notre métier est direct. Indexer, c'est calculer. Et le calcul vidéo est la frontière la plus énergivore de l'IA. Selon la synthèse de Bon Pote s'appuyant sur le rapport Energy & AI de l'Agence internationale de l'énergie, une vidéo de six secondes à huit images par seconde demande environ 115 Wh, soit l'équivalent de la recharge de deux ordinateurs portables, quand une génération de texte se situe autour du wattheure. La phase d'inférence représente 80 à 90 % de la consommation totale de l'IA.


Personne dans la profession ne dispose aujourd'hui d'un bilan carbone crédible d'un projet d'indexation massive. C'est une lacune, et elle devient gênante quand les mêmes groupes qui publient des rapports RSE annoncent l'indexation de 150 millions d'heures. À l'inverse, l'argument de la sobriété devient un argument commercial : Kill The Tape revendique une solution d'archivage jusqu'a cinquante ans présentés comme cent fois moins énergivores qu'un stockage cloud, et les acteurs de la bande estiment l'économie énergétique jusqu'a 90 % sur les archives froides accédées moins d'une ou deux fois par an.


L'outillage : trois références qui tiennent, huit qui bougent

Impossible de parler de ce métier sans nommer les outils. Voici la photographie de septembre 2026, en distinguant ce qui structure le marché depuis longtemps de ce qui le déplace maintenant.

Le socle historique

Trois familles servent encore de référence. Dalet Galaxy five reste la plateforme de MAM et d'orchestration de workflows des grands diffuseurs, avec environ 4,9 % de part de mindshare sur la catégorie DAM selon les comparatifs PeerSpot, ou Avid Interplay pointe a 4,8 %, en recul marqué. Iconik occupe le segment cloud hybride, avec la possibilité de conserver son propre stockage on-premise. Et la bande LTO, dans sa dixième génération, demeure le support maitre de conservation recommandé par la profession.

Ce qui a changé le paysage


Un mot sur ce dernier cas, parce qu'il touche au coeur du metier. Publié en avril 2026 avec l'INSAIT de l'Universite de Sofia, VOID ne se contente pas de remplir un trou : il simule ce que la scène serait devenue sans l'objet retiré. C'est un outil formidable de post-production. Appliqué à un fonds patrimonial, c'est une bombe. Un archiviste dont le mandat est de garantir l'intégrité d'un master ne peut pas traiter la retouche générative comme une simple option de nettoyage.


Droits, entrainement et le nouveau flanc juridique

Il y a un sujet dont les archivistes n'avaient pas à se soucier il y a trois ans et qui atterrit désormais sur leur bureau : leurs fonds sont une matière première convoitée.


Le cadre européen s'est précisé. Le rapport IRIS de l'Observatoire européen de l'audiovisuel, rappel que le règlement sur l'IA en vigueur depuis le 2 aout 2026 ne tranche pas le droit d'auteur : ses considérants renvoient à la directive de 2019, dont l'article 4 ouvre la fouille de textes et de données à tous, entreprises comprises, sous deux conditions, un accès licite et l'absence de réserve exprimée par le titulaire de droits par des procédés lisibles par machine. C'est l'opt-out. Une synthèse détaille la mécanique opérationnelle : exprimer un opt-out cumulatif via TDMRep, ai.txt, robots.txt et une clause de réservation en langue naturelle, et journaliser les détections.


Concrètement, cela crée une tâche nouvelle et non financée : la réservation de droits sur les corpus d'archives, sa documentation et sa traçabilité. Qui la porte ? Ni le juridique seul, ni la technique seule. Le media asset manager est le seul a savoir où sont les fichiers, sous quel contrat, avec quelles métadonnées de droits attachées.


Sur le versant opportuniste, le marché montre la voie et ses limites. L'accord pluriannuel entre Getty Images et OpenAI, annoncé en juin 2026, autorise l'affichage d'images sous licence dans ChatGPT avec attribution, mais exclut explicitement l'entrainement de DALL-E. Un accord similaire avait été signé avec Perplexity en octobre 2025. La distinction entre droit d'affichage et droit d'entrainement est désormais la ligne de front contractuelle. Un producteur qui confie son fonds à une plateforme sans lire cette clause ne vend pas un service, il cède un actif.


Le métier lui-même : 50 %, et alors ?

Notre score d'exposition estimé pour cette fonction est de 50 %. Il faut l'entendre correctement : c'est une mesure de tâche, pas de métier. D'autres évaluations placent le documentaliste audiovisuel plus haut, autour de 71 %, quand des panoramas sectoriels rappellent que l'IA agit d'abord au niveau des tâches et que la valeur se déplace vers la création, la fiabilité et la conformité. Les écarts entre ces indices en disent long sur la maturité des méthodologies.

Ce qui bascule vraiment, en revanche, se lit clairement.


La conséquence n'est pas la disparition du poste. C'est son déplacement vers l'amont. Celui qui définit le schéma de métadonnées, qui choisit ce qu'on indexe et ce qu'on n'indexe pas, qui documente les trous du corpus et qui pose les seuils de confiance acceptables, celui-là fabrique la valeur de tout le catalogue. Celui qui se contente de relire des transcriptions automatiques occupe un poste que la prochaine version du modèle rendra discutable.


Le sujet est aussi social, et il commence à se traiter comme tel. France Télévisions a signé en 2026 un accord de dialogue social dédié à l'IA, salué par Force Ouvriere comme une rareté, qui distingue quatre phases de maturité d'un projet, de l'exploration au déploiement, et prévoit l'association des représentants du personnel. Les IA visées sont exactement celles qui touchent nos fonds : transcription son vers texte, sous-titrage direct, analyse de programmes pour repérer automatiquement début et fin. On peut juger l'accord modeste. Il a au moins le mérite d'exister, ce qui n'est pas le cas dans la plupart des groupes privés.


Boites de films etiquetees empilees sur des rayonnages dans une chambre forte

Une partie du patrimoine mondial reste hors du périmètre de l'IA, faute de numérisation. L'UNESCO estime que 95 % de ses propres archives ne sont pas numérisées.

Le trou dans la raquette : ce que l'IA ne sauvera pas

Un dernier point, rarement abordé dans les démonstrations commerciales. Toute cette puissance ne s'applique qu'à ce qui est déjà numérisé.


Les chiffres de l'UNESCO sont sans appel : 95 % de ses archives ne sont toujours pas numérisées, ce qui les rend largement inaccessibles hors de Paris. L'organisation décrivait en juin 2026 des menaces urgentes : vieillissement des formats, fragilité des supports, technologies obsolètes, conditions de stockage inadaptées, avec un risque de perte irréversible pour des collections entières. Une chronique de l'ONU mentionne 4 000 heures d'images sur environ 12 500 bobines 16 et 35 mm non numérisés, dont une partie atteinte du syndrome du vinaigre.


La disproportion des investissements est frappante. On mobilise des sommes considérables pour indexer finement des fonds récents et déjà accessibles, pendant que des supports uniques se décomposent dans des réserves. L'IA sait rendre trouvable. Elle ne sait pas sauver un acétate.


Cet arbitrage est politique autant que technique, et il revient à l'archiviste de le porter en réunion. Le problème, c'est que l'IA lui a donné des arguments pour la monétisation, pas pour la sauvegarde. Un plan de numérisation d'urgence ne produit pas de retour sur investissement au trimestre suivant. C'est peut-être là la contradiction la plus profonde de cette période : la technologie qui a revalorisé le métier n'a revalorisé qu'une moitié de sa mission.


Ce que cette série aura montré

dix-huit métiers, dix-huit scores, une même mécanique. Partout, l'IA absorbe la tâche répétitive et remonte la valeur vers la décision. Pour l'archiviste et le media asset manager, la remontée est spectaculaire : d'une fonction de rangement a une fonction d'arbitrage sur la mémoire, les droits, l'argent et l'énergie. C'est une promotion. C'est aussi un transfert de responsabilité que peu d'organisations ont formalisé, financé ou même reconnu.


À partir de quel taux d'erreur une métadonnée générée automatiquement cesse-t-elle d'être une aide et devient-elle une pollution du référentiel ? Personne, dans la filière, ne s'est encore engagé sur un seuil. Tant que ce chiffre n'existera pas, chaque archiviste devra le fixer seul, sans mandat et sans filet.

• • •

#Archives #MediaAssetManagement #IA #Metadonnees #Archivage #Patrimoine #KillTheTape

KILLTHETAPE - Copyright © 2026 - Mentions légales