Le même scénario se répète dans de nombreux projets d'IA d'entreprise. Les données d'entraînement sont annotées, le volume est suffisant, les scores de référence sont bons. Mais une fois le modèle déployé en production, la qualité des réponses s'effondre dans une langue donnée, un service donné ou face à un type de requête donné. Le score global ne le montre pas ; l'utilisateur final, si. Cet écart explique une partie des difficultés qui apparaissent lorsqu'un projet d'IA passe du pilote à la production.
Ce problème ne tient pas uniquement au modèle : il vient souvent d'une phase d'évaluation qui n'a pas été conçue avec suffisamment de rigueur au moment de la sélection du prestataire. Que les données soient étiquetées avec précision est une condition nécessaire, pas suffisante. Ce dont une entreprise a réellement besoin, c'est d'une preuve vérifiable que le modèle se comporte de façon stable lorsque la langue, le service ou les conditions d'usage changent, avec une traçabilité suffisante pour reproduire et expliquer les résultats.
Cet article présente les sept critères qu'une équipe IA d'entreprise devrait appliquer pour choisir un prestataire de données d'entraînement multilingue pour des modèles sur mesure. Il explique aussi pourquoi la capacité d'évaluation est devenue le critère décisif, pourquoi un modèle peut échouer localement alors que la moyenne globale reste bonne, et quelles questions poser avant d'engager données, budget et temps de développement.
Imaginez un projet d'IA pour une tâche précise : volume de données suffisant, bons scores sur le benchmark. Mais une fois déployé dans différents services de l'organisation, la qualité des réponses chute nettement dans une langue, un pays, une région ou un registre donné (relation client face à communication interne, par exemple). C'est un effondrement local que la moyenne ne reflète pas.
Dans le modèle d'achat traditionnel, l'entreprise fournissait les données brutes, le prestataire renvoyait les fichiers étiquetés, et la qualité finale du modèle restait sous la seule responsabilité de l'équipe technique interne. Mais dès lors qu'un système d'IA s'intègre dans des processus métier, un service client ou un flux de travail réglementé, ce partage des responsabilités devient intenable : il masque le risque plutôt que de le gérer. Les questions qu'une équipe achats devrait poser au prestataire sont d'un autre ordre :
Ce n'est que lorsqu'on peut répondre à ces questions que l'annotation cesse d'être un service isolé pour devenir un élément d'un processus d'assurance qualité gouverné. Le secteur désigne de plus en plus cette discipline opérationnelle sous le terme d'AI Data Operations : un cadre qui relie la source des données, l'annotation, la confidentialité, l'évaluation, l'alignement et l'amélioration continue au sein d'un même système de contrôle qualité.
Les organisations qui opèrent en France, en Belgique, en Suisse ou plus largement dans l'espace francophone ont besoin de plus qu'un bon score global. Elles doivent pouvoir démontrer comment les données ont été obtenues, quels droits en permettent l'usage, où elles sont traitées, et comment le modèle se comporte dans chaque langue, variété de français et contexte opérationnel concernés.
Les obligations réglementaires varient selon la juridiction, le secteur et le type de données. Dans l'Union européenne, le RGPD et le règlement européen sur l'intelligence artificielle (AI Act) constituent deux cadres structurants, sous le contrôle d'autorités nationales telles que la CNIL en France ou l'Autorité de protection des données en Belgique. La Suisse applique son propre cadre de protection des données, sous la supervision du PFPDT. Pour un prestataire international, l'enjeu n'est pas de se conformer à un texte unique, mais d'adapter les flux de travail à chaque marché tout en maintenant la traçabilité, la qualité et l'auditabilité.
La réalité linguistique est elle aussi plus large qu'il n'y paraît. Le français utilisé en France, en Belgique, en Suisse, au Québec ou dans les pays francophones d'Afrique présente des différences de terminologie, de registre et d'usages administratifs. À cela s'ajoutent les langues régionales de France, les situations de plurilinguisme propres à chaque marché, et l'alternance codique avec l'anglais ou les langues locales dans certains contextes professionnels. Dans plusieurs marchés africains, l'évaluation doit également tenir compte de l'alternance entre le français et les langues nationales ou locales, ainsi que de données vocales reflétant les accents, les environnements acoustiques et les usages réels. Un système peut donner d'excellents résultats en français neutre et se dégrader nettement face à une terminologie administrative locale, un registre de service public ou une requête réelle en centre de relation client. C'est pourquoi la qualité doit s'évaluer par marché, par langue, par variante et par cas d'usage : la moyenne globale donne un contexte, la décision de déploiement exige une preuve locale.
La qualité de l'annotation détermine ce que le modèle apprend du jugement humain. Mais la précision seule ne suffit pas comme preuve de qualité : les données d'entreprise doivent aussi être reproductibles, c'est-à-dire permettre d'obtenir le même niveau de qualité dans les mêmes conditions.
Deux relecteurs formés, travaillant à partir des mêmes consignes, devraient arriver à des conclusions suffisamment cohérentes. En cas de désaccord, le processus doit permettre d'identifier si la cause est une consigne ambiguë, un manque de contexte, une différence d'interprétation culturelle, ou simplement un cas limite réellement difficile.
Une annotation de texte multilingue de qualité exige davantage que des locuteurs natifs : elle demande une conception des tâches, une expertise du domaine, une calibration des relecteurs, un arbitrage et une analyse continue de la qualité.
La couverture linguistique ne devrait jamais se juger au nombre de langues affichées sur une liste. Un prestataire peut annoncer la prise en charge de dizaines de langues tout en disposant d'une capacité opérationnelle solide dans un sous-ensemble restreint. La profondeur réelle dépend de relecteurs qualifiés, d'une couverture régionale, d'une expertise terminologique et de la capacité à recueillir ou générer de nouvelles données lorsque les ressources existantes sont insuffisantes.
La qualité multilingue ne se dégrade pas non plus de façon uniforme. Un modèle peut bien fonctionner en français neutre et moins bien dans une variante régionale (français de Belgique, de Suisse, du Québec) ou face à une terminologie administrative locale, sans que le score agrégé ne le montre. Ce phénomène est appelé effondrement local de la qualité (Local Quality Collapse) : une dégradation grave de l'exactitude factuelle, linguistique ou comportementale dans une langue, une région, un domaine ou un groupe d'utilisateurs donné, alors que la performance moyenne reste acceptable. Ce qui compte pour une entreprise, c'est que l'utilisateur vit cette qualité locale, pas la moyenne du tableau de bord.
Les données d'IA doivent être utiles tout en restant défendables sur le plan juridique. L'entreprise doit savoir d'où viennent les données, quels droits en autorisent l'usage, quelles transformations ont été appliquées, et si des informations personnelles ou confidentielles subsistent. L'absence de ces garanties peut transformer un jeu de données apparemment économique en un problème juridique, sécuritaire ou contractuel ultérieur.
La gouvernance doit couvrir toute la chaîne : origine, droits associés et chaîne de responsabilité, base de consentement ou de licence, finalités autorisées, règles de conservation, accès des annotateurs, transformations et filtrage, gestion des versions, livraison et suppression. Dans de nombreux cas, les informations sensibles doivent être supprimées avant toute relecture externe ou tout entraînement. Les flux d'anonymisation multilingue de Pangeanic identifient et protègent les données personnelles dans plusieurs langues tout en préservant autant que possible leur utilité analytique.
Certains projets exigent un traitement sur site, en cloud privé ou dans un environnement isolé (air-gapped). Ces conditions doivent être posées dès la conception du projet, et non ajoutées après le début de la collecte.
Les jeux de données génériques suffisent rarement à un comportement métier spécialisé. Un modèle destiné à classer des sinistres d'assurance, interroger des manuels industriels ou assister une démarche administrative a besoin d'exemples issus de cette tâche précise, de ce domaine et de ce vocabulaire. La préparation des données doit partir du comportement attendu du modèle, et non du jeu de données le plus simple à obtenir.
Selon Gartner, d'ici 2027, les organisations utiliseront des modèles d'IA de petite taille et spécialisés par tâche au moins trois fois plus fréquemment que les grands modèles généralistes. Plus une tâche est ciblée, plus la conception des données d'entraînement et d'évaluation détermine la performance finale du modèle.
Un prestataire de données pertinent devrait pouvoir fournir : des jeux de fine-tuning supervisé, des données d'instructions et de démonstrations, une terminologie métier, des traces de raisonnement expert, des corpus de récupération documentaire pour les systèmes RAG, des données de grounding et des exemples négatifs difficiles, des données de préférence et d'alignement, ainsi que des jeux d'évaluation propres à chaque tâche.
Les corpus parallèles conservent une forte valeur pour la traduction, la recherche interlangue et l'adaptation des modèles multilingues. Le référentiel de Pangeanic contient plus de 10 milliards de segments alignés, combinables avec des flux de filtrage, d'évaluation et d'adaptation au domaine sur mesure.
L'IA d'entreprise devient de plus en plus multimodale. Le texte reste central, mais de nombreux systèmes en production traitent aussi la voix, l'image, la vidéo, les documents numérisés et les métadonnées structurées. Un prestataire qui traite chaque modalité comme une simple variante de l'annotation de texte passe à côté des conditions techniques qui déterminent la qualité.
Les projets vocaux exigent des métadonnées sur les locuteurs, une diarisation, une segmentation, un alignement temporel, des informations de canal, des conditions acoustiques, une couverture des accents et dialectes, une annotation de l'alternance codique et des conventions de transcription. Pangeanic propose des jeux de données vocales et audio, disponibles ou sur mesure, pour l'ASR, l'IA conversationnelle, la transcription et l'évaluation de modèles.
Les documents et images posent d'autres exigences : transcription OCR, ordre de lecture, mise en page, tableaux, écriture manuscrite, qualité d'image, et lien entre le contenu visuel et textuel. La question essentielle est de savoir si le prestataire peut reproduire l'environnement réel dans lequel le modèle fonctionnera : l'audio de studio ne permet pas d'évaluer un modèle de centre d'appels, et des documents numériques propres ne préparent pas un système à des scans dégradés ou à des formulaires administratifs complexes.
Un modèle peut être linguistiquement fluide tout en restant inadapté en production : il peut donner des conseils dangereux, ignorer une politique interne, adopter un registre inapproprié, révéler des informations confidentielles, refuser des demandes inoffensives, ou se comporter différemment selon la langue dans laquelle la même instruction est formulée.
L'alignement de modèle utilise le jugement humain et une évaluation structurée pour rapprocher le comportement du modèle des attentes métier, réglementaires et culturelles de l'organisation. Les données concernées incluent des réponses préférées et rejetées, des étiquettes de politique, des classifications de sécurité, des corrections d'experts, des exemples de suivi d'instructions, des jugements de registre et de ton, des revues d'adéquation culturelle, et des prompts adversariaux.
L'alignement multilingue doit être évalué localement : traduire mécaniquement un jeu de sécurité conçu en anglais capture rarement les mêmes références culturelles, ambiguïtés, rapports sociaux ou stratégies adversariales. Le red teaming IA multilingue utilise des prompts originaux et des scénarios à plusieurs tours, créés directement dans la langue cible, pour révéler les défaillances de raisonnement, les hallucinations, les biais, les réponses dangereuses et les refus inappropriés à travers les langues et les limites de politique.
L'évaluation est le critère qui relie tous les autres, et l'un des éléments déterminants pour décider si un projet peut passer en production. Sans mesure indépendante, l'entreprise ne peut pas savoir si une meilleure annotation, davantage de données, un fine-tuning supplémentaire ou un retour humain ont réellement amélioré le système. Un benchmark générique peut indiquer une capacité générale, mais représente rarement la langue, la tâche, le domaine et le risque exacts d'un déploiement donné. C'est pourquoi l'évaluation et l'assurance qualité IA doivent être conçues à partir du comportement opérationnel.
L'évaluation traditionnelle réduit souvent la performance à un seul chiffre. L'exactitude, le BLEU, le F1 ou le taux de victoire peuvent être utiles, mais un chiffre unique peut masquer précisément les défaillances les plus pertinentes pour l'organisation.
L'évaluation comparative du comportement (behavioural benchmarking) vérifie en continu si le modèle exécute les actions requises dans des conditions représentatives : exactitude factuelle, suivi des instructions, cohérence terminologique, langue et registre, respect de la politique de sécurité, refus approprié, robustesse face à l'ambiguïté, cohérence entre langues, et performance sur des cas limites rares mais coûteux. Ce cadre fonctionne comme une spécification de qualité opérationnelle pour l'organisation : il définit le seuil acceptable avant le déploiement et offre une référence stable lorsque le modèle, les prompts ou les sources de données évoluent.
L'assurance qualité ne s'arrête pas à la validation initiale ni à la mise en production. Les défaillances détectées en production peuvent être relues, anonymisées, classées et intégrées aux futurs jeux d'évaluation. De nouveaux termes, de nouvelles politiques et de nouveaux usages devraient eux aussi générer de nouveaux cas de test, dans une boucle continue :
Comportement en production → analyse des défaillances → nouvelles données d'évaluation → amélioration du modèle ou du flux → nouvelle vérification
En traduction automatique, l'estimation de la qualité de traduction automatique (MTQE) fournit un signal opérationnel pour détecter et orienter les sorties de faible qualité, comparer les moteurs, filtrer les données parallèles et construire des jeux d'évaluation multilingue plus solides.
L'effondrement local de la qualité (Local Quality Collapse) se produit lorsqu'un système d'IA multilingue conserve une performance agrégée acceptable tout en subissant une dégradation grave — factuelle, linguistique ou comportementale — dans une langue, une région, un domaine ou un groupe d'utilisateurs donné.
Le modèle peut sembler sain sur un tableau de bord global parce que le volume de données dans une langue ou une variante dominante tire la moyenne vers le haut. Les utilisateurs d'une langue régionale, d'une variante géographique du français, d'un secteur à terminologie très spécifique ou d'un registre particulier peuvent vivre une expérience fondamentalement différente. Cela se manifeste par des réponses factuellement incorrectes dans une langue ou une variante donnée, un registre peu naturel, un taux d'hallucination plus élevé, une incapacité à reconnaître une terminologie régionale, un comportement de sécurité incohérent, ou une reconnaissance vocale moins précise pour un accent donné.
La solution ne consiste pas simplement à ajouter davantage de volume multilingue. Les entreprises ont besoin de jeux d'évaluation qui révèlent la défaillance locale, de données d'entraînement ou de grounding suffisantes pour la corriger, et d'une vérification continue confirmant que l'intervention a fonctionné. L'analyse complète est disponible dans cet article (en anglais).
Les propositions commerciales affichent souvent des chiffres impressionnants : nombre de langues couvertes, taille de l'équipe de relecteurs, volume d'annotations réalisées. Ces chiffres disent peu de choses sur la capacité réelle à livrer un modèle fiable. La vérification doit commencer par les preuves.
Comparer des prestataires n'a de sens que si l'on examine des capacités opérationnelles vérifiables, pas des listes de cases cochées sans preuve. La grille suivante peut être utilisée dans un appel d'offres ou pour sélectionner un pilote.
| Capacité | Preuve à demander | Risque en son absence |
|---|---|---|
| Profondeur linguistique | Échantillons, disponibilité réelle des relecteurs, indicateurs de qualité par variante | Bonne moyenne mais défaillances locales graves |
| Reproductibilité de l'annotation | Consignes, indicateurs d'accord, exemples d'arbitrage, journaux d'audit | Signaux d'entraînement contradictoires, instabilité du modèle |
| Provenance des données | Registres d'origine, base de licence, statut du consentement, usage autorisé | Exposition juridique, contractuelle et de gouvernance du modèle |
| Architecture de confidentialité | Flux d'anonymisation, contrôles d'accès, options de déploiement | Exposition de données personnelles, confidentielles ou réglementées |
| Préparation aux modèles sur mesure | Exemples de fine-tuning, de grounding, de spécifications par tâche | Gros volumes peu pertinents pour la tâche de production |
| Capacité d'alignement | Flux de préférence, étiquetage de politique, méthodologie de red teaming multilingue | Modèles fluides mais dangereux ou inappropriés |
| Infrastructure d'évaluation | Jeux de benchmark protégés, taxonomie des défaillances, rapports de comparaison | Aucune preuve fiable que les données ont amélioré le modèle |
| Amélioration continue | Processus transformant le retour de production en nouveaux tests et exemples | Dégradation de la qualité lorsque le modèle ou les conditions changent |
Pangeanic collecte, aligne et traite des données multilingues pour des systèmes de traduction automatique depuis plus de vingt ans. Ce parcours a produit d'importants référentiels linguistiques — plus de 10 milliards de segments alignés — et une capacité industrielle pour évaluer des données de langue à travers de nombreux domaines et paires de langues.
Sur cette base repose un modèle plus large d'AI Data Operations, que Pangeanic structure de façon intégrée :
Les références de Pangeanic illustrent cette capacité dans trois domaines complémentaires : le déploiement institutionnel à grande échelle, la protection des données dans des environnements réglementés, et la préparation de données pour l'entraînement et l'évaluation de modèles de langage.
Déploiement institutionnel à grande échelle. Les services de traduction documentaire de Pangeanic sont utilisés par plus de 25 000 agents de l'Agencia Estatal de Administración Tributaria (AEAT), l'administration fiscale espagnole, répartis dans des équipes géographiquement dispersées.
Confidentialité et environnements réglementés. Les flux d'anonymisation multilingue MAPA sont utilisés par le ministère espagnol de la Justice et par la direction générale de la Traduction de la Commission européenne.
Recherche, évaluation et modèles de langage. Pangeanic a collaboré avec le Barcelona Supercomputing Center (BSC), l'un des principaux centres européens de calcul intensif, sur des travaux d'annotation, de retour humain, d'évaluation et de préparation de données liés aux modèles Salamandra et ALIA.
Pour les entreprises, les laboratoires d'IA et les administrations publiques, la valeur commerciale réside dans un partenaire unique capable de relier toutes ces couches. La collecte de données sans évaluation n'apporte que du volume. L'évaluation sans retour opérationnel n'apporte qu'un instantané. AI Data Operations relie les deux dans un système capable de continuer à apprendre sans perdre le contrôle.
Ce sont des services qui collectent, préparent, annotent, gouvernent et évaluent les données utilisées pour entraîner ou adapter des systèmes d'IA à travers plusieurs langues. Ils peuvent inclure l'annotation de texte, la transcription vocale, les corpus parallèles, la terminologie, les données d'instructions, les préférences humaines, les benchmarks d'évaluation et les scénarios de red teaming.
Un service d'annotation produit des étiquettes ou des jugements sur un jeu de données défini. Chez Pangeanic, AI Data Operations relie la source des données, la préparation, l'annotation, la gouvernance, l'évaluation, l'alignement et le retour de production tout au long du cycle de vie du modèle. L'annotation reste une composante, au sein d'une discipline d'assurance qualité plus large.
Parce que les entreprises ont besoin de preuves vérifiables qu'un modèle exécute la tâche prévue de façon sûre et cohérente. Les jeux d'évaluation, les benchmarks comportementaux et la relecture humaine montrent si l'entraînement ou le fine-tuning ont produit le comportement souhaité. Une étiquette dont l'effet ne peut pas être mesuré indépendamment a une valeur limitée.
C'est la vérification continue de la capacité d'un modèle à exécuter les actions requises dans des conditions représentatives. Plutôt que de s'appuyer sur un score agrégé unique, elle évalue séparément l'exactitude factuelle, le suivi des instructions, la terminologie, la sécurité, le refus approprié, la cohérence entre langues et la performance sur des cas limites peu fréquents mais à fort enjeu.
Cela se produit lorsqu'un système d'IA multilingue paraît acceptable dans l'ensemble mais fonctionne mal pour une langue, une région, un domaine ou un groupe d'utilisateurs donné. Le détecter exige une évaluation séparée par langue et par contexte opérationnel.
Cela dépend de la tâche. Un modèle sur mesure peut nécessiter du texte de domaine, des exemples d'instructions, une terminologie spécialisée, des documents de recherche, des préférences humaines, des prompts adversariaux et des jeux d'évaluation indépendants. Plus une tâche est spécifique, plus le modèle bénéficie de données représentant fidèlement ses conditions réelles d'exploitation.
Par relecture experte, accord inter-annotateurs, résultats d'arbitrage, comparaison à une référence gold standard, et effet des données obtenues sur des évaluations protégées du modèle. La mesure appropriée dépend de la nature objective, subjective ou spécialisée de la tâche.
Ils doivent être évalués séparément selon la langue, la variante, le domaine et la capacité. Les jeux de test doivent inclure du matériel créé nativement dans la langue cible et des scénarios utilisateurs représentatifs, plutôt que de reposer uniquement sur des traductions depuis l'anglais.
Oui, lorsque la gouvernance, la base légale, les contrôles d'accès, l'anonymisation et le traitement sécurisé sont correctement conçus. Certaines organisations exigent des flux sur site ou en environnement isolé afin que les données ne quittent jamais leur propre infrastructure.
Cela dépend des langues, du volume, de l'expertise du domaine, des conditions de collecte, de la complexité de l'annotation et des exigences d'évaluation. Les jeux de données existants peuvent être licenciés rapidement, tandis que les langues peu dotées ou les collectes spécialisées peuvent demander du recrutement, un travail pilote et plusieurs phases de production.
Un pilote utile doit inclure des données représentatives, des consignes documentées, des indicateurs de qualité, des informations de provenance et un jeu d'évaluation protégé. L'organisation doit mesurer si les données livrées améliorent réellement le modèle par rapport à des comportements opérationnels clairement définis.
L'IA d'entreprise ne s'achète plus au volume d'annotation, mais à la capacité d'évaluation, à la traçabilité et à l'assurance qualité tenue dans la durée.
Pangeanic aide les entreprises, les laboratoires d'IA et les institutions publiques à construire une IA multilingue grâce à des jeux de données fiables, une évaluation humaine, un alignement de modèle, des flux de travail respectueux de la confidentialité et un déploiement maîtrisé. Notre travail relie l'acquisition de données à des preuves de comportement, permettant d'améliorer les modèles sans perdre le contrôle sur la qualité linguistique, la gouvernance et le risque opérationnel.