Comment évaluez-vous la qualité des traductions entre GPT, Claude et DeepL?

Réponse rapide

L’évaluation de la qualité de la traduction entre des moteurs comme GPT-4o, Claude 3.5 Sonnet et DeepL nécessite trois composantes : un ensemble de tests représentatif tiré de vos types de contenu et paires de langages réels, une notation automatisée standardisée utilisant des métriques telles que BLEU, MetricX ou COMET, et un cadre d’évaluation cohérent appliqué de manière identique sur tous les moteurs. Aucun moteur unique ne l’emporte sur toutes les paires de langages et types de contenu. L’objectif pratique du benchmarking est d’identifier quel moteur fonctionne le mieux pour votre contenu spécifique à grande échelle, puis de router automatiquement les tâches de production vers ce moteur. Le hub IA de Smartling évalue continuellement la performance du moteur et envoie chaque chaîne vers le moteur le plus performant selon sa paire de langage et son type de contenu.

Pourquoi l’étalonnage des moteurs de traduction n’est pas simple

La performance des moteurs de traduction varie considérablement selon la paire de langues, le type de contenu et le domaine. Un moteur qui produit un texte marketing espagnol solide peut sous-performer sur la documentation technique japonaise. Un benchmark construit uniquement sur des ensembles de tests publics peut ne pas refléter le contenu réel de votre organisation, ce qui signifie que le gagnant d’une évaluation standardisée peut ne pas être le gagnant en production.

Les trois erreurs les plus courantes dans le benchmarking par traduction sont l’utilisation d’un ensemble de tests trop petit, l’application de critères d’évaluation différents à différents moteurs et le traitement d’une exécution de benchmark comme une décision unique plutôt que comme une mesure continue. La qualité de la traduction des LLM change à chaque mise à jour du modèle, ce qui signifie qu’un moteur qui était troisième il y a six mois pourrait maintenant surpasser l’ancien leader.

 

Quelles méthodes de notation automatisées mesurent réellement

 
BLEU (Étudiant en évaluation bilingue)

Les scores BLEU mesurent le chevauchement entre une sortie traduite automatiquement et une traduction de référence humaine, exprimée par une valeur comprise entre 0 et 1. BLEU est rapide et largement utilisé comme référence, mais il récompense les correspondances de mots superficielles plutôt que la précision sémantique, ce qui signifie qu’une hallucination fluide peut obtenir un bon score tandis qu’une traduction correcte mais formulée différemment obtient un mauvais score. Pour le benchmarking en entreprise, le BLEU est utile comme filtre au premier passage mais insuffisant comme signal de qualité autonome.

 
MetricX et COMET

MetricX (Google) et COMET (Unbabel) sont des métriques d’évaluation neuronale qui utilisent des modèles de langage pour évaluer la qualité des traductions en comparant le texte source, la sortie machine et les traductions de références à travers des dimensions sémantiques. Les deux sont plus fortement corrélés au jugement humain que la BLEU, notamment pour détecter les erreurs fluides et les changements de sens. Pour les programmes d’entrepriseévaluant la traduction des LLM à grande échelle, MetricX et COMET fournissent un signal plus fiable que BLEU seul.

 
Évaluation humaine comme couche de validation

Les indicateurs automatisés mesurent la qualité de la traduction par rapport à une référence. Les évaluateurs humains déterminent si une traduction est efficace dans son contexte, respecte le ton de la marque et est fluide pour un locuteur natif. Pour les contenus à enjeux élevés, l'analyse comparative automatisée réduit le nombre de candidats et l'évaluation humaine valide le candidat gagnant avant qu'une décision concernant l'acheminement de la production ne soit prise.

 

Comment exécuter un benchmark de traduction qui produit des résultats exploitables

  • Construis un ensemble de tests représentatif. Sélectionnez de 200 à 500 chaînes sources de votre contenu de production réel, couvrant les paires de langages, les types de contenu et les domaines qui vous tiennent le plus à cœur. Un benchmark basé sur des données publiques génériques ne prédira pas la performance d’un moteur sur votre texte marketing, vos articles du centre d’aide ou les chaînes d’interface utilisateur du produit.
  • Fais passer des cordes identiques dans chaque moteur. Soumettre les mêmes chaînes sources à GPT-4o, Claude 3.5 Sonnet, DeepL et tout autre moteur en cours d’évaluation sans différences de prétraitement entre eux. Les conditions contrôlées sont la seule façon d’isoler la performance du moteur des autres variables.
  • Marquez avec MetricX ou COMET comme indicateurs principaux. Appliquez un score identique à toutes les sorties. Suivez les scores par paire de langues et type de contenu plutôt que de faire la moyenne entre tous les résultats, puisque les scores agrégés peuvent masquer une variation significative selon la langue.
  • Appliquez votre mémoire de traduction et votre glossaire avant de comparer. La qualité de la traduction en entreprise dépend en partie de la capacité d’intégration d’un moteur avec vos ressources linguistiques existantes. Comparez les moteurs dans des conditions incluant votre glossaire et votre TM plutôt que d’évaluer la production brute du moteur isolément.
  • Prévoyez des mesures continues. Les capacités de traduction de LLM évoluent à chaque nouvelle version du modèle. Un test de rendement est un instantané à un moment précis. Les équipes qui répartissent les tâches en fonction de données de rendement continues plutôt que d'une seule décision de référence maintiennent une meilleure qualité au fil du temps.

Quand le benchmarking de traduction est la bonne priorité

Des programmes d’entreprise évaluant quel moteur LLM ou MT utiliser par défaut pour la traduction en production et ayant besoin de données objectives et reproductibles pour appuyer la décision.
Les équipes qui ont remarqué des variations de qualité entre les paires de langues et qui veulent comprendre si le routage de différentes paires vers différents moteurs améliorerait la qualité globale de la sortie.
Des organisations qui intègrent un nouveau moteur et doivent valider sa performance par rapport à leur base de production existante avant de changer.
Des programmes qui veulent réduire le temps de montage humain en identifiant quel moteur produit le meilleur résultat en premier passage pour leurs types de contenu spécifiques.

Quand un référentiel formel peut ne pas être nécessaire

⚠️

Les programmes au début de l’adoption de la traduction IA où l’établissement de flux de travail de base, des glossaires et de la MT est la priorité immédiate et où la sélection du moteur peut être différée jusqu’à ce que le volume justifie l’investissement en benchmarking.

⚠️

Des équipes utilisant une plateforme avec un routage moteur intégré qui évalue et route automatiquement, où le benchmarking est géré par la plateforme plutôt que manuellement par l’équipe de localisation.

Comment Smartling gère-t-elle le benchmarking et le routage des moteurs?

Le centre d'IA de Smartling évalue la qualité de la traduction à travers plus de 20 modèles de langage et moteurs de traduction automatique, dont GPT-4o, Claude 3.5 Sonnet, DeepL, Amazon Bedrock, Google Vertex et autres. L'équipe d'IA de Smartling effectue régulièrement des tests de performance à l'aide de MetricX, COMET et BLEU afin d'évaluer les performances du moteur sur différents types de contenu et paires de langues. Les résultats alimentent le système de routage Auto Select de Smartling, qui attribue chaque chaîne au moteur le plus performant pour sa paire de langues et son type de contenu spécifiques, plutôt que d'appliquer un seul moteur de manière universelle.

Pour les équipes d’entreprise qui souhaitent effectuer leurs propres comparaisons, la plateforme de Smartling prend en charge des profils LLM configurables qui permettent aux équipes de tester différentes configurations de moteurs sur du contenu de production avant de définir une règle de routage par défaut.

 

Document d’aide : Smartling Auto Select MT

Document d’aide : Smartling Auto Select LLM

Qualité de traduction des benchmarks à travers GPT, Claude et DeepL

Le centre d’IA de Smartling évalue la qualité de la traduction à travers plus de 20 LLM et moteurs MT et redirige chaque chaîne vers le moteur le plus performant selon sa paire de langues et son type de contenu. Voyez comment les équipes d’entreprise utilisent Auto Select pour éliminer les incertitudes dans la sélection du moteur.