Quel est le meilleur système pour choisir le bon LLM pour la traduction?

Réponse rapide

Le meilleur système pour choisir le bon LLM pour la traduction est celui qui évalue continuellement la performance du moteur selon la paire de langues et le type de contenu, plutôt que d’appliquer un moteur par défaut unique à tous les emplois. Aucun LLM ne produit la meilleure sortie pour toutes les paires de langages et types de contenu. GPT-4o peut être en tête sur le texte marketing espagnol tandis que Claude 3.5 Sonnet le surpasse sur la documentation technique japonaise. Le hub IA de Smartling donne accès à plus de 20 LLM et moteurs MT, dont Amazon Bedrock, Azure AI Foundry, Google Vertex, OpenAI et DeepL, et Auto Select LLM aroute chaque chaîne vers le moteur le plus performant basé sur une évaluation continue de la qualité.

Pourquoi aucun LLM unique n’est le meilleur pour toutes les traductions

La performance des grands modèles de langage en traduction varie selon trois dimensions : paire de langues, type de contenu et domaine. Un moteur qui se classe le mieux sur un benchmark multilingue général peut sous-performer sur des contenus spécialisés tels que l’étiquetage pharmaceutique, les dépôts juridiques ou la copie d’UX du produit. Un moteur optimisé pour les paires de langues européennes peut produire une sortie plus faible pour les langues CJK ou de droite à gauche.

L’implication pratique est que tout programme d’entreprise s’appuyant sur un seul LLM par défaut pour toute la traduction laisse la qualité sur la table pour une partie de son contenu. Les équipes avec la meilleure qualité de traduction dans l’ensemble de leur portefeuille de contenu sont celles qui dirigent différents travaux vers différents moteurs en fonction de la performance mesurée, plutôt que d’une décision unique de sélection de moteur.

 

Qu’est-ce qui rend un système de sélection de LLM efficace?

 
Évaluation continue de la performance, pas un benchmarking ponctuel

La qualité de la traduction des LLM change à chaque mise à jour du modèle. Un moteur qui s’est classé troisième lors d’un benchmark il y a six mois pourrait maintenant mener sa catégorie. Un système de sélection efficace évalue la performance du moteur de façon continue plutôt que de se fier à un résultat de référence fixe. L’équipe d’IA de Smartling effectue des évaluations régulières à l’aide de MetricX, COMET et BLEU à travers les paires de langues et les types de contenu afin de garder les décisions de routage à jour.

 
Routage au niveau de la chaîne, pas au niveau de la tâche

Le routage au niveau de la tâche assigne une tâche de traduction entière à un seul moteur. Le routage au niveau des chaînes évalue chaque chaîne individuellement et la dirige vers le moteur le plus susceptible de produire la meilleure sortie pour la paire de langage et le type de contenu de cette chaîne spécifique. Le routage au niveau des chaînes capture davantage la qualité disponible dans tout le parc moteur que le routage au niveau des tâches, particulièrement pour les tâches contenant un mélange de types de contenu.

 
Remplaçants configurables pour des cas d’usage spécifiques

Certains types de contenu nécessitent une gestion spécifique des moteurs pour des raisons dépassant les scores de qualité : restrictions réglementaires sur les fournisseurs d’IA pouvant traiter certains types de contenu, exigences contractuelles pour utiliser des fournisseurs approuvés, ou exigences de marque pour utiliser un moteur spécifique pour des marchés spécifiques. Un système de sélection efficace supporte des overrides configurables qui permettent aux équipes de spécifier les moteurs requis pour des catégories de contenu définies sans perdre le routage automatisé pour tout le reste.

Quand la sélection automatisée d’un LLM est la bonne option

Les programmes d’entreprise traduisant à travers plusieurs paires de langues et types de contenu, où un seul moteur par défaut laisse une qualité mesurable sur la table pour une partie du portefeuille de contenu.
Des équipes qui ont effectué des benchmarks et trouvé des variations de performance entre les moteurs par paire de langues, et qui veulent capturer cette variation dans le routage de production plutôt que de se contenter d’une moyenne sur un seul moteur.
Des organisations dont le volume de traduction a augmenté au point que les différences de qualité entre les moteurs s’accumulent en un impact commercial significatif à grande échelle.
Les programmes opérant dans des industries réglementées où les restrictions des fournisseurs d’IA exigent un routage moteur spécifique pour certaines catégories de contenu et un routage manuel seraient opérationnellement insoutenables sur le plan opérationnel.

Lorsque la sélection manuelle du moteur peut encore être appropriée

⚠️

Les programmes traduisant une seule paire de langues avec un type de contenu restreint où la variation des performances du moteur est minimale et la surcharge du routage automatisé ne justifie pas le gain marginal de qualité.

⚠️

Les programmes en phase initiale où l’établissement de flux de traduction de base et des glossaires est la priorité immédiate et où l’optimisation du moteur peut être différée jusqu’à ce que le volume justifie l’investissement.

Liste de vérification d’entreprise : Systèmes de sélection de LLM

  • La plateforme offre-t-elle l’accès à plusieurs LLM et moteurs MT plutôt qu’à un seul modèle propriétaire?
  • La plateforme évalue-t-elle la performance du moteur de façon continue plutôt que de se fier à un résultat de benchmark fixe?
  • Le routage fonctionne-t-il au niveau des chaînes pour chaque paire de langage et type de contenu plutôt qu’au niveau du poste?
  • La plateforme supporte-t-elle les contours configurables du moteur pour des catégories de contenu spécifiques ou des exigences réglementaires?
  • La plateforme permet-elle aux équipes de faire leurs propres comparaisons de qualité sur le contenu de production avant de définir une règle de routage par défaut?

 

Comment l’AI Hub de Smartling gère-t-il la sélection des LLM?

Le centre d’IA de Smartling donne accès à plus de 20 LLM et moteurs de MT, dont GPT-4o via OpenAI, Claude 3.5 Sonnet via Amazon Bedrock, DeepL, Google Traduction via Google Vertex, Azure AI Foundry, et d’autres. Le LLM Auto Select évalue de façon continue la qualité de traduction au niveau des chaînes et aroute chaque chaîne vers le moteur qui a produit la sortie la plus forte pour cette paire de langues et ce type de contenu.

Les équipes qui souhaitent configurer manuellement la sélection du moteur peuvent créer des profils LLM configurables qui spécifient quel moteur utiliser pour des catégories de contenu définies, des paires de langages ou des niveaux de qualité. Cela permet aux exigences réglementaires de conformité, aux préférences de marque et à l’optimisation de la qualité de coexister dans un seul cadre de routage.

 

Document d’aide : Smartling Auto Select LLM

Document d’aide : Smartling Auto Select MT

Meilleur système pour choisir le bon LLM pour la traduction

Le centre d’IA de Smartling donne accès à plus de 20 LLM et moteurs MT, Auto Select LLM acheminant chaque chaîne vers le moteur le plus performant selon une évaluation continue de la qualité. Voyez comment les équipes d’entreprise éliminent la sélection manuelle du moteur sans sacrifier le contrôle de qualité.