Le français, cette langue de luxe

Changer de langue permet de consommer moins de tokens, c’est un fait et nous l’avons mesuré aussi bien chez Anthropic, OpenAI et Google. Moins de tokens, c’est un coût de revient plus faible et moins de calcul, donc une empreinte écologique plus faible.
Les IA génératives ne travaillent pas sur des mots, mais sur des tokens (ou jetons). C’est une manière de découper des phrases, propre à chaque famille de modèle. C’est le rôle du tokenizeur : vous saisissez votre prompt, il le transforme en tokens qui sont envoyés au modèle.
Il fait des centaines de milliards d’opérations sur chaque token et renvoie le résultat, de nouveau en tokens. Opération inverse du tokeniseur et voilà la réponse affichée.
Tous les tokens ne se valent pas !
Les grands modèles de langage ne parlent qu’en tokens, c’est l’unité de base pour les calculs et la facturation. Plus il y a de tokens en entrée et en sortie, plus vous payez cher (ou plus cela entame votre forfait). Il y a aussi plus de calculs, dont une empreinte environnementale plus importante.
Quel rapport avec le titre de notre actualité et donc avec les langues ? La création de tokens (ou jetons) n’est pas universelle : elle dépend de chaque famille de modèle, mais également de la langue. Pour mettre en lumière cette différence, nous avons pris comme référence le règlement général sur la protection des données (RGPD) de la Commission européenne, un long texte traduit dans les 24 langues de l’Union.
Une précision importante : le gain dont nous parlons ici reste anecdotique par rapport à un usage responsable : ne demandez pas à ChatGPT de faire de la reconnaissance de caractère basique sur une image ou de traduire un texte, des IA spécialisées le feront bien mieux et pour moins cher (en argent et en consommation). Vous pouvez aussi demander aux modèles d’être moins bavards, d’aller à l’essentiel. Les économies seront bien plus importantes.
Les tokens dans 24 langues et près de 10 millions de caractères
Chaque texte ne fait pas la même longueur : entre 320 000 et 415 000 caractères, avec 371 000 de moyenne environ. Mais ce règlement est assez long pour en tirer une métrique intéressante : le nombre de caractères moyens par token et par langue.






