Accueil / Tech News / Jalapeño : le premier processeur d’OpenAI devancerait Nvidia en efficacité et rapidité

Jalapeño : le premier processeur d’OpenAI devancerait Nvidia en efficacité et rapidité

OpenAI conçoit désormais ses modèles, ses logiciels et son propre silicium, sans pour autant rompre ses liens avec Nvidia.

OpenAI vient de rendre publics les résultats de tests de Jalapeño, son premier processeur maison. Il a été testé sur trois modèles ouverts, GPT‑OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, à l’aide d’InferenceX, un benchmark public développé par SemiAnalysis. Sur l’ensemble de ces tests, Jalapeño aurait délivré de 1,5 à 1,9 fois plus de travail d’IA par watt au pic de débit, ainsi qu’une latence de bout en bout inférieure de 1,7 à 3,6 fois par rapport aux systèmes de comparaison. Pour les charges fortement interactives, l’écart de performance grimperait jusqu’à un facteur de 2,1 à 4,1.

Sur le modèle GPT‑OSS 120B, le débit maximal de Jalapeño par watt atteindrait 85 448 jetons par seconde, contre 44 960 jetons par seconde pour le système comparé, basé sur un accélérateur Nvidia GB200, soit un rapport de 1,9. Sa latence de bout en bout s’établirait à 1,03 seconde, contre 1,80 seconde pour le système de comparaison. Sur DeepSeek R1 670B, testé face à un système à base de GB300, le débit par watt serait supérieur d’un facteur 1,7 et la latence inférieure d’un facteur 3,6, avec un débit de décodage par utilisateur de 700 jetons par seconde contre 169 pour le système comparé. Sur Kimi K2.5 1T, le plus volumineux des trois modèles testés, l’avantage de Jalapeño atteindrait environ 1,5 fois en débit par watt et 3,4 fois en latence.

OpenAI précise avoir normalisé l’ensemble de ces comparaisons à partir de la puissance nominale publiée de chaque accélérateur : Jalapeño est classée à 700 watts, contre 1 200 watts pour le GB200 et 1 400 watts pour le GB300, la puissance mesurée de Jalapeño en conditions réelles étant toutefois restée à 550 watts ou moins sur les charges testées.

OpenAI justifie l’importance de l’efficacité par watt plutôt que de la seule performance par puce par la nature des charges agentiques, qui enchaînent plusieurs étapes d’inférence successives, chaque latence s’accumulant sur l’ensemble de la tâche. La puce aurait été conçue pour limiter les déplacements de données et les délais de communication entre cœurs et puces, notamment en maintenant localement le cache dit KV, utilisé pendant la génération des réponses, au plus près des unités de calcul qui en ont besoin.

OpenAI indique avoir mobilisé ses propres modèles tout au long du développement de Jalapeño, de la conception initiale jusqu’à la gravure du prototype final, un processus mené en neuf mois. L’IA aurait notamment permis d’accélérer l’exploration des architectures possibles et l’optimisation des circuits arithmétiques.

Grâce aux outils de génération de code Codex et GPT‑Astra, l’équipe affirme avoir porté en deux mois trois modèles ouverts non prévus initialement dans le plan de production à un niveau de performance élevé.

OpenAI prévoit de déployer Jalapeño au sein de sa propre infrastructure de calcul d’ici la fin de l’année, alors que se poursuivent la qualification en production, la maturation logicielle et la validation des performances sur un plus grand nombre de modèles.

La deuxième génération du processeur serait déjà bien avancée en développement, et la conception d’une troisième génération aurait débuté. L’entreprise précise toutefois qu’elle continuera de déployer largement les accélérateurs de Nvidia et d’autres partenaires, tant pour l’entraînement que pour l’inférence.

La licorne franco-américaine Hugging Face aurait mandaté une banque afin d’étudier sa vente, mais avec une très sérieuse plus-value. Prix envisagé : au moins 13 milliards de dollars, contre une valorisation de 4,5 en 2023.

IBM entend répondre à l’essor rapide des logiciels cloud natifs et d’intelligence artificielle bâtis sur Arm, sans contraindre les entreprises à migrer leurs charges critiques hors de leurs systèmes mainframe existants.

Le ZDNET Morning le brief de l'actu tech pour les pros tous les matins à 9h00. Transformation numérique, IA, matériel, logiciels,… ne passez pas à côté de ce qui fait la Une du secteur.

L'accélérateur d'inférence Nvidia Groq 3 LPX entre en production. Intégré à la plateforme Vera Rubin, ce composant promet de résoudre la latence de décodage pour déployer des agents IA d'entreprise.

Conçu pour Windows, macOS, iOS et Android, Wispr Flow est un véritable plaisir à utiliser par rapport aux autres applications de dictée vocale. Voici pourquoi.

Trop de texte, polices incohérentes, visuels étranges : voici 8 conseils, prompts à l'appui, pour créer des flyers avec l'IA qui ne trahissent plus leur origine artificielle.

Tous les nouveaux modèles ne sont pas forcément à la hauteur de leur réputation. Notre outil de suivi compare chaque nouveauté à ses concurrents, pour que vous sachiez quels modèles méritent votre attention.

Économisez votre argent, préservez votre vie privée et protégez la planète. Cette IA à installer offre plusieurs avantages que vous ne trouverez pas avec des modèles plus traditionnels comme ChatGPT.

Les deux sont incroyablement performants, mais les options d'abonnement, les environnements de développement et les avantages cachés de chaque écosystème pourraient faire en sorte que l'un d'entre eux vous convienne mieux personnellement.

Dans Google Workspace, Gemini a accès par défaut à Gmail, Docs, Agenda, Chat et bien d'autres services. Voici pourquoi cela est important et comment les administrateurs peuvent désactiver cette fonctionnalité dès aujourd'hui.

Alors qu’Assistant s’apprête à disparaître, remplacé par Gemini, cette application, qui préserve vos données privées, constitue une option intéressante. Malgré, toutefois, quelques bémols.

J'ai utilisé l’outil d’intelligence artificielle Cowork d’Anthropic pour automatiser un flux de travail, et le résultat s'est avéré remarquablement efficace, mais cela a mis en évidence quatre inconvénients majeurs.

Origine de l’article : lire l’article original

Traduction