
OpenAI a publié les 25 et 26 août 2026 les premiers résultats de Jalapeño, sa toute première puce IA maison, conçue spécifiquement pour l'inférence, c'est-à-dire pour faire tourner des modèles déjà entraînés plutôt que pour les entraîner. Selon les benchmarks indépendants relayés par The Register, Winbuzzer et CNBC, cette puce affiche jusqu'à 1,9 fois plus de débit par kilowatt que les racks Nvidia les plus récents. Pour une PME qui paie chaque mois une facture d'API IA, la question est simple : est-ce que ça va faire baisser les prix ?
En bref
- Jalapeño est la première puce IA d'OpenAI, conçue en interne et fabriquée avec Broadcom (silicium et réseau), l'intégration système étant assurée par Celestica.
- Elle est dédiée à l'inférence (faire tourner les modèles) et non à l'entraînement : OpenAI continue d'utiliser des GPU Nvidia et AMD pour entraîner ses modèles.
- Selon les benchmarks SemiAnalysis InferenceX, publiés les 25-26 août 2026, Jalapeño délivre 1,5 à 1,9 fois plus de débit par kilowatt et une latence 1,7 à 3,6 fois plus faible que les racks Nvidia GB200 et GB300.
- Sa puissance nominale est de 700 W, contre 1 200 à 1 400 W pour les racks Nvidia comparés, à performance égale ou supérieure.
- Un déploiement limité est prévu fin 2026, avec une montée en volume en 2027 : aucun impact tarifaire immédiat n'est annoncé pour les utilisateurs de ChatGPT ou de l'API OpenAI.
- Pour une PME, l'enjeu à court terme n'est pas une baisse de prix garantie, mais un signal de concurrence croissante sur le matériel IA, favorable au client sur la durée.
Qu'est-ce que la puce Jalapeño, concrètement
Jalapeño est un circuit spécialisé (ASIC) pensé uniquement pour servir des modèles déjà entraînés aux utilisateurs, ce qu'on appelle l'inférence. C'est la tâche la plus coûteuse en volume pour OpenAI : chaque message envoyé sur ChatGPT ou chaque appel à l'API déclenche une opération d'inférence. L'architecture a été conçue par OpenAI, la fabrication du silicium et la partie réseau confiées à Broadcom, et l'assemblage des racks à Celestica.
Contrairement à un GPU généraliste comme ceux de Nvidia, qui doivent gérer à la fois l'entraînement (très gourmand en calcul brut) et l'inférence (plus sensible à la latence et au coût par requête), Jalapeño est optimisé pour un seul usage. Selon OpenAI, l'architecture est pensée « pour minimiser les déplacements de données et les délais de communication » entre les puces d'un même rack, un facteur clé pour répondre vite à des millions de requêtes simultanées.
Les chiffres du benchmark face à Nvidia
Les tests ont été menés par le cabinet d'analyse SemiAnalysis, via son protocole InferenceX, sur trois modèles ouverts : GPT-OSS-120B, DeepSeek R1 (670 milliards de paramètres) et Kimi K2.5 (mille milliards de paramètres), avec des requêtes de 8 000 jetons en entrée et 1 000 en sortie.
| Indicateur | Jalapeño (OpenAI) | GB200 / GB300 (Nvidia) |
|---|---|---|
| Puissance nominale (TDP) | 700 W | 1 200 W à 1 400 W |
| Débit par kilowatt | 1,5x à 1,9x supérieur | Référence |
| Latence de bout en bout | 1,7x à 3,6x plus rapide | Référence |
| Rôle prévu | Inférence uniquement | Entraînement + inférence |
| Disponibilité | Échantillons d'ingénierie, volume limité fin 2026 | Disponible dès aujourd'hui |
Source : benchmarks SemiAnalysis InferenceX, rapportés par The Register et Winbuzzer (25-26 août 2026).
Un rack complet embarque 128 accélérateurs Jalapeño, pour une puissance de calcul cumulée de 1,7 exaflops en 4 bits et 27,5 To de mémoire HBM4, alimentée par environ 2 pétaoctets par seconde de bande passante mémoire. Ce sont des chiffres de laboratoire : ils mesurent la performance brute de l'infrastructure, pas encore le coût final facturé à l'utilisateur.
Pourquoi OpenAI construit sa propre puce
La démarche n'est pas isolée. Google développe ses puces TPU depuis plusieurs générations pour ses propres services et pour Google Cloud. Amazon propose ses puces Trainium et Inferentia sur AWS. Microsoft a présenté sa puce Maia pour Azure. Meta développe sa propre puce MTIA pour ses charges d'inférence internes. OpenAI rejoint donc un mouvement de fond du secteur : réduire la dépendance à un fournisseur unique de GPU et mieux maîtriser le coût de l'inférence, qui représente une part croissante des dépenses des grands laboratoires d'IA à mesure que le nombre d'utilisateurs augmente.
Nvidia reste indispensable pour l'entraînement
OpenAI continue d'utiliser des GPU Nvidia et AMD pour entraîner ses futurs modèles. Jalapeño ne remplace pas cette infrastructure : elle vient s'y ajouter, uniquement pour la phase de service aux utilisateurs.
Calendrier de déploiement
25-26 août 2026
Premiers benchmarks publics
Fin 2026
Déploiements limités
2027
Montée en volume
Ce que cela signifie concrètement pour une PME
Pas d'effet immédiat sur vos factures
Une piste pour la disponibilité
Une concurrence qui profite au client à terme
Suivre le prix réel, pas l'annonce
Ce que l'on ne sait pas encore
OpenAI n'a pas communiqué le coût de fabrication de Jalapeño, sa fiabilité à grande échelle, ni le taux d'utilisation réel prévu pour ses centres de données. Le coût final par jeton pour l'utilisateur final dépend de ces trois facteurs, encore inconnus à ce stade.
FAQ
Qu'est-ce que la puce Jalapeño d'OpenAI ?
Jalapeño est la première puce IA conçue par OpenAI, dédiée à l'inférence (faire tourner des modèles déjà entraînés). Elle est développée avec Broadcom pour le silicium et le réseau, et Celestica pour l'intégration système.
Jalapeño va-t-elle faire baisser le prix de ChatGPT ou de l'API OpenAI ?
Rien n'est annoncé en ce sens à ce jour. Les gains d'efficacité mesurés (jusqu'à 1,9 fois plus de débit par kilowatt qu'un rack Nvidia GB200 ou GB300) créent un potentiel de baisse des coûts d'infrastructure, mais OpenAI n'a communiqué aucune baisse tarifaire liée à Jalapeño.
OpenAI abandonne-t-il Nvidia ?
Non. OpenAI continue d'utiliser des GPU Nvidia et AMD pour entraîner ses modèles. Jalapeño est réservée à l'inférence, c'est-à-dire au service des requêtes des utilisateurs, et vient compléter cette infrastructure plutôt que la remplacer.
Quand la puce Jalapeño sera-t-elle disponible à grande échelle ?
Selon les informations rapportées par The Register et Winbuzzer, des déploiements limités sont prévus fin 2026, considérés comme des échantillons d'ingénierie, avec une montée en volume annoncée pour 2027.
En conclusion
Jalapeño confirme une tendance de fond : les grands laboratoires d'IA cherchent à réduire leur dépendance à Nvidia pour maîtriser le coût de l'inférence, poste de dépense qui augmente avec chaque nouvel utilisateur. Pour une PME, il n'y a aucune raison de changer quoi que ce soit dans l'immédiat : aucune baisse de prix n'est annoncée, et le déploiement reste limité jusqu'en 2027. Le bon réflexe reste de suivre les grilles tarifaires officielles plutôt que les annonces de performance, et de garder un œil sur cette concurrence matérielle qui, historiquement, profite aux utilisateurs sur la durée. Pour suivre l'évolution des coûts de l'IA, consultez notre article sur le coût des agents IA avec Claude Opus 5 ou l'ensemble de nos ressources du Mag.


