C’est quoi, concrètement ?
C’est une puce faite pour un travail précis : faire tourner les modèles d’IA quand ils répondent, et non quand ils apprennent.
Un modèle d’IA vit deux phases. L’apprentissage demande une puissance colossale, mais reste rare. La réponse, elle, mobilise des serveurs en permanence, à chaque question posée par un utilisateur. C’est cette activité quotidienne, appelée inférence, que Jalapeño vise.
La puce a été présentée le 24 juin 2026. Broadcom signe l’implémentation du silicium et le réseau Tomahawk qui relie les puces entre elles. Celestica assure l’intégration. Les premiers échantillons d’ingénierie tournent déjà en laboratoire, y compris avec un modèle d’OpenAI.
Les premiers résultats sont fiables ?
Les chiffres publiés le 25 août 2026 sont encourageants. Ils viennent d’OpenAI directement, annoncés par Sam Altman sur X. C’est une nuance de taille.
Sur la plateforme de tests InferenceX, face à un Nvidia GB300, le plus gros modèle ouvert testé, Kimi K2.5, affiche environ 1,5 fois plus de performance par watt et 3,4 fois moins de latence. La puce consomme 700 W contre 1 400 W pour le GB300. Les gains annoncés sont des maximums, ils varient selon les modèles et les usages.
Aucun audit indépendant n’a confirmé ces mesures. Et le chemin reste long : la feuille de route parle d’un déploiement à l’échelle du gigawatt, avec des partenaires de centres de données, sur plusieurs générations de puces. Concrètement, rien de tout cela n’arrivera dans les outils que vous utilisez avant des années.
Pourquoi les géants fabriquent leurs propres puces ?
Google fait tourner ses TPU depuis des années. Amazon a ses puces Trainium et Inferentia. Avec Jalapeño, OpenAI rejoint ce mouvement.
La raison tient en une phrase : l’inférence est la facture d’électricité des entreprises d’IA. Chaque réponse générée coûte de l’énergie et du matériel. En concevant leur propre silicium, ces acteurs reprennent la main sur leur plus gros poste de dépense et réduisent leur dépendance aux fabricants traditionnels.
C’est un signal fort pour le marché : la performance ne viendra plus seulement des puces généralistes, mais d’équipements taillés pour un usage précis.
Ça change quoi pour une TPE ?
Aucune action à prévoir de votre côté, ni aujourd’hui ni dans les prochains mois.
Vous n’avez pas d’abonnement à changer, pas d’outil à remplacer, pas de veille technique à organiser. Les tarifs des services que vous utilisez restent ce qu’ils sont, et la concurrence entre fournisseurs fait déjà son travail.
Quand cette génération de puces arrivera sur le marché, si les promesses se confirment, les fournisseurs auront la possibilité de baisser leurs prix ou d’offrir plus de capacité pour le même tarif. Rien n’est garanti : une économie de production ne se transforme pas toujours en baisse de facture. Mais la tendance joue en votre faveur, comme elle l’a fait pour le stockage et la puissance de calcul, dont les coûts n’ont cessé de baisser.
Alors, faut attendre avant de se lancer ? Non. Attendre une baisse hypothétique, c’est repousser des gains concrets que les outils actuels offrent déjà, souvent pour quelques dizaines d’euros par mois. La bonne question n’est pas de savoir quelle puce fera tourner l’IA dans trois ans. C’est de savoir où elle peut vous faire gagner du temps cette semaine.
Question : Les prix de l’IA vont baisser ?
Rien n’est garanti. Les puces maison comme Jalapeño visent à réduire le coût de production de l’IA, mais la baisse des prix dépend de la stratégie commerciale d’OpenAI et de la concurrence. La tendance est là, le calendrier et l’ampleur restent à confirmer.
Question : Jalapeño remplace les puces Nvidia ?
Pas tout de suite. Nvidia reste la référence du marché, et Jalapeño n’arrivera en volume que dans plusieurs années. Cette puce montre surtout qu’OpenAI veut réduire sa dépendance aux fournisseurs de matériel, comme Google et Amazon l’ont déjà fait avec leurs propres puces.
Question : Quelle puce utilise votre fournisseur d’IA ?
Vous n’avez pas à le savoir. La puce qui fait tourner un outil d’IA ne change rien à ce que vous en retirez. Seuls les résultats, le prix et la fiabilité comptent. La course aux puces concerne les fournisseurs, pas les utilisateurs.