
OpenAI har publicerat de första testresultaten för sitt egenutvecklade AI-chip Jalapeno. Kretsen är optimerad för inferens i stora språkmodeller och särskilt för interaktiva AI-agenter, där både hög genomströmning och låg latens är avgörande.
Enligt OpenAI levererar Jalapeno 1,5–1,9 gånger mer AI-arbete per watt än jämförelsesystemen över tre publika modeller. Samtidigt var end-to-end-latensen 1,7–3,6 gånger lägre. I mycket interaktiva arbetslaster var prestandan 2,1–4,1 gånger högre.
Arkitekturen är byggd för hela inferensflödet. Prefill-fasen är främst beräkningsintensiv, medan decode-fasen i högre grad begränsas av minnesbandbredd. Därför har OpenAI utvecklat beräkning, minne, nätverk och programvara tillsammans för att minska dataflytt och kommunikationslatens mellan olika delar av systemet.
AI användes också i själva chiputvecklingen. Enligt OpenAI hjälpte AI till att utforska implementationer, korta design- och verifieringsloopar samt optimera kretsens aritmetik. Från den första designen till tapeout tog det nio månader.
AI används dessutom för att programmera kretsen. För utvalda attention- och mixture-of-experts-block i GPT-OSS var AI-genererade implementationer 1,5–1,8 gånger snabbare än motsvarande kod skriven av mänskliga experter.
OpenAI planerar att börja ta Jalapeno i drift i sin egen beräkningsinfrastruktur före årets slut. Generation två är redan långt kommen i utvecklingen och en tredje generation håller på att ta form.