Chip de inferencia de OpenAI: los resultados que arrojó Jalapeño

Última actualización: 25/08/2026

El chip de inferencia de OpenAI mostró un salto importante en rendimiento y eficiencia durante las primeras pruebas públicas de Jalapeño, el acelerador propio que la compañía está preparando para ejecutar modelos de inteligencia artificial a gran escala. OpenAI afirma que el sistema puede entregar más trabajo de IA por unidad de energía y reducir la latencia frente a plataformas comerciales comparadas en el benchmark InferenceX.

Los resultados publicados el 25 de agosto de 2026 convierten a Jalapeño en algo más que un proyecto de hardware. OpenAI ya habla de silicio propio funcionando con mediciones concretas, de una segunda generación en desarrollo y de una estrategia para controlar una parte mayor de la infraestructura que sostiene ChatGPT, Codex y sus futuros productos basados en agentes.

Qué mostró Jalapeño en las primeras pruebas

OpenAI evaluó Jalapeño con InferenceX, un benchmark público de SemiAnalysis que mide el proceso completo de servir una solicitud de IA. La compañía comparó su acelerador con sistemas comerciales disponibles y puso el foco en tres variables que resultan especialmente importantes para los servicios de IA actuales: rendimiento, consumo eléctrico y latencia.

Según los datos publicados por OpenAI, Jalapeño consiguió entre 1,5 y 1,9 veces más trabajo de IA por vatio en el punto de máximo rendimiento y entre 1,7 y 3,6 veces menos latencia de extremo a extremo que los sistemas de comparación. En cargas interactivas, la compañía calcula entre 2,1 y 4,1 veces más rendimiento.

La prueba no se limitó a modelos de OpenAI. Jalapeño fue evaluado con GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T. En el caso de Kimi, el modelo público más grande incluido en la comparación, OpenAI informó aproximadamente 1,5 veces más rendimiento máximo por vatio y 3,4 veces menos latencia de extremo a extremo frente al sistema de referencia.

El chip está diseñado para inferencia, no para todo

La diferencia central de Jalapeño está en su especialización. OpenAI no diseñó un acelerador generalista y después intentó adaptarlo a los modelos de lenguaje. La compañía partió de las características de la inferencia moderna y construyó alrededor de ellas el chip, la memoria, la red, el software y el sistema completo.

Durante la inferencia existen fases con necesidades diferentes. El prefill, cuando el sistema procesa el pedido inicial del usuario, es especialmente exigente en capacidad de cómputo. El decode, cuando genera la respuesta token por token, está más condicionado por el ancho de banda de memoria. A eso se suman los tiempos de comunicación cuando la información tiene que viajar entre distintos chips o componentes.

OpenAI asegura que Jalapeño busca reducir esos movimientos de datos. Parte del estado del modelo, incluido el KV cache utilizado durante la generación, puede mantenerse localizado mientras el sistema coordina cómputo, memoria y red según la etapa de la solicitud. La intención es evitar que un componente rápido quede esperando a otro más lento.

Qué significa el rendimiento por vatio

En los centros de datos de IA, la eficiencia energética tiene una importancia económica directa. Cada consulta requiere electricidad para ejecutar el modelo, refrigerar los servidores y mantener operativa la infraestructura. Si un acelerador puede realizar más trabajo con la misma cantidad de energía, el operador puede atender más solicitudes sin aumentar el consumo en la misma proporción.

OpenAI indica que Jalapeño tiene una potencia nominal de 700 vatios, aunque durante las cargas evaluadas su consumo sostenido se mantuvo en 550 vatios o menos. La compañía sostiene que esa relación entre rendimiento y energía puede ser una de las principales ventajas de su arquitectura cuando la demanda de inferencia siga creciendo.

La cuestión es especialmente relevante para los agentes de IA. Un agente puede necesitar ejecutar muchos pasos consecutivos para completar una tarea. Una pequeña demora en cada operación termina acumulándose, por lo que reducir la latencia puede tener un efecto mayor que en una consulta aislada. OpenAI está diseñando Jalapeño precisamente pensando en ese tipo de cargas interactivas.

OpenAI también usó IA para diseñar el chip

Uno de los aspectos más llamativos del proyecto es que los propios modelos de OpenAI participaron en el desarrollo del hardware. La compañía afirma que utilizó IA para explorar implementaciones, acelerar ciclos de diseño y verificación y optimizar circuitos aritméticos.

El programa llegó desde el diseño inicial hasta el tape-out en nueve meses. OpenAI presenta ese plazo como una muestra de lo que puede conseguir una colaboración estrecha entre hardware y software, apoyada por la experiencia de Broadcom en implementación de silicio y por Celestica en placas, racks y sistemas.

La estrategia no termina en diseñar el chip. OpenAI también está utilizando IA para programarlo. La compañía explica que trabajó con Codex y GPT-Astra para adaptar tres modelos de pesos abiertos que no estaban previstos originalmente para Jalapeño. En determinados bloques de atención y mezcla de expertos, las implementaciones generadas por IA llegaron a ser entre 1,5 y 1,8 veces más rápidas que las versiones escritas por expertos humanos, aunque esos números corresponden a bloques concretos y no al rendimiento completo de los modelos.

El objetivo es controlar más partes de la infraestructura

El chip de inferencia de OpenAI forma parte de una estrategia más amplia. Hasta ahora, las grandes empresas de IA han dependido de aceleradores fabricados por Nvidia, AMD y otros proveedores para construir sus centros de datos. OpenAI seguirá utilizando hardware externo, pero Jalapeño le permite sumar una plataforma diseñada específicamente alrededor de sus propios modelos y productos.

En Tecno.ar ya analizamos cómo Etched apuesta por chips especializados para inferencia. La diferencia es que OpenAI puede utilizar información obtenida directamente de sus propios modelos y servicios para decidir qué necesita optimizar en el siguiente diseño.

La compañía describe esta estrategia como una ventaja de integración vertical: modelos, productos, software de serving, chips, memoria, redes y sistemas pueden diseñarse pensando en conjunto. Si una mejora en un modelo cambia las necesidades de memoria o comunicación, el hardware futuro puede incorporar ese aprendizaje en lugar de depender únicamente de una plataforma general.

No significa que OpenAI vaya a dejar Nvidia

Los resultados de Jalapeño no implican que OpenAI vaya a abandonar los aceleradores de Nvidia. La propia compañía afirma que continuará desplegando ampliamente hardware de Nvidia y de otros socios para entrenamiento e inferencia. El objetivo es sumar una alternativa propia y poder elegir el sistema más adecuado para cada carga de trabajo.

La cobertura anterior de Nvidia y Rebellions muestra por qué el mercado de aceleradores especializados se está ampliando: distintos proveedores buscan ofrecer soluciones que reduzcan costos, mejoren eficiencia o resuelvan necesidades concretas de los modelos modernos.

Para OpenAI, tener silicio propio puede aportar mayor capacidad de decisión sobre rendimiento, costos y disponibilidad. También puede servir como herramienta de negociación frente a proveedores externos, aunque todavía falta conocer el costo real de fabricación y despliegue a gran escala.

Cuándo llegará a los centros de datos

OpenAI prevé comenzar a desplegar Jalapeño dentro de su propia infraestructura de cómputo hacia fines de 2026. La compañía ya trabaja en la producción, la maduración del software y la validación de rendimiento con más modelos.

El proyecto además tiene una hoja de ruta multigeneracional. OpenAI asegura que la segunda generación ya está en desarrollo y que una tercera empieza a tomar forma. Esto indica que Jalapeño no debe interpretarse como un experimento aislado, sino como el comienzo de una familia de aceleradores que podría evolucionar junto con los modelos de la compañía.

Qué puede cambiar para los usuarios argentinos

Para el usuario argentino, el efecto no será ver una computadora con un chip Jalapeño a la venta. El impacto más probable llegará de manera indirecta: si la infraestructura de inferencia de OpenAI consigue reducir el costo por consulta y mejorar la velocidad, esas ganancias pueden trasladarse a ChatGPT, Codex y servicios de API utilizados por empresas locales.

Una infraestructura más eficiente también puede ayudar a sostener el crecimiento de herramientas de IA sin que el consumo eléctrico y el costo de los centros de datos aumenten al mismo ritmo. Esto resulta relevante para compañías argentinas que dependen de APIs de modelos para automatización, atención al cliente, programación, análisis de documentos o creación de contenido.

De todos modos, todavía hay una diferencia entre una prueba de laboratorio y un despliegue masivo. Los resultados publicados por OpenAI son propios y fueron medidos con una metodología que la compañía describe en detalle, pero será necesario observar evaluaciones independientes, disponibilidad real y costos de operación antes de determinar cuánto cambiará la economía de la IA.

El próximo desafío será escalarlo

La primera generación del chip de inferencia de OpenAI ya tiene resultados medidos y una fecha prevista de despliegue. El siguiente desafío será demostrar que esas ventajas se mantienen cuando Jalapeño pase de pruebas controladas a sistemas de producción con millones de solicitudes, modelos distintos y cargas variables durante todo el día.

Si OpenAI logra sostener el rendimiento por vatio y la baja latencia que mostró en InferenceX, el movimiento puede convertirse en uno de los cambios más importantes de su infraestructura. La compañía no busca reemplazar de inmediato a Nvidia: busca sumar control sobre una capa crítica de su negocio y construir una plataforma que pueda evolucionar al mismo ritmo que sus modelos.

Fuentes

OpenAI — resultados iniciales de Jalapeño

OpenAI y Broadcom — presentación de Jalapeño

TechCrunch — benchmarks del chip Jalapeño

Resumen de privacidad

Este sitio utiliza cookies para que podamos ofrecer una mejor experiencia de usuario . La información de las cookies  realiza funciones tales como reconocer a un usuario cuando vuelve a ingresar a nuestra web, y ayuda a nuestro equipo a entender sus preferencias.