

La inferencia en Inteligencia Artificial, más que el entrenamiento, se está consolidando como el auténtico cuello de botella en la industria. Esta tendencia es impulsada por el creciente consumo de tokens por parte de agentes y asistentes de programación, que ha disparado las consultas relacionadas con programación, pasando del 11% al 50% del volumen total en cuestión de semanas, de acuerdo con el informe «State of AI» de OpenRouter. Este cambio refleja una transición hacia aplicaciones prácticas como la depuración y generación de código.
En respuesta a este desafío, NVIDIA ha presentado datos relevantes sobre el costo de servir IA en tiempo real, especialmente donde cada milisegundo y vatio cuentan. Según la evaluación de SemiAnalysis InferenceX, los sistemas GB300 NVL72 de NVIDIA, basados en su plataforma Blackwell Ultra, proporcionan hasta 50 veces más rendimiento por megavatio y reducen en 35 veces el costo por token en comparación con la generación Hopper, particularmente en aplicaciones que requieren baja latencia.
En el entorno de los centros de procesamiento de datos (CPD), el rendimiento bruto ha dejado de ser suficiente. La atención se centra ahora en la eficiencia energética, el coste por token y la operatividad al escalar infraestructuras. NVIDIA subraya que su enfoque no se limita al hardware, sino que se extiende a la optimización del software, destacando avances en librerías como TensorRT-LLM, NVIDIA Dynamo y SGLang, que mejoran la inferencia en escenarios de Mixture-of-Experts (MoE).
Estos avances en software, como en TensorRT-LLM, permiten hasta quintuplicar el rendimiento en cargas de baja latencia respecto a modelos anteriores, subrayando la importancia de factores como el runtime, la planificación, y la comunicación entre GPUs. Además, tecnologías como los kernels optimizados para baja latencia, NVLink Symmetric Memory y el Programmatic dependent launch son cruciales para la operativa eficiente de asistentes interactivos.
Mientras tanto, el desafío del «contexto largo» sigue vigente. Los sistemas deben manejar enormes volúmenes de datos, y en escenarios con 128.000 tokens de entrada y 8.000 de salida, NVIDIA afirma que su plataforma GB300 NVL72 puede reducir el coste por token significativamente frente a generaciones anteriores.
La adopción de la plataforma Blackwell por parte de compañías de cloud como Microsoft y Oracle Cloud Infrastructure indica una tendencia hacia infraestructuras más eficaces. Con escenarios de baja latencia y contexto largo a la vanguardia, la decisión se traslada de elegir hardware GPU a definir arquitecturas de operación completas.
Por otro lado, NVIDIA anticipa su plataforma Rubin, que promete superar a Blackwell en rendimiento por megavatio, reduciendo significativamente el coste por millón de tokens. Con una capacidad de entrenar grandes modelos usando menos recursos, Rubin representa un paso hacia hacer la IA más accesible y asequible.
Para los responsables de infraestructura, estas evoluciones suponen un cambio en la forma de evaluar costos y eficiencia, destacando la importancia de métricas como tokens por megavatio y el manejo de contextos largos, todo en pos de maximizar la eficiencia y minimizar el gasto energético. Estos desafíos y avances marcarán el camino de la IA en el futuro cercano.
Más información y referencias en Noticias Cloud.
