

A medida que las empresas de todo el mundo intensifican su adopción de inteligencia artificial generativa, enfrentan un desafío cada vez más complicado: equilibrar la calidad, los costos y la latencia. Este reto es particularmente relevante en el ámbito de los modelos de lenguaje grande (LLM, por sus siglas en inglés), donde los costos de inferencia pueden representar entre el 70% y el 90% de los gastos operativos totales. Para abordar este problema, las organizaciones están explorando estrategias que promuevan interacciones más eficientes con los modelos, evitando el gasto innecesario de recursos.
Una técnica innovadora llamada «Chain-of-Draft» (CoD) ha emergido como una solución efectiva a esta problemática. Propuesta en un estudio por Zoom AI, CoD se presenta como una evolución de la técnica tradicionalmente conocida como «Chain-of-Thought» (CoT). Mientras que CoT ha contribuido al mejoramiento del razonamiento en modelos de lenguaje a través de explicaciones detalladas, CoD da un paso más allá al emular los métodos de resolución de problemas humanos mediante pasos de pensamiento más directos y concisos.
La implementación práctica de CoD utilizando Amazon Bedrock y AWS Lambda ha mostrado resultados prometedores. Se ha observado hasta un 75% de reducción en el uso de tokens y una disminución superior al 78% en la latencia, preservando al mismo tiempo la precisión característica de CoT. Estos resultados, demostrados a través de ejemplos y métricas de rendimiento, señalan un avance significativo en la optimización de costos y la mejora de la experiencia del usuario gracias a tiempos de respuesta más ágiles.
El principio de funcionamiento de CoD se centra en eliminar la redundancia frecuente en las cadenas de razonamiento. Al simplificar los pasos hasta su esencia semántica, los modelos pueden concentrarse en la estructura lógica de las tareas, en lugar de perderse en la riqueza del lenguaje. Esto no solo reduce la latencia de inferencia mediante salidas más concisas y genera menores costos por tokens, sino que también ofrece una salida clara y directa para su procesamiento o automatización posterior.
Sin embargo, es importante subrayar que CoD no es la panacea. Hay escenarios donde un razonamiento más detallado es ineludible, como en las revisiones legales o médicas, donde la precisión interpretativa es crucial. Asimismo, en modelos de lenguaje más pequeños, CoD puede resultar menos efectivo en comparación con CoT.
En resumen, CoD emerge como una técnica prometedora para las organizaciones que buscan optimizar su inversión en inteligencia artificial generativa sin comprometer la calidad del razonamiento. En el camino hacia modelos de lenguaje más eficientes y efectivos, CoD marca un hito importante, permitiendo a las empresas avanzar con confianza en la vanguardia del desarrollo tecnológico.
