Noticias.madrid

Mejorando la Eficiencia del Ajuste de Modelos de Lenguaje a Gran Escala con Datos No Estructurados mediante SageMaker Unified Studio y S3

Elena Digital López

AWS ha dado un paso significativo en el ámbito del aprendizaje automático al anunciar la integración de Amazon SageMaker Unified Studio con los buckets de propósito general de Amazon S3. Esta nueva funcionalidad prometedora permite a los equipos trabajar con datos no estructurados almacenados en S3, mejorando así las capacidades de análisis y procesamiento de grandes volúmenes de información compleja.

En un ejercicio reciente, se evidenció la eficacia de esta integración mediante la prueba del modelo Llama 3.2 11B Vision Instruct. Este modelo está diseñado para responder a preguntas visuales, un proceso que se pudo simplificar mediante la nueva conectividad ofrecida por SageMaker con S3. Al alimentar al modelo con imágenes y preguntas, se demostró su capacidad para realizar consultas complejas, como determinar la fecha de una transacción en un recibo detallado.

Llama 3.2 logró alcanzar un promedio de Similaridad de Levenshtein Normalizada (ANLS) del 85,3% en el conjunto de datos DocVQA, destacando en un entorno con miles de ejemplos de preguntas visuales. Aunque esta es una puntuación respetable, en situaciones que demandan mayor precisión, se implementó un protocolo para el ajuste fino. Se utilizaron diferentes tamaños de conjuntos de datos (1,000, 5,000 y 10,000 imágenes) para evaluar cómo el tamaño del conjunto influye en el rendimiento del modelo.

El ajuste fino a través de SageMaker Unified Studio implica un riguroso proceso que abarca desde la ingesta de datos hasta la evaluación de métricas. Para ello, las organizaciones deben cumplir ciertos requerimientos, como la creación de un dominio en SageMaker y el establecimiento de conexiones seguras con los buckets de S3. Esta gestión se facilita mediante una arquitectura de acceso bien diseñada, permitiendo la colaboración eficaz de los equipos de datos a través de roles que simplifican la administración de permisos.

La incorporación de MLflow ha sido crucial, permitiendo un seguimiento preciso de los experimentos y observando mejoras significativas en la precisión del modelo. Los resultados preliminares indicaron que el modelo ajustado mejoró su ANLS a 90,2%, un incremento del 4,9% en comparación con el modelo base, validando así la eficacia de la metodología adoptada.

Este avance no solo destaca la capacidad de Amazon SageMaker Unified Studio de optimizar modelos de aprendizaje automático, sino que también allana el camino para una transición fluida desde datos no estructurados hasta la implementación efectiva de modelos en producción. La adopción de esta tecnología promete redefinir el manejo de información compleja en el panorama empresarial actual.

Silvia Pastor

Silvia Pastor es una destacada periodista de Noticias.Madrid, especializada en periodismo de investigación. Su labor diaria incluye la cobertura de eventos importantes en la capital, la redacción de artículos de actualidad y la producción de segmentos audiovisuales. Silvia realiza entrevistas a figuras clave, proporciona análisis expertos y mantiene una presencia activa en redes sociales, compartiendo sus artículos y ofreciendo actualizaciones en tiempo real. Su enfoque profesional, centrado en la veracidad, objetividad y ética periodística, la convierte en una fuente confiable de información para su audiencia.

TE PUEDE INTERESAR...

    Noticias.Madrid
    Noticias.Madrid es un diario independiente que cubre la actualidad y las noticias de la provincia de Madrid.
    También informa sobre eventos y temas de interés en la capital de España.
    Copyright © 1995-2025 Colorvivo Internet S.L.U. Noticias.Madrid.
    Diario de información en el corazón de Madrid. Todos los derechos reservados. Alojamiento cloud con Stackscale.
    Resumen de privacidad

    Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.