La empresa Olmo ha lanzado Olmo-core 3, una actualización de su framework para desarrollar modelos de lenguaje grandes que incluye un sistema de entrenamiento de mezcla de expertos (MoE) rediseñado. Este sistema permite escalar el entrenamiento de MoE hasta el rango de trillones de parámetros mientras se mantiene la eficiencia computacional. Olmo-core 3 está diseñado para cerrar la brecha entre la eficiencia computacional y la complejidad de los modelos MoE, permitiendo a los investigadores y laboratorios más pequeños desarrollar modelos avanzados de manera más eficiente.
Introduciendo Olmo-core 3: Infraestructura de entrenamiento abierta y escalable para MoEs grandes
Imagen ilustrativa: Gobierno CDMX · CC0
Resumen elaborado automáticamente con IA a partir de la fuente original.
Fuente principal:
Hugging Face Blog →
Hugging Face Blog →
