¿Qué es la mezcla de expertos (MoE)? La arquitectura de los LLM modernos resulta más fácil de entender cuando se conecta con una decisión real, en vez de tratarse como otra palabra de moda de la IA. Esta guía de AI Tools Radar se centra en la idea operativa, las concesiones que importan y las preguntas que conviene plantearse antes de adoptar una herramienta o un flujo de trabajo.
La mezcla de expertos (MoE) es una arquitectura de red neuronal que distribuye el cálculo entre varias subredes especializadas llamadas expertos. Una red de compuerta ligera selecciona qué expertos procesan cada token de entrada. Solo se activa un pequeño subconjunto en cada momento. Este encaminamiento selectivo diferencia a MoE de los modelos densos tradicionales, que usan todos los parámetros para cada token.
El diseño ha ganado tracción porque permite que el número total de parámetros alcance cientos de miles de millones mientras el coste de inferencia se mantiene comparable al de modelos mucho más pequeños. Mixtral 8x7B y varias versiones de GPT-4 emplean este patrón. Comprender su mecánica ayuda a evaluar las afirmaciones sobre escala y eficiencia de los modelos.
Ideas clave. • La mezcla de expertos (MoE) sustituye una única red grande de propagación hacia adelante por muchas redes de expertos más pequeñas, junto con un enrutador que elige el subconjunto adecuado. • La activación dispersa implica que solo un número fijo de expertos procesa cada token, por lo que el cálculo por token se mantiene aproximadamente constante aunque crezca el total de parámetros. • Modelos como Mixtral 8x7B muestran que las versiones MoE pueden igualar o superar a referencias densas en pruebas comparativas mientras usan una cantidad similar de parámetros activos durante la inferencia. • El entrenamiento sigue siendo más complejo que el de modelos densos, porque equilibrar la carga entre expertos y mantener estable el enrutador exige técnicas adicionales. • La misma arquitectura aparece tanto en modelos abiertos como en sistemas propietarios, lo que demuestra que el enfoque ha pasado de la investigación a los modelos de lenguaje grandes en producción.
Un modelo de mezcla de expertos contiene un conjunto de subredes expertas y una función de compuerta. La función de compuerta recibe la misma entrada que los expertos y genera una distribución de probabilidad sobre el conjunto de expertos. Solo los k expertos superiores, con las puntuaciones más altas, reciben la entrada y contribuyen a la salida. Los demás permanecen inactivos para ese token.
Entre sus propiedades fundamentales figuran la modularidad, la dispersión y el cálculo condicional. La modularidad se aprecia porque cada experto puede especializarse en distintos patrones de datos o tipos de tareas. La dispersión aparece porque la fracción de parámetros activos por token se mantiene baja. El cálculo condicional existe porque el conjunto activo cambia con cada token.
Estas propiedades distinguen los modelos MoE de los transformadores densos. En un modelo denso, cada peso interviene en cada pasada hacia adelante. En un modelo MoE, la mayoría de los pesos permanece inactiva para cualquier token dado. El resultado es una mayor capacidad total con un cálculo por token aproximadamente constante.
La arquitectura se divide en tres capas: el enrutador, el conjunto de expertos y el paso de combinación de salidas.
El enrutador es una pequeña capa lineal o un MLP poco profundo que asigna el estado oculto de entrada a un vector de puntuaciones de expertos. Una función softmax convierte esas puntuaciones en probabilidades. Después, el sistema selecciona los k expertos superiores de acuerdo con esas probabilidades. Los valores habituales de k son 1 o 2, incluso cuando el número total de expertos llega a ocho o más.
Cada experto suele ser una red de propagación hacia adelante idéntica en estructura a la FFN por posición dentro de un bloque transformador estándar. Como los expertos son más pequeños que una única FFN grande, el modelo puede mantener muchos de ellos sin superar los presupuestos de memoria durante el entrenamiento. La especialización surge durante el entrenamiento, cuando distintos expertos reciben gradientes procedentes de distribuciones de datos diferentes.
Las salidas de los expertos seleccionados se multiplican por sus probabilidades del enrutador y se suman. Así se obtiene la contribución final de la capa MoE. El resto del bloque transformador, incluida la atención, permanece sin cambios.
La activación dispersa mantiene bajo el número de parámetros activos. Un modelo con 8 expertos, cada uno del tamaño de una FFN de 7B parámetros, sigue activando aproximadamente el cálculo de un modelo de 7B cuando k es igual a 1. Los expertos restantes permanecen en memoria, pero no participan en las multiplicaciones de matrices para ese token.
Mixtral 8x7B contiene ocho expertos por capa y activa dos por token. Por tanto, el número de parámetros activos durante la inferencia es similar al de un modelo denso de 12–13B, aunque el total supera los 46B. En pruebas estándar, el modelo supera a Llama 2 70B en varias categorías mientras utiliza menos ancho de banda de memoria durante la generación.
Se informa ampliamente que GPT-4 usa un diseño MoE con un número mayor de expertos y un total de parámetros más elevado. Los detalles públicos siguen siendo limitados, pero el patrón de alta capacidad total junto con un coste de inferencia controlado responde al mismo principio. Otros sistemas de producción, como Switch Transformer y GLaM de Google, siguen una estructura idéntica a una escala aún mayor.
El patrón compartido por estos modelos es que el enrutador aprende a enviar distintos tipos de tokens a distintos expertos. Los tokens de código pueden dirigirse a un conjunto de expertos, mientras que los tokens de lenguaje natural se encaminan a otro. Esta especialización implícita mejora la eficiencia de las muestras durante el entrenamiento.
En los modelos conversacionales de pesos abiertos, el diseño permite contextos más largos a un coste manejable. Los usuarios pueden ejecutar Mixtral 8x7B localmente o en GPU en la nube modestas porque el uso de memoria activa se mantiene próximo al de un modelo denso de 13B. Las empresas que despliegan asistentes internos obtienen una mayor calidad de salida sin aumentos proporcionales del hardware de servicio.
Los grupos de investigación que estudian las leyes de escalado usan MoE para comprobar si el rendimiento sigue mejorando cuando el total de parámetros supera el punto en que el entrenamiento denso deja de ser práctico. Los artículos sobre Switch Transformer mostraron que un modelo MoE con más de un billón de parámetros podía entrenarse de forma estable al combinarse con pérdidas auxiliares de equilibrio de carga.
Preguntas frecuentes sobre la mezcla de expertos (MoE).
P: ¿Cómo reduce la mezcla de expertos (MoE) el coste de inferencia frente a un modelo denso del mismo tamaño total?
R: Solo los expertos seleccionados realizan multiplicaciones de matrices. El coste del enrutador es pequeño, y el ancho de banda de memoria viene determinado por los pesos activos, no por el total. Como resultado, la velocidad de generación sigue el tamaño de los expertos activos.
P: ¿La mezcla de expertos (MoE) requiere hardware especial?
R: Las GPU estándar son suficientes. Una inferencia eficiente sigue beneficiándose de núcleos que omiten expertos con contribución nula, pero la arquitectura en sí funciona en los entornos de ejecución de transformadores existentes una vez que se cargan los pesos del modelo.
P: ¿En qué se diferencia el entrenamiento del de un transformador denso?
R: El enrutador debe entrenarse junto a los expertos. Las pérdidas auxiliares mantienen equilibrado el uso de los expertos. Sin esos términos, algunos expertos reciben muy pocos tokens y nunca aprenden representaciones útiles.
P: ¿Puede ajustarse una mezcla de expertos (MoE) como un modelo denso?
R: Sí. Se aplican los mismos procesos de ajuste supervisado y optimización de preferencias. Solo el enrutador y los expertos activos reciben gradientes en cada ejemplo, lo que incluso puede reducir el uso de memoria durante la pasada hacia atrás.
P: ¿Qué ocurre si el enrutador envía todos los tokens al mismo experto?
R: Ese experto recibe una cantidad desproporcionada de gradientes mientras los demás quedan poco entrenados. Durante el preentrenamiento se añaden pérdidas de equilibrio de carga y perturbación del enrutador para evitar el colapso hacia un único experto.
La prueba práctica consiste en comprobar si este enfoque mejora una parte repetible del trabajo sin ocultar sus fuentes, costes ni modos de fallo. Empieza con una tarea representativa, conserva un punto de control humano donde los errores importen y vuelve a evaluar el resultado a medida que cambien los modelos y los productos.
Combinamos fuentes primarias, documentación de producto y casos de uso reales para ayudarte a valorar si una herramienta encaja en tu flujo de trabajo.