Estrada Maldonado, J. O.
EN ES
← Toda la investigación

Arquitectura de dos torres con fusión temprana para predicción de resultados en la Liga MX

Combinando embeddings transferidos y estadísticas tabulares, con un caso de estudio del Club América

Jesús Osvaldo Estrada Maldonado — autor único

En prensa · presentación en diciembre de 2026 ICECER2026 · artículo 557 Indexación en Scopus prevista para enero de 2027 Texto original en inglés
Esta página se publica antes de la presentación para que el trabajo pueda encontrarse y citarse. Las cifras son las enviadas al comité; la referencia definitiva se añadirá cuando salgan las memorias.

El problema

La predicción automatizada de resultados de fútbol topó con un techo de desempeño que dos décadas de refinamiento metodológico no han logrado desplazar. Los modelos más competitivos se mueven dentro de una banda estrecha de precisión que los métodos puramente tabulares nunca han superado, y las redes profundas entrenadas desde cero suelen empeorar las cosas: con muestras pequeñas, sobreajustan.

La arquitectura

El artículo propone y fundamenta teóricamente un clasificador híbrido construido sobre un diseño de dos torres con fusión temprana.

  • Torre tabular. Las estadísticas históricas de partidos se codifican con un perceptrón multicapa entrenado de principio a fin sobre ocho temporadas completas de la primera división mexicana.
  • Torre de texto. La cobertura mediática previa al partido se codifica con un modelo de lenguaje preentrenado a gran escala, especializado en texto de redes sociales en español.
  • Fusión. Cada red se trunca después de su última capa oculta y los dos embeddings densos resultantes se concatenan directamente en un solo vector de características.
  • Cabeza. El vector fusionado alimenta un clasificador de gradient boosting.

La razón por la que el diseño funciona es la transferencia, no la capacidad: el conocimiento lingüístico del codificador de texto se importa en lugar de aprenderse desde un corpus deportivo pequeño, y eso es lo que mitiga el sobreajuste que hunde a los modelos profundos entrenados desde cero con datos de este tamaño.

Estadísticas de partido 8 temporadas, Liga MX Texto mediático previo cobertura en español Torre MLP entrenamiento completo Modelo preentrenado transferido y reducido Concatenación un solo vector fusionado Gradient boosting victoria · empate · derrota
Fusión temprana: ambas torres se truncan tras su última capa oculta y sus embeddings se unen antes de clasificar, en lugar de combinar predicciones después del hecho.

Caso de estudio y evaluación

El caso de estudio abarca 350 partidos del Club América, elegido por ser el club que genera la mayor discusión mediática en la Liga MX y, por lo tanto, la señal textual previa más rica. Los resultados se promedian sobre 100 entrenamientos independientes y se validan con una validación cruzada independiente.

Resultados

Solo torre tabular52.9%
Fusión de dos torres57.1%
Precisión, media de 100 corridas independientes. La ganancia es estadísticamente significativa con p < 0.0001, y precisión, recuperación, F1 y log loss mejoran de forma simultánea.

La mejora se sostiene una vez que el embedding de texto se reduce en dimensionalidad para ajustarse al tamaño de muestra disponible; sin esa reducción, el ancho adicional cuesta más de lo que aporta la señal. La recuperación del empate, en cambio, permanece prácticamente igual: la representación fusionada ayuda a separar victorias de derrotas, no el punto medio ambiguo.

El hallazgo metodológico

El protocolo de evaluación terminó importando tanto como la arquitectura. Una sola corrida de entrenamiento no era estadísticamente distinguible de ningún efecto. Solo el protocolo de múltiples corridas reveló la mejora. En conjuntos de datos futbolísticos de tamaño comparable, la evaluación rigurosa con corridas repetidas no es un lujo: es la condición para saber si algo ocurrió.

Si un resultado sobre unos cuantos cientos de partidos se reporta a partir de un solo entrenamiento, la lectura honesta es que no se ha medido.

Por qué generaliza

Nada en el diseño es específico del fútbol. El patrón —un conjunto tabular pequeño, un flujo adyacente de texto no estructurado y un codificador preentrenado que aporta el conocimiento lingüístico que el corpus local no puede dar— se repite en problemas aplicados de predicción en economía y ciencias sociales, que es de donde llegué a él.