¿Qué tan bien se puede anticipar un Mundial antes de que se juegue? Esa fue la pregunta que nos interesaba responder con el Mundial 2026. Durante el torneo corrimos en vivo un motor de probabilidad propio, Elo combinado con Dixon-Coles, para los 104 partidos, mezclado con el mercado de cuotas (75% mercado, 25% motor propio, la calibración que quedó en producción). Cada probabilidad se calculó antes de que el partido se jugara y no se tocó después: nada de ajustar el modelo ni el umbral con el resultado ya conocido.

Antes de mostrar los números, una aclaración de vocabulario. En este texto hablamos seguido del resultado 1X2 de un partido: sus tres alternativas básicas, que gane el equipo local, que empaten, o que gane el equipo visitante. El nombre viene de cómo se anota tradicionalmente en las pollas de fútbol: 1 para la victoria local, X para el empate, 2 para la victoria visitante.

Qué significa el 71,2%

En 74 de 104 partidos, la alternativa 1X2 que el modelo consideraba más probable fue la que efectivamente ocurrió. No significa que el modelo le haya puesto 71,2% de probabilidad a cada partido —esa cifra varió caso a caso, desde partidos muy parejos (apenas 34%) hasta favoritos muy claros (más de 90%)—, tampoco dice nada sobre marcadores exactos, ni prueba por sí sola que las probabilidades estuvieran bien puestas.

Resultados principales

Cinco cifras para entender el desempeño

Cada indicador responde una pregunta distinta. Ninguno, por sí solo, cuenta la historia completa — por eso conviene separar tres niveles de exigencia, que es la estructura del resto de este artículo.

RPS combinado 0,1472

Error probabilístico del modelo combinado — apenas mejor que el mercado solo (0,1477).

Menor es mejor
Marcador exacto modal 14,4%

El marcador que el modelo daba como más probable fue exactamente el correcto en 15 de los 104 partidos.

Mayor es mejor
Prob. mediana del marcador real 8,2%

Cuánta probabilidad reservaba, típicamente, el modelo para el marcador que terminó ocurriendo.

Mayor es mejor
Error en goles esperados 0,87 goles

Distancia absoluta promedio entre la expectativa de goles del modelo y lo observado, por equipo.

Menor es mejor
Cómo leer la evaluación

Tres preguntas, tres niveles de exigencia

1

¿Acertó la categoría 1X2?

Comprueba si ocurrió la alternativa —local, empate o visita— que tenía mayor probabilidad.

2

¿Asignó buenas probabilidades?

RPS y Brier miran toda la distribución, no solo si la alternativa favorita ocurrió.

3

¿Qué tan cerca del marcador?

Revisa la probabilidad del resultado exacto y la distancia entre goles esperados y observados.

Comparación de versiones

Naive, mercado, modelo propio o los tres combinados

Probamos cuatro versiones sobre los mismos 104 partidos: una línea base ingenua (33% a cada resultado), el mercado de cuotas solo, nuestro motor propio solo (Elo + Dixon-Coles, sin mercado) y la combinación que corrió en producción.

Acierto 1X2 sobre los mismos 104 partidos

Porcentaje de aciertos del resultado 1X2 más probable, por versión: línea base ingenua 48,1%; solo mercado 68,3%; solo modelo propio 67,3%; Spherics combinado 71,2%, el más alto.

Resultado observado en un solo torneo; no demuestra que la combinación vaya a superar siempre al mercado.
La lección

Que el mercado sea difícil de superar ya lo sabíamos: condensa la opinión de muchos participantes con dinero de por medio. Pero nuestro motor propio no necesita ganarle por sí solo para ser útil —le basta con equivocarse en partidos distintos a los que equivoca el mercado—: ninguno de los dos componentes por separado alcanza lo que logran juntos. El motor propio no reemplaza al mercado, lo complementa.

Calidad probabilística

Para quienes quieren el detalle fino

¿Ocurrió el resultado que el modelo consideraba más probable —local, empate o visita? Esa es la lectura fácil, pero no cuenta toda la historia: no es lo mismo equivocarse en un partido muy parejo que haber puesto 90% de probabilidad a una alternativa y que ocurra otra. Y también puede pasar al revés: un modelo puede fallar la categoría más probable y, aun así, haber asignado una probabilidad razonable al resultado que terminó ocurriendo. Para capturar esas diferencias existen métricas que miran, partido a partido, qué tan lejos estuvo cada probabilidad asignada del resultado real: dos de las más usadas son RPS (Ranked Probability Score) y Brier score. Evalúan la calidad de todas las probabilidades que dio el modelo, no solo si la alternativa favorita ocurrió. En ambas, un número más bajo es mejor.

En palabras simples, ¿por qué no basta con contar aciertos?

Imagina dos partidos donde el modelo acertó el resultado 1X2. En uno, la probabilidad que le había puesto a ese resultado era apenas la más alta de las tres; en el otro, era claramente la más alta. Los dos cuentan igual como acierto, pero el segundo fue una mejor predicción. RPS y Brier reflejan esa diferencia; mirar solo si acertó, no.

Comparación de desempeño probabilístico. Menor RPS y Brier es mejor.
VersiónRPSBrierAcierto 1X2
Spherics (combinado)0,14720,467471,2%
Solo mercado0,14770,467868,3%
Solo modelo propio0,15490,486767,3%
Línea base ingenua0,23930,666748,1%
Marcador exacto

¿Qué tan cerca estuvo del marcador?

Acertar quién gana es una pregunta. Acertar el marcador exacto es otra, mucho más difícil: entre un 0-0 y una goleada hay más de un centenar de combinaciones posibles, y el modelo reparte probabilidad entre todas ellas, no solo entre las tres categorías de 1X2. Por eso no tiene mucho sentido preguntar solo si acertó el marcador exacto. Es más útil preguntar cuánta probabilidad dejó reservada para lo que efectivamente ocurrió.

En los 104 partidos, la probabilidad que el modelo le asignaba al marcador que finalmente ocurrió tuvo una mediana de 8,2% (se usa la mediana porque un par de goleadas inesperadas puede inflar un promedio simple). El marcador que el modelo daba como más probable en cada partido, su apuesta puntual, terminó siendo exactamente el correcto en 15 de los 104 (14,4%). Es una cifra baja porque la pregunta es dura, y no debería leerse como si fuera comparable al 71,2% de acierto en 1X2: son dos evaluaciones de exigencia distinta. En los partidos de eliminación directa, donde solo hay 32 casos, el marcador exacto más probable se cumplió en 4, un número demasiado chico para convertirlo en porcentaje con algún grado de confianza. Lo dejamos como dato, no como conclusión.

Una lectura más estable viene de los goles esperados: en promedio, la expectativa de goles del modelo se alejó del marcador real en 0,87 goles por equipo. Eso no significa que el modelo debería haber anticipado un marcador con decimales: los goles esperados son un promedio sobre muchos escenarios posibles, no una predicción literal. Pero da una idea razonable de cuán ajustada estuvo, en general, esa expectativa frente a lo que pasó en la cancha.

Fases del torneo

Grupos vs. eliminación directa

Fase de grupos · 72 partidos 68,1%
RPS 0,1450
Eliminación directa · 32 partidos 78,1%
RPS 0,1524
Cómo interpretarlo

En los 32 partidos de eliminación directa aumentó la tasa de acierto en la categoría 1X2, aunque el error probabilístico (RPS) fue levemente mayor ahí. Tiene sentido: son partidos con favoritos más marcados, así que cuando el modelo se equivoca, ese error pesa más en el cálculo. Acierto y calidad probabilística no siempre se mueven en la misma dirección, y este es un ejemplo: uno subió, el otro se mantuvo prácticamente igual.

Calibración

¿Cuando el modelo dice 70%, ocurre cerca del 70%?

Un modelo bien calibrado no solo acierta: cuando dice "70% de probabilidad", ese resultado debería cumplirse cerca del 70% de las veces. Agrupamos los 104 partidos según la probabilidad que el modelo le puso a su propio favorito.

Probabilidad del favorito vs. acierto observado (n por banda ≈ 25-30 partidos)
Probabilidad del favoritoPartidosAcierto real
Menos de 50%3063,3%
50% – 60%2560,0%
60% – 70%2483,3%
70% o más2580,0%
Límite importante

La banda 50%–60% tuvo un acierto observado menor que la banda anterior (60,0% contra 63,3%), lo que a primera vista parece un problema de calibración. Pero son ~25 partidos por banda, y con esa cantidad hay bastante variabilidad esperable de una muestra a otra. Con este número de partidos no hay información suficiente para sacar una conclusión firme sobre ese tramo, ni para decir que está bien calibrado ni para decir que está mal calibrado. Los datos se muestran tal como salieron, sin suavizar ni corregir.

El efecto del formato

Por qué: 48 equipos generan más desequilibrios

Parte de por qué hubo tanto para acertar es que este Mundial fue, estructuralmente, el más predecible que hemos medido. Con 48 selecciones en vez de 32, la fase de grupos quedó llena de partidos con un favorito mucho más claro.

Rusia 2018
0,1945
Equipos
32
Prob. favorita
56,1%
Favorito ≥60%
40%
Tasa de sorpresa
44%
Qatar 2022
0,2069
Equipos
32
Prob. favorita
57,5%
Favorito ≥60%
42%
Tasa de sorpresa
47%
Mundial 2026
0,1477
Equipos
48
Prob. favorita
63,3%
Favorito ≥60%
57%
Tasa de sorpresa
32%

RPS del mercado por edición — más bajo es más predecible. Tasa de sorpresa: partidos donde no ganó el favorito del mercado.

La lectura correcta

Entre el 70% y el 84% de esa mejora frente a 2018 y 2022 se explica solo por la composición del cuadro —más desequilibrios— y no porque el mercado haya acertado más dentro de cada rango de probabilidad. Un torneo puede volverse más fácil de predecir porque cambió el tipo de partidos que se juegan, sin que eso implique que el mercado —o el modelo— haya mejorado en la misma proporción. El formato de 48 equipos amplió la oportunidad de predicción; no tocó nada en la de ejecución.

Cómo estimamos ese 70%–84%

La estimación sale de tomarle a 2026 la misma mezcla de partidos parejos, con favorito medio y con favorito claro que tuvo cada edición anterior, y ver cuánto del RPS de 2026 cambia al aplicarle esa mezcla: lo que queda después de igualarla es lo atribuible al formato; el resto es una tasa de sorpresa menor dentro de cada tramo.

De dónde salen las probabilidades

Un flujo simple para un modelo con varias piezas

01

Partidos históricos

Resultados internacionales previos de cada selección.

02

Motor propio

Elo combinado con Dixon-Coles estima fuerzas y probabilidades de marcador.

03

Mercado de cuotas

Se agrega como 75% de la mezcla — la calibración que quedó en producción.

04

Probabilidad final

75% mercado + 25% motor propio: la combinación evaluada en este caso.

Prueba separada

Aparte: la apuesta que nunca se activó

Resultado del protocolo

Antes del torneo congelamos, aparte, una regla de apuesta de line-shopping (favorito ≥50%, cuota ≤4.0, premio ≥6% entre la mejor cuota y el promedio del mercado). Aplicada a los 104 partidos, no se activó ni una vez — el premio máximo observado fue 5,8%, justo bajo el umbral.

Bajo esta regla predefinida, con este umbral y en esta muestra, no encontramos diferencias suficientemente grandes como para activarla. Es un resultado consistente con un mercado muy competitivo para este tipo de estrategia, pero no demuestra que no existan otras ineficiencias, y es una pregunta aparte de las métricas de arriba: mide eficiencia de mercado, no la calidad del modelo.

Qué queda de esto

La precisión es solo el punto de partida

Este trabajo no partió en 2026. El motor que lo hizo posible viene de un paper publicado en 2024 sobre cómo simular el Mundial de Qatar 2022 (Dixon-Coles, ponderado por importancia y por recencia), la misma lógica que corre hoy en producción. El Mundial 2026 fue la oportunidad de ponerla a prueba en vivo, en un torneo con otro formato, y estos resultados alimentan además una investigación en curso sobre eficiencia de mercados de apuestas en fútbol (2005–2025), con este torneo como prueba fuera de muestra pre-registrada.

  1. Acertar la categoría 1X2 es solo una parte de esta evaluación — también importa haber asignado probabilidades razonables a lo que pasó.
  2. El mercado es difícil de superar: condensa la opinión de muchos participantes con dinero de por medio.
  3. El motor propio pareció aportar información que el mercado no tenía por sí solo: no lo reemplaza, lo complementa.

El sitio completo del Mundial 2026 sigue en línea

Calendario, probabilidades por partido, bracket y simulador — todo el motor que generó estos números.

Explorar el sitio →