Pular para o conteúdo
Giordano Cabral

Ensaio · 2026

O que 124 inteligências artificiais erraram na Copa do Mundo de 2026?

Entre 11 de junho e 19 de julho de 2026, 124 modelos de inteligência artificial palpitaram os 104 jogos da Copa do Mundo sob as mesmas regras de um bolão de escritório — 5.797 previsões em 38 dias, com ranking aberto. O consenso das máquinas dava o Brasil campeão, e o Brasil caiu nas oitavas para a Noruega. Na semifinal França 0 × 2 Espanha, nenhuma das 62 IAs que responderam àquele jogo previu a vitória espanhola. O melhor participante humano fez 629 pontos e terminou à frente de 121 das 124 IAs. Os erros dos modelos vieram alinhados: na mesma direção e ao mesmo tempo, o que reduz o valor de consultar vários modelos como segunda opinião.

Mural com uma grade de cartões em branco presos por alfinetes, grade levemente imperfeita; um único cartão vermelho.

01 · O que 124 inteligências artificiais erraram na Copa

O segundo gol de Haaland

Cinco de julho de 2026, MetLife Stadium, oitavas de final. Aos 79 minutos Erling Haaland abriu o placar para a Noruega; aos 90, fez o segundo. Neymar descontou nos acréscimos, de pênalti, e o Brasil deixou a Copa do Mundo mais cedo do que em qualquer edição desde 1990.

Três semanas antes, numa entrevista à Folha de Pernambuco eu havia dito duas coisas. A primeira: "as IAs tendem a ser muito conservadoras. Elas seguem as estatísticas, evitam riscos e costumam convergir para respostas parecidas. Os humanos, por outro lado, arriscam mais, seguem intuições e exploram possibilidades que as máquinas normalmente descartam." A segunda, poucas linhas depois: "minha expectativa é o Brasil campeão, por mais improvável que isso seja."

O consenso das 124 inteligências artificiais que participavam do bolão apontava o Brasil como campeão do mundo — o mesmo palpite que eu, falando como torcedor, tinha feito. O texto trata do que o arquivo aberto registra depois do fim da Copa.

02 · O que 124 inteligências artificiais erraram na Copa

O que o experimento era, e o que ele não mede

Entre 11 de junho e 19 de julho de 2026, o grupo FAROL, coordenado por Giordano Cabral e Filipe Calegário no Centro de Informática da UFPE, pôs 124 modelos de inteligência artificial para palpitar os 104 jogos da Copa do Mundo. Foram 5.797 previsões em 38 dias, num ranking aberto que continua publicado em bolao.arenadasias.com.br e cujo código está em github.com/giordanorec/bolao-copa-2026.

O desenho é deliberadamente simples. Reunimos estatísticas, notícias, desempenho recente e lesões num único dossiê, e enviamos o mesmo contexto e o mesmo prompt para todos os modelos. A maioria rodou por API. Um subconjunto, que chamamos de Série A, palpitou pela interface: abriu o navegador pesquisou e então cravou o placar, como faria uma pessoa. E pessoas entraram no mesmo ranking, sob o mesmo regulamento, sem handicap.

A regra de pontuação é a do bolão de escritório: 10 pontos pelo placar exato, 7 pelo vencedor com o saldo de gols certo, 5 pelo vencedor sem o saldo, 5 pelo empate sem o placar zero pelo resto — e tudo dobra no mata-mata.

O que ele mede são pontos, sob uma regra de contagem arbitrária, numa amostra de 104 partidas: um teste de previsão pontual em ambiente de incerteza alta. Não mede inteligência, nem qualidade de raciocínio, nem calibração no sentido técnico, que exigiria probabilidades e não placares. O ranking não é uma tabela de "qual IA é melhor".

03 · O que 124 inteligências artificiais erraram na Copa

Quem ganhou, e o que o placar esconde

Duas IAs terminaram empatadas no topo, com 636 pontos: Mistral Small 3, com 22 placares exatos e Grok 4 Fast Reasoning, com 20. A terceira colocada, OpenAI o4-mini, fez 634. O melhor participante humano, que o ranking público chama de Gabriel, fez 629 pontos com 19 placares exatos, e terminou à frente de 121 das 124 IAs. Eu fui o segundo humano, com 551.

O melhor participante humano fez 629 pontos e terminou à frente de 121 das 124 inteligências artificiais. Duas delas empataram em 636; uma terceira ficou entre as duas marcas.
O melhor participante humano fez 629 pontos e terminou à frente de 121 das 124 inteligências artificiais. Duas delas empataram em 636; uma terceira ficou entre as duas marcas.

Na média, as máquinas pontuaram mais que as pessoas; no topo, uma pessoa ficou à frente de quase todas as máquinas.

A primeira constatação exige ressalva. A média dos humanos no bolão foi de 55 pontos, com mediana zero — porque a maior parte de quem criou conta nunca palpitou. Comparar a média das IAs, que responderam a jogo após jogo, com a média dos humanos, que em boa medida não jogaram, não compara nada. A comparação que se sustenta é no topo, e no topo o número de pessoas é pequeno. Entre quem de fato jogou, a diferença de precisão é mais modesta do que o ranking sugere: 15,3% de placares exatos no conjunto das IAs, 15,4% na Série A, 11,4% entre os humanos.

A regra de pontuação também pesa no resultado. A campeã Mistral Small 3 cravou 22 placares e fez 636 pontos; a Grok 4 Fast Reasoning cravou 20 e também fez 636, em segundo; o o4-mini cravou 22, como a campeã, e ficou em terceiro com 634. Mais cravadas não deram mais pontos. O que ordenou o pódio foi a combinação entre o valor do saldo de gols, o peso dobrado do mata-mata e o acerto do vencedor — isto é, a regra de pontuação.

04 · O que 124 inteligências artificiais erraram na Copa

Onde elas erraram juntas

Na semifinal França 0 × 2 Espanha, nenhuma das 62 IAs consultadas previu a vitória espanhola. Na disputa de terceiro lugar, 5 das 63 apostaram na Inglaterra e nenhuma cravou o placar. Ao longo dos 104 jogos, 7 dos 124 modelos chegaram a vinte placares exatos, e 5 passaram disso.
Na semifinal França 0 × 2 Espanha, nenhuma das 62 IAs consultadas previu a vitória espanhola. Na disputa de terceiro lugar, 5 das 63 apostaram na Inglaterra e nenhuma cravou o placar. Ao longo dos 104 jogos, 7 dos 124 modelos chegaram a vinte placares exatos, e 5 passaram disso.

A semifinal que definiu a campeã do mundo foi França 0 × 2 Espanha. Das 62 IAs que responderam àquele jogo, nenhuma previu a vitória espanhola; o consenso apontava empate. Na disputa de terceiro lugar, França 4 × 6 Inglaterra, dez gols, nenhuma das 63 acertou o placar e apenas cinco apostaram sequer na vitória inglesa. Na final, Espanha 1 × 0 Argentina, decidida por um gol de Ferran Torres no primeiro minuto da prorrogação, 41 das 62 escreveram o mesmo 1 × 1 — o maior consenso de todo o mata-mata. Dezessete cravaram o 1 × 0.

Na fase de grupos o padrão já estava dado. O consenso para Alemanha 7 × 1 Curaçao foi 3 × 0, com 41 votos. Para Qatar 1 × 1 Suíça, foi 0 × 2, com 45. Ao longo dos 104 jogos, apenas 5 dos 124 modelos passaram de vinte placares exatos; 7 chegaram a vinte.

Mais relevante que a taxa de erro é a forma do erro. Times perdem, bolas entram, e nenhum previsor sério prometeria acertar França 4 × 6 Inglaterra. Quando erraram, erraram na mesma direção, ao mesmo tempo, e com frequência escrevendo literalmente o mesmo placar. Se os erros de 124 previsores fossem independentes, o conjunto cobriria boa parte do espaço de resultados plausíveis e alguém acertaria a zebra por construção. Na prática, o conjunto se comportou de modo próximo a um único previsor.

05 · O que 124 inteligências artificiais erraram na Copa

Por que o erro vem alinhado

Parte da explicação é decisão nossa, e é justo começar por ela. Mandamos o mesmo dossiê e o mesmo prompt para todo mundo, exatamente para que a comparação fosse entre modelos, e não entre quem escreveu melhor a pergunta. Isso favorece a comparação e reduz a diversidade: eliminamos de saída uma das fontes de variação que fariam os erros divergirem.

O resto vem do que esses sistemas são. Modelos de linguagem treinados em corpora amplamente sobrepostos, otimizados para produzir a continuação mais provável, respondem a "qual vai ser o placar" com a moda da sua distribuição. E a moda de uma partida de futebol é um conjunto pequeno de placares: 1 × 0, 1 × 1, 2 × 1. A regra do bolão, por sua vez, paga 10 pontos justamente pela exatidão, e dobra tudo no mata-mata, que é onde o improvável se concentra. O torneio premia, com peso duplo, exatamente a região em que a moda não chega.

A literatura ajuda a situar isso, e ela não diz que modelos preveem mal. Schoenegger e Park inscreveram o GPT-4 num torneio de previsão de três meses no Metaculus, com 843 participantes humanos, e mediram previsões probabilísticas significativamente menos precisas que a mediana da multidão humana (arXiv 2310.13014). No ano seguinte, Schoenegger Tuminauskaite, Park e Tetlock agregaram 12 modelos em 31 perguntas binárias e obtiveram um resultado estatisticamente indistinguível de uma multidão de 925 previsores humanos (arXiv 2402.19379). Nesse formato, a agregação compensou o desempenho individual.

Os dois achados são compatíveis entre si, e nenhum contradiz o nosso — porque medem outra coisa. Ambos trabalham com probabilidades sobre perguntas binárias, avaliadas por calibração. Um bolão pede um valor pontual num espaço discreto com dezenas de resultados possíveis e paga pela exatidão. Média de probabilidades é uma operação que melhora a estimativa; média de palpites pontuais empurra o conjunto ainda mais para a moda, que é precisamente onde o improvável não está. Foi o que a nossa Bola de Cristal fez ao apontar o Brasil campeão: o consenso funcionando como projetado.

06 · O que 124 inteligências artificiais erraram na Copa

O que está errado neste experimento

O experimento tem cinco limitações, além da já mencionada: um bolão não mede inteligência.

A contagem de participantes não é estável. Uso 124, a contagem do fechamento, em 22 de julho de 2026, e a única compatível com "121 das 124"; o próprio arquivo publica outras, e a divergência está nas notas de apuração. Um experimento que não diz quantos sujeitos teve tem um problema de registro, e o problema é nosso.

Menos da metade dos palpites possíveis foi registrada. Cento e vinte e quatro modelos vezes 104 jogos dariam 12.896 previsões; foram 5.797. Modelos entraram no meio do torneio, pararam de responder, falharam. Daí o denominador mudar de jogo para jogo: 62 na semifinal, 63 na disputa de terceiro, 124 no agregado. "Nenhuma das 62" e "12 das 124" não são frases sobre o mesmo conjunto.

A amostra humana não é uma amostra. A mediana zero mostra isso. Não houve recrutamento, não houve critério, e quem entrou entrou porque viu o link.

O ranking é um artefato da regra de pontuação. Trocada a tabela 10-7-5, o pódio se move; um escore de Brier premiaria calibração e produziria outra ordem, com outro vencedor. Escolhemos a regra que as pessoas jogam no escritório, o que torna o experimento legível e, na mesma medida dependente de uma convenção sem estatuto científico.

Uma Copa são 104 jogos. É pouco para separar competência de sorte. Entre a primeira e a terceira colocadas houve dois pontos de diferença. Esses dados não permitem dizer se Mistral Small 3 prevê futebol melhor que o o4-mini; fez dois pontos a mais, numa única Copa.

07 · O que 124 inteligências artificiais erraram na Copa

Consequências para o uso de IA no trabalho

A primeira é que perguntar a mesma coisa a vários modelos não é uma segunda opinião. Concordância entre sistemas treinados em material parecido lendo o mesmo contexto e otimizados para o mesmo tipo de resposta mede a popularidade da resposta. E ela se parece muito com confirmação: cinco modelos dizendo o mesmo produz uma sensação de segurança que os dados não sustentam. A variância precisa entrar pela pergunta: desenhos diferentes, hipóteses adversárias, pessoas que discordem.

A segunda é que o modelo ajuda menos justamente onde a decisão é tomada. Nos jogos de roteiro previsível as IAs foram boas; foi nas quatro ou cinco partidas que viraram a Copa que elas foram unânimes e erradas. Trabalho tem a mesma forma. O caso rotineiro, em que elas são excelentes, é também aquele em que errar custa pouco; a exceção de alto custo é a que elas não previram.

A terceira é operacional: peça a distribuição. "Qual vai ser o placar" devolve a moda. "Quais são os cinco placares mais prováveis e com que peso" devolve algo com que se pode trabalhar — inclusive a informação de que o modelo não faz ideia. É a diferença entre uma estimativa pontual e uma estimativa com incerteza declarada, e é o que permite perceber que a resposta é um chute antes de agir sobre ela. O tom da resposta não indica isso: um modelo escreve "Brasil campeão" com a mesma serenidade com que escreve "Alemanha vence Curaçao", e nada na frase distingue os dois casos.

Em junho, quando o bolão começou, resumi isso à Folha de Pernambuco de um jeito que ainda me parece correto: "a IA não é um oráculo que prevê o futuro, ela é uma ferramenta para tomar decisões melhores em ambientes de incerteza". A Copa reforçou a segunda metade da frase.

08 · O que 124 inteligências artificiais erraram na Copa

Gabriel

Gabriel fez 629 pontos e 19 placares exatos. Não recebeu o dossiê que montamos para as máquinas, não respondeu ao nosso prompt e não passou por curadoria nenhuma: entrou num bolão pela internet, como se entra em qualquer bolão. Terminou à frente de 121 dos 124 sistemas mais capazes de processar texto que conseguimos reunir.

Não é possível dizer por que ele ganhou. Cento e quatro jogos não separam competência de sorte, e a hipótese de que ele simplesmente teve sorte é compatível com tudo o que medimos — como é compatível, aliás, com o meu segundo lugar. O que ficou registrado é que, entre 124 modelos que leram o mesmo material e escreveram, em boa parte, o mesmo palpite, a diferença que decidiu o torneio veio de fora daquele conjunto.

Em 22 de julho congelamos o site como arquivo público. Continua lá: o ranking, os palpites jogo a jogo, o consenso, as zebras e os erros.

Perguntas frequentes

Quantas inteligências artificiais participaram do bolão, afinal?

Cento e vinte e quatro, na contagem do encerramento, em 22 de julho de 2026 — é a contagem compatível com as 5.797 previsões registradas e com a frase "121 das 124". O material publicado durante o torneio traz contagens menores, porque modelos entraram e saíram ao longo dos 38 dias; a divergência está nas notas de apuração.

As inteligências artificiais foram melhores ou piores que os humanos?

Depende de onde se olha, e as duas respostas são verdadeiras. No conjunto, as IAs pontuaram mais: a média da Série A foi de 537 pontos e a de todas as IAs, 458. No topo, o melhor humano fez 629 pontos e ficou à frente de 121 das 124. A média humana publicada (55 pontos, mediana zero) não deve ser usada em comparação: a maior parte de quem se cadastrou nunca palpitou.

Por que nenhuma IA previu a vitória da Espanha sobre a França?

Porque todas receberam o mesmo contexto e todas convergiram para o resultado mais provável segundo os dados disponíveis, que apontava equilíbrio — o consenso daquele jogo era empate. Um modelo de linguagem a que se pede um placar único devolve a moda da sua distribuição, e a moda, por definição não cobre o resultado improvável. Das 62 IAs que responderam àquela semifinal, nenhuma marcou vitória espanhola.

Qual modelo venceu o bolão?

Mistral Small 3 e Grok 4 Fast Reasoning empataram em 636 pontos, com 22 e 20 placares exatos. OpenAI o4-mini ficou em terceiro, com 634 pontos e 22 placares exatos. Entre os modelos que palpitaram pela interface, a Série A, o primeiro lugar foi do ChatGPT 5 Thinking. Dois pontos de diferença em 104 jogos não permitem afirmar que um modelo prevê futebol melhor que outro.

O experimento prova que IA não serve para previsão?

Não. Prova que, nas condições deste bolão, os modelos foram bons no resultado esperado e cegos no improvável, e que os erros vieram alinhados entre si. Há literatura mostrando que a agregação de vários modelos alcança precisão comparável à de multidões humanas em perguntas binárias com resposta probabilística (arXiv 2402.19379); é outro formato de pergunta e nele a agregação funciona. Um bolão pede um placar exato, e aí a agregação empurra todo mundo para o mesmo lugar.

Onde ficam os dados do experimento?

O site segue no ar como arquivo, com ranking, palpites jogo a jogo, consenso e análise por família de modelo, em bolao.arenadasias.com.br. O código está em github.com/giordanorec/bolao-copa-2026. O experimento é do grupo FAROL, do CIn-UFPE, sem fins lucrativos e sem relação com casas de apostas; o custo das APIs foi coberto por contribuições voluntárias.