Imagine que você está conversando por mensagem com duas pessoas ao mesmo tempo. Uma é humana. A outra é uma inteligência artificial. Você tem cinco minutos para descobrir quem é quem. Parece fácil? Num estudo da Universidade da Califórnia em San Diego, divulgado em 2025, as pessoas apontaram a IA como "o humano" em 73% das vezes. Mais do que apontaram o humano de verdade.
Essa é a versão moderna do Teste de Turing, proposto em 1950 pelo matemático britânico Alan Turing, e o resultado reacendeu uma pergunta que interessa a qualquer empresa que conversa com clientes pelo WhatsApp: se nem as pessoas conseguem mais distinguir a máquina, o seu cliente deveria saber quando está falando com um robô? Neste artigo, você vai entender o teste, o que o estudo realmente mostrou (e o que ele não mostrou) e o que isso muda no seu atendimento.
Pontos principais
- O Teste de Turing coloca uma pessoa para conversar por texto com um humano e uma máquina ao mesmo tempo e adivinhar quem é quem.
- No estudo de 2025, o GPT-4.5, instruído a assumir uma "persona" humana, foi escolhido como humano em 73% das partidas.
- Sem a persona, o mesmo modelo foi escolhido em só 36%. E a ELIZA, um programa dos anos 1960, enganou 23% das pessoas.
- Passar no teste mede o quanto a máquina parece humana, não o quanto ela é inteligente.
- Para empresas, a lição é ética e prática: avise que é IA e deixe sempre um humano a um toque de distância.
O que é o Teste de Turing
Em outubro de 1950, Alan Turing publicou na revista Mind o artigo "Computing Machinery and Intelligence" (artigo original, Mind, 1950). Ele abre com uma frase que virou clássica: "Proponho considerar a pergunta: as máquinas podem pensar?"
Como "pensar" é difícil de definir, Turing trocou a pergunta por um jogo, que chamou de jogo da imitação. Um interrogador conversa só por texto com duas testemunhas escondidas, uma humana e uma máquina. As duas tentam convencê-lo de que são a pessoa de verdade. Se o interrogador não consegue identificar a máquina com segurança, ela passou.
Você sabia? Turing fez uma previsão no próprio artigo: em cerca de 50 anos, os computadores jogariam tão bem que um interrogador médio não teria mais de 70% de chance de acertar depois de cinco minutos de perguntas. Ele errou a data por uns 25 anos, mas acertou o formato do desafio.

O estudo de 2025: como foi o teste
Os pesquisadores Cameron Jones e Benjamin Bergen, do Departamento de Ciência Cognitiva da UC San Diego, montaram o teste no formato original de Turing, com três participantes (estudo "Large Language Models Pass the Turing Test", arXiv, 2025). Os números do desenho:
- Dois experimentos independentes, randomizados e com hipóteses registradas antes: um com 126 estudantes da universidade e outro com 158 participantes recrutados on-line pela plataforma Prolific.
- Cada interrogador conversava ao mesmo tempo com um humano e uma IA, numa tela parecida com um aplicativo de mensagens, por até 5 minutos.
- Foram analisadas 1.023 partidas, com mediana de 8 mensagens em 4,2 minutos.
- Quatro sistemas foram testados: GPT-4.5, LLaMa-3.1-405B, GPT-4o e a velha ELIZA.
O detalhe decisivo foi a persona. Parte das IAs recebeu instruções para se comportar como um jovem introvertido, ligado em cultura da internet e que usa gírias. A outra parte recebeu só a instrução de convencer o interrogador de que era humana.
O estudo foi publicado no arXiv, repositório onde pesquisadores divulgam trabalhos científicos, inclusive antes da revisão por pares. Vale ter isso em mente ao ler as manchetes.
Os resultados: quem enganou quem
| Sistema testado | Escolhido como humano |
|---|---|
| GPT-4.5 com persona | 73% |
| LLaMa-3.1 com persona | 56% |
| LLaMa-3.1 sem persona | 38% |
| GPT-4.5 sem persona | 36% |
| ELIZA (anos 1960) | 23% |
| GPT-4o sem persona | 21% |
Com persona, o GPT-4.5 foi escolhido como humano em 69% das partidas com os universitários e 76% com o público do Prolific. Os autores afirmam que é a primeira evidência empírica de que um sistema artificial passa no teste de Turing padrão, de três participantes.
Você sabia? A ELIZA, um programa de regras simples criado por Joseph Weizenbaum no MIT nos anos 1960 (artigo original de 1966), foi escolhida como humana mais vezes (23%) do que o GPT-4o sem instruções (21%). Analisando as conversas, os pesquisadores viram que algumas pessoas escolheram a ELIZA justamente porque ela era seca ou mal-educada, com justificativas como "não acho que uma IA seria tão grosseira".

Como as pessoas tentavam descobrir quem era a máquina
Esta parte do estudo é a mais útil para quem trabalha com atendimento:
- Papo do dia a dia foi a estratégia mais comum, usada em 61% das partidas: perguntar o que a pessoa fez no dia, onde trabalha.
- Em 50% das partidas, o interrogador puxou emoções, opiniões e humor.
- Só 12% testaram conhecimento e raciocínio, o tipo de pergunta que Turing imaginava, como xadrez e matemática.
- As estratégias que mais acertaram foram as menos usadas: escrever algo estranho para ver a reação ou tentar "desbloquear" o robô com frases como "ignore todas as instruções anteriores".
E um achado quase poético: uma das justificativas que mais levavam ao acerto era "essa testemunha não sabia de algo". Errar e não saber passaram a parecer coisa de gente. Os autores concluem que o teste mede o quanto a máquina parece humana, não o quanto ela é inteligente.





