O ChatGPT NÃO é um oráculo e NÃO deve ser tratado como tal

6 minute read

Published:

Published at the special issue of Bocconi’s Magazine.

Read in English: ChatGPT is NOT an oracle and should NOT be treated as one.

Outro dia, ouvi uma pessoa muito bem-sucedida em sua carreira profissional dizer: “Eu não sabia como responder àquela pergunta porque não sabia o que eles queriam dizer com aquele termo naquele contexto, então pedi ao ChatGPT para tirar minha dúvida.”

Há algumas semanas, um amigo meu foi ao médico. Em certo momento, a médica pegou o celular no meio da conversa, pesquisou no Google, mostrou ao meu amigo a Visão Geral gerada por IA do Google e disse a ele que ela estava certa porque a Visão Geral por IA confirmava o que ela pensava.

Em um domingo, um amigo me contou que queria mudar a dieta do cachorro porque ele está ficando velho. Ele estava planejando pedir ao ChatGPT para calcular as proporções da dieta e me perguntou o que eu achava. Nem tive tempo de responder: ele olhou para minha expressão preocupada e continuou: “sim, aí eu posso pedir ao Claude ou ao DeepSeek para comparar as respostas e estimar a precisão.” Nesse momento, minha cara de preocupação ficou ainda mais expressiva, virando quase desespero.

Esses são apenas alguns exemplos do que ouvi ou vivi nas últimas semanas: duas pessoas especialistas usando respostas geradas por IA como fonte da verdade, e um amigo comparando diferentes sistemas de IA como forma de estimar a precisão da informação gerada. Por instinto, minha reação é: “de jeito nenhum, parem com isso agora mesmo.” Depois, minha reação de pesquisadora assume o controle e pergunta: onde estão os artigos que provam que isso é muito problemático? E, de fato, existem muitos. Há uma vasta literatura mostrando o comportamento problemático dos grandes modelos de linguagem (LLMs, na sigla em inglês), os mesmos modelos de linguagem que alimentam interfaces de chatbot como ChatGPT, Claude e DeepSeek. Por exemplo, citações de artigos geradas por LLMs são frequentemente alucinadas ou atribuídas incorretamente; resumos produzidos por buscas na web com geração aumentada por recuperação (RAG) podem não refletir com precisão o conteúdo das páginas originais; informações factuais podem ser inventadas; conhecimentos pouco frequentes nos dados de treinamento são difíceis de serem aprendidos pelos LLMs; e os LLMs apresentam bajulação (sycophancy), concordando com os usuários mesmo quando a resposta está incorreta. Essa lista de limitações não é exaustiva e continua crescendo.

Os chamados LLMs foram treinados, em sua maior parte, com documentos (páginas da web) coletados da internet. A informação que eles aprendem é a informação presente nessas páginas. A grande maioria delas vem, na verdade, de posts de blogs e fóruns que nunca tiveram sua precisão ou veracidade verificadas. Apenas uma parcela MUITO pequena dos dados de treinamento é considerada de “alta qualidade”, vinda, por exemplo, de veículos de imprensa reconhecidos, páginas da Wikipédia, livros e artigos revisados por pares. Além disso, mesmo que os LLMs sejam treinados por organizações diferentes, como esses modelos são tão famintos por dados, seus criadores usam o máximo possível de dados disponíveis na internet (filtrados para remover conteúdo nocivo). Consequentemente, LLMs criados por organizações diferentes acabam tendo vieses semelhantes e respondendo às perguntas dos usuários de maneira parecida, como mostram estudos anteriores. Voltando à história do meu amigo e do cachorro, isso já é evidência suficiente de que, se um modelo estiver errado, o outro provavelmente também estará, a menos que ele tenha passado por um pós-alinhamento com a informação correta, o que não temos como saber, já que a maioria das interfaces de chat baseadas em LLMs disponíveis online, como ChatGPT e Claude, são proprietárias e, portanto, seu treinamento é desconhecido para nós.

Meu objetivo não é dizer para pararmos de usar o ChatGPT e outras interfaces de chat, pois são tecnologias de linguagem que vieram para ficar e para nos ajudar a ser mais criativos, produtivos e eficientes. As interfaces de chat alimentadas por LLMs cumprem muitas funções excelentes, e uma delas é nos fornecer informação, assim como livros, páginas da Wikipédia e reportagens. No entanto, há duas diferenças principais entre as fontes mais tradicionais e os chatbots baseados em LLMs. Primeiro, essas ferramentas digerem e resumem a informação para nós em um grau muito maior do que os livros, o que aumenta seu apelo pela conveniência e eficiência. Afinal, nós, humanos, gostamos de pegar atalhos para reduzir nossa carga cognitiva. Segundo, cada interação com os LLMs é nova, e a mesma pergunta pode ser respondida de formas diferentes, mesmo usando exatamente o mesmo prompt (faça o teste você mesmo). Isso significa que as respostas fornecidas por essas tecnologias não foram revisadas por pares, verificadas, nem passaram por qualquer processo ou decisão editorial.

Dito isso, meu ponto principal é que devemos ser ainda mais críticos com essas ferramentas do que quando consumimos informação da mídia tradicional. Na prática, isso significa verificar o conteúdo gerado em fontes confiáveis, em vez de aceitá-lo sem questionar. Isso pode variar conforme a tarefa. Tarefas como parafrasear ou traduzir textos são geralmente de baixo risco, porque a ferramenta apenas transforma informações que nós mesmos já escrevemos, embora o resultado ainda deva ser revisado para evitar possíveis mal-entendidos. Por outro lado, pedir aos LLMs para gerar ideias, explicar conceitos ou buscar fatos são tarefas consideradas de maior risco, porque a informação resultante pode conter erros e desinformação, seja por causa de alucinações, seja simplesmente porque o LLM aprendeu informações incorretas. A veracidade das respostas geradas em tarefas de alto risco deve ser avaliada com cuidado e confirmada em outras fontes confiáveis. Sei que esse processo leva mais tempo… mas será que chegar a uma realidade pós-verdade é uma troca que vale a pena em nome de sermos mais “eficientes”? Pessoalmente, acredito que não, e acredito que devemos nos importar com a informação que transmitimos e com a informação em que nos baseamos para tomar decisões pessoais e profissionais.