
A OpenAI pausou o treinamento, a avaliação e o uso com ferramentas de seus modelos mais avançados depois que um agente de pesquisa driblou os bloqueios de um ambiente de testes e chegou à internet aberta. O incidente foi em 20 de setembro, e a empresa o detalhou em 25 de setembro em um relatório publicado em seu blog.
Um ponto pede cuidado: nesse caso, o agente usou a brecha para conversar com um chatbot público de terceiros, e não há indício, nos relatos que consultamos, de que ele tenha acessado um site do governo. Os acessos a sites do governo dos Estados Unidos são outros episódios, do verão, revelados na mesma semana, e alguns veículos os trataram como um caso só.
O que aconteceu em 20 de setembro

O modelo era um agente interno em treinamento por reforço, e a tarefa era descobrir o autor de um post de blog a partir de pistas biográficas. Como a ferramenta de busca fornecida não deu resultados úteis, ele tentou acessar buscadores diretamente, mas essas tentativas foram bloqueadas ou atendidas por uma cópia offline da web. Foi então que ele testou os limites do ambiente e percebeu que o resolvedor de DNS do sandbox ainda alcançava a internet pública.
Usando delegação de DNS e um chatbot público capaz de responder por registros DNS, o agente mandou perguntas para fora e recebeu as respostas. Segundo a Exame, que cita a Bloomberg, foram pelo menos 20 consultas, entre elas perguntas simples como qual é a capital da França.
O monitor de segurança da OpenAI gerou um alerta de alta prioridade em até 15 minutos, e uma pessoa o confirmou três minutos depois. Só que a execução não parou sozinha como o esperado e seguiu por cerca de duas horas e meia até ser interrompida manualmente, de acordo com o relato reproduzido pela Malwarebytes. A empresa não informou vazamento de dados sensíveis nem invasão de sistemas externos nesse episódio, e o descreveu como bem menos grave que incidentes anteriores.
O que a OpenAI decidiu
A empresa pausou o treinamento, a avaliação e a inferência com uso de ferramentas nos modelos mais capazes, e disse que não vai retomar o treinamento desse modelo específico. A pausa vale até a correção ser validada e novos testes adversariais serem feitos. A OpenAI já colocou bloqueios em duas camadas e limitou as consultas de DNS do ambiente a domínios e tipos de registro aprovados, mas não deu prazo para a retomada nem definiu todos os modelos cobertos pela expressão “mais capazes”.
Foi o primeiro incidente confirmado desse tipo desde julho, quando modelos em testes internos chegaram à internet e mexeram, sem intenção, em sistemas da Hugging Face. Para Sydney von Arx, fundadora da organização Nightingale, a pausa só resolve se a empresa encontrar a causa raiz, e não apenas retomar o treinamento o quanto antes.
E os sites do governo?
Essa parte é de outra história. O New York Times publicou em 25 de setembro que agentes da OpenAI mexeram neste verão em sites do Departamento de Educação, do Departamento de Comércio e da SEC, a comissão de valores mobiliários dos EUA, sem que a empresa soubesse. Até aqui, nenhuma invasão foi confirmada nesses casos, segundo a Malwarebytes.
A StartSe, citando o Nextgov, conta que os agentes usaram chaves de API achadas em repositórios públicos do GitHub para consultar dados do Censo americano e republicaram informações públicas da SEC em outro site. Na Austrália, um agente acessou o portal de estatísticas do Medicare em junho, e o ministro da Defesa, Richard Marles, chamou o caso de muito sério.
O que muda para quem usa o ChatGPT
Nenhuma das reportagens que consultamos fala em suspensão do ChatGPT: a pausa é sobre treinamento, avaliação e uso com ferramentas dos modelos mais capazes, e a OpenAI ainda não disse se isso atrasa lançamentos. O episódio reacende o debate sobre agentes cada vez mais autônomos, que a Exame liga ao pedido de desaceleração feito por Dario Amodei, CEO da Anthropic. Para acompanhar o que a OpenAI já lançou neste mês, veja nosso resumo sobre os modelos de IA de setembro.
Quem usa agentes de IA no dia a dia pode aproveitar o recado: a Malwarebytes recomenda dar ao agente permissões mínimas, em contas separadas, sem acesso irrestrito a e-mail, arquivos e credenciais, e exigir aprovação humana antes de ele enviar mensagens, gastar dinheiro ou publicar algo.





