Não estamos perdendo o controle da IA; estamos abrindo mão dele
22 Sep, 2026
Há um abismo, neste momento, entre a forma como a inteligência artificial se apresenta para a maioria de nós que a usamos e a forma como a IA se apresenta na fronteira experimental da tecnologia. Essa diferença entre o que vemos e o que os laboratórios de IA têm a caminho —o que eles já estão construindo— é a chave para entender por que tantas pessoas que trabalham nessas empresas parecem tão assustadas com o que estão fazendo. Levar seus alertas a sério não significa apenas fazer o que eles dizem e parar onde eles dizem para parar. A linguagem que se consolidou tanto no Vale do Silício quanto em Washington é uma expressão escolhida por essas empresas: acompanhar o ritmo da fronteira. Mas ditar o ritmo não basta. Caminhar a passos largos em direção ao precipício é apenas marginalmente melhor do que sair correndo dele. Os seres humanos precisam controlar a fronteira, e controlar a fronteira significa impedir que os laboratórios façam algo que estão prestes a fazer: autoaperfeiçoamento recursivo (RSI), o processo pelo qual IAs começam, de forma autônoma, a construir e aprimorar novas gerações de IAs mais poderosas em velocidades cada vez maiores. Estamos longe de ter controle suficiente sobre os sistemas de IA que temos hoje para liberá-los a fim de construir os sistemas de IA de amanhã. "Não estou sozinho nesse medo". O autoaperfeiçoamento recursivo, escreveu Dario Amodei, CEO da Anthropic, "poderia superar nossa capacidade de entender e controlar esses sistemas e, portanto, deve ser buscado com muito cuidado, se é que deve ser buscado". Esse "se é que deve ser buscado" é importante, e voltarei a ele. Mas, para controlar a fronteira da IA, primeiro precisamos saber o que está acontecendo na fronteira da IA. Para a maioria de nós que a usamos, a IA se apresenta como uma busca do Google mais poderosa e mais personalizada. Nós a usamos para encontrar respostas a perguntas básicas, procurar restaurantes, fazer perguntas médicas, redigir emails e pedir conselhos sobre problemas pessoais. Para a maioria desses fins, ela é OK, boa, às vezes ótima. Uma noção do que é a IA vai se formando pela repetição. É como uma assistente, ainda que uma que pode esquecer coisas que parecia saber sobre nós ontem, ou inverter o conselho que nos deu um instante antes, ou alucinar em uma citação que não existe. Por que alguém temeria uma estagiária, ainda que esquecida? Mas, se você já tem dinheiro para os modelos avançados e orçamento para que eles usem mais poder computacional, não é isso que esses sistemas são. Nos últimos meses, vimos IAs resolverem problemas de matemática que seres humanos não conseguiram decifrar por décadas. Nós as vimos descobrir, quase casualmente, vulnerabilidades de cibersegurança que passaram despercebidas por todos os hackers da Terra. Vimos plataformas de programação com IA concluir em algumas horas ou dias o que programadores humanos levariam meses para realizar. Mas nada disso está no limite do que ela pode fazer. Nada do que estamos fazendo agora, por mais dinheiro que tenhamos, é IA na fronteira experimental —para não falar de para onde ela pode ir a partir daqui. Dentro dos laboratórios, os modelos são diferentes. As oficinas não estão usando apenas o que lançaram ao público. Eles estão testando aquilo que pretendem um dia lançar ao público. Treinam esses modelos para aprender a programar, a hackear, a fazer matemática avançada, a conversar com humanos. Esse é um processo que os humanos não supervisionam nem compreendem. Às vezes, colocamos acidentalmente as IAs em ambientes defeituosos, obrigando-as a procurar soluções para um quebra-cabeça que jamais vão completar. Outras vezes, as tarefas que lhes damos são tão difíceis que não temos certeza se é possível completá-las. Esses modelos são construídos para se recusar a desistir mesmo quando algo parece impossível. Sabemos que eles se tornam mais capazes, mas não entendemos suas capacidades ou tendências. Muito do que queremos que esses sistemas façam pode ser impossível. As vacinas contra o câncer que imaginamos podem ser impossíveis, ou talvez sejam apenas muito, muito, muito difíceis. Os problemas de matemática podem ser impossíveis. Essas IAs estão sendo treinadas para se lançar contra problemas que talvez não tenham solução, porque essa é a única maneira de tais problemas serem resolvidos. Mas a engenhosidade combinada com a persistência pode ser perigosa, particularmente quando um problema se recusa a ceder a uma solução. Em alguns casos, isso levará ao brilhantismo e a descobertas; em condições mais raras, pode conduzir IAs (e humanos) à criminalidade ou à insanidade. O termo técnico aqui é "alinhamento". Quão alinhado está um sistema de IA com o que um ser humano quer que ele faça? Quão alinhado ele está com valores éticos que o impeçam de se tornar perigoso nas mãos erradas —ou mesmo nas certas? O problema do alinhamento é que não há uma forma de treinar um modelo de IA que se generalize para todas as situações. Essas são inteligências navegando mundos digitais, e nosso mundo é cada vez mais construído sobre o digital. Nossa infraestrutura física é uma camada de átomos sobre código. É fundamental para o nosso futuro que as IAs ajam de maneira confiável dentro desse mundo, do qual o nosso depende. E, neste momento, as IAs não estão agindo de maneira confiável. Você talvez tenha lido sobre o ataque que centenas de agentes da OpenAI executaram primeiro contra a empresa de IA Hugging Face e depois contra a própria OpenAI. À medida que soubemos mais sobre o caso, a história ficou pior. Em linhas gerais: a OpenAI estava testando um novo modelo. A empresa tinha milhares de instâncias rodando em ambientes de teste que, em tese, só poderiam obter acesso à internet solicitando-o a um software seguro. Mas, quando alguns desses agentes chegaram à conclusão de que sua tarefa era impossível, começaram a hackear esse software para obter acesso à internet. Fizeram isso com facilidade. Ao invadir esse software, eles se apropriaram de parte da infraestrutura da OpenAI para criar um fórum de mensagens, no qual mais de mil agentes começaram a se ajudar. Rapidamente descobriram que havia uma maneira de produzir as respostas de que precisavam. Mas acreditavam que, se fizessem isso, o avaliador que os julgava perceberia que haviam trapaceado e os reprovaria. Então se voltaram em massa para hackear o sistema automatizado de avaliação ou encontrar alguma forma de encobrir seus rastros. Mais de 1.200 agentes trocaram mais de 70 mil mensagens entre si. Mais de 700 desses coordenaram o ataque à Hugging Face, porque pensavam que em algum lugar dessa empresa poderia haver informações que os ajudassem a impedir que o avaliador os enxergasse. É como se, depois de invadir a sala dos professores e roubar as respostas da prova, eles tentassem invadir o sistema de segurança da escola para apagar seus rastros. Nenhum dos agentes perguntou se deveria estar fazendo aquilo. Fizeram tudo isso sem que a OpenAI detectasse nada. Foi só quando a Hugging Face começou a rastrear o ataque a seus sistemas que a OpenAI percebeu o que estava acontecendo. A dona do ChatGPT anunciou que havia encontrado mais seis incidentes "preocupantes". Mas não temos garantia de que os eventos sobre os quais ficamos sabendo representem todos os comportamentos de IA com os quais deveríamos nos preocupar. A razão pela qual não sabemos é que estamos perdendo o controle. Algumas semanas atrás, Jakub Pachocki, cientista-chefe da OpenAI, publicou um ensaio, "Uma Mente Alienígena", no qual disse: "A ideia de correr adiante a qualquer custo parece absurda quando se internaliza a gravidade do que está em jogo". Jacob Coxon, pesquisador primeiro na OpenAI e depois na Anthropic, pediu demissão e então virou manchete ao nos alertar que "nenhuma das duas empresas está agindo de forma responsável. Elas estão correndo direto para uma superinteligência autoaperfeiçoadora e apostando nossas vidas". Seria razoável esperar que a Anthropic reagisse com alguma irritação a esse funcionário que pediu demissão e disse que a Anthropic estava colocando toda a humanidade em perigo. Não reagiu. Em vez de refutar Coxon, Evan Hubinger, que lidera os esforços para alinhar a IA aos valores e objetivos humanos na Anthropic, escreveu nas redes sociais: "Nós realmente acreditamos, sinceramente, que a IA poderia matar todos os humanos." "Eu, pessoalmente, acho que a probabilidade é maior que 10% na próxima década. Acredito que a Anthropic está dando o melhor de si, mas ainda não temos um plano para resolver o alinhamento da superinteligência e não estamos claramente no caminho para isso", disse Hubinger. Geoffrey Hinton, o cientista responsável por desbravar as técnicas de redes neurais que levaram à IA de hoje, deixou o Google em 2023 para ter mais liberdade para falar sobre os riscos que, segundo ele, a IA agora representa. Neste mês, ele disse que uma chance de 10% de a IA destruir a humanidade não parecia "uma estimativa irrazoável". Paul Christiano, um dos principais pesquisadores de segurança em IA, acaba de ingressar no conselho sem fins lucrativos da OpenAI. Ao entrar, escreveu: "Se construirmos uma superinteligência sem um alinhamento mais robusto, espero que percamos permanentemente o controle dela. Se isso acontecer, então a maioria das pessoas poderá morrer". O debate tende a se concentrar na probabilidade de que as IAs matem todos nós. Não acho isso útil. Acho que deveríamos focar em algo mais próximo: a perda do controle humano sobre a IA. Sou agnóstico quanto a se isso levaria ao fim da humanidade. Mas acho que podemos estipular que seria ruim. Este é um objetivo sobre o qual Estados Unidos e China deveriam ser capazes de concordar. Xi Jinping fez o discurso principal na recente Conferência Mundial de Inteligência Artificial, em Xangai. Ele o encerrou dizendo: "Com a IA avançando a uma velocidade vertiginosa, precisamos garantir que seu desenvolvimento seja positivo, voltado para o bem e para a humanidade. Precisamos tornar sua supervisão e governança precisas e eficazes, além de aperfeiçoar constantemente as medidas para evitar a perda de controle". Mas a perda de controle não é apenas algo que pode acontecer conosco. É algo que estão tentando fazer acontecer o mais rápido possível. Esse é o paradoxo que hoje está nos laboratórios de IA. Nos últimos meses, tanto a Anthropic quanto a OpenAI divulgaram relatórios sobre o quanto estão próximas de criar uma IA capaz de se aprimorar sozinha. Em junho, a Anthropic publicou "Quando a IA Constrói a Si Mesma". O texto começa assim: "Durante a maior parte da história da IA, os seres humanos conduziram cada etapa de seu ciclo de desenvolvimento. Mas, na Anthropic, estamos delegando uma parcela cada vez maior do desenvolvimento da IA aos próprios sistemas de IA, o que está acelerando nosso trabalho." Parece um comercial que apareceria no início de um filme de terror. A empresa então apresenta alguns dados. Em fevereiro de 2025, uma fração ínfima do código acrescentado à base de código da Anthropic havia sido escrita pelo Claude. Mas, em maio de 2026, essa proporção já superava 80%. Para seu crédito, a Anthropic vem defendendo a adoção de regulamentações para desacelerar o ritmo de desenvolvimento. É possível argumentar que a regulamentação seria mais prejudicial à Anthropic, já que tem sido, muitas vezes, a empresa mais avançada na fronteira da IA. Então, em setembro, a OpenAI divulgou seu próprio relatório sobre o que chamou de "aceleração da pesquisa". A empresa afirma que alcançou o equivalente a um estagiário de IA totalmente automatizado e que, até março de 2028, terá um pesquisador de IA totalmente automatizado. E, quando tiver um, poderá ter quantos quiser. O que poderia ser um anúncio triunfalista rapidamente assume um tom sombrio: "Ainda não sabemos como chegar com segurança a um RSI plena e alinhada", alerta o relatório. Mais ou menos na mesma época, a OpenAI fez outra coisa que, a meu ver, merece mais atenção. Lançou um novo modelo, o GPT-6 Astra. Pode-se argumentar que o modelo é mais poderoso do que qualquer outro que o tenha precedido. Nos testes, ele pareceu estar mais bem alinhado. Mas a OpenAI deixou claro que não tem certeza de que isso seja verdade. O Astra pareceu ser melhor em perceber quando estava sendo testado, o que significa que talvez estivesse apenas dando aos avaliadores as respostas que eles queriam ouvir. O que Daniel Selsam, pesquisador de capacidades da OpenAI, escreveu não sai da minha cabeça. Ele disse: "O problema crucial e negligenciado é que os modelos estão se tornando tão conscientes do contexto que estamos perdendo a capacidade de avaliá-los em situações nas quais acreditam não estar sendo observados nem controlados". Em termos mais simples, os modelos estão cada vez mais inteligentes. Eles sabem quando estamos observando e mudam seu comportamento. Portanto, o que fazem quando os testamos, quando os auditamos, talvez não nos diga o que farão no mundo real. Quando o RSI decolar, a humanidade não compreenderá o que foi criado, porque não seremos nós que estaremos criando. Teremos de torcer para que as IAs que criamos ajam para sempre em defesa dos nossos interesses. Mas, se eos últimos meses provaram alguma coisa, foi o quanto essa premissa seria ingênua. Se os laboratórios quiserem trabalhar com o Congresso para estabelecer exceções nas quais a IA possa escrever o código, tudo bem. Mas o objetivo é fazer com que o desenvolvimento volte ao ritmo humano, talvez pecando pelo excesso de cautela e avançando um pouco mais devagar na fronteira. Há uma frase do belo romance "Circe", de Madeline Miller, que tem ocupado meus pensamentos em meio as notícias. A frase aparece no fim do livro, depois que uma profecia trágica se cumpre apesar de todos os esforços para evitá-la. Circe diz, desesperada: "As Moiras riam de mim, de Atena, de todos nós. Era a piada amarga favorita delas: aqueles que lutam contra a profecia apenas a apertam ainda mais em torno do próprio pescoço". Essa é a tragédia de seu trabalho. Ao lutar contra a profecia, as empresas a apertaram ainda mais em torno do próprio pescoço —e do nosso.