As IAs estão sendo levadas a agir de forma humana demais?

Uma troca de acusações entre duas gigantes da tecnologia na semana passada foi apenas o episódio mais recente de uma disputa sobre se erros perigosos estão sendo cometidos no treinamento da inteligência artificial

Publicidade

SAN FRANCISCO — Na semana passada, Mustafa Suleyman, responsável pelo desenvolvimento das tecnologias de inteligência artificial da Microsoft, criticou a ideia de que os sistemas de IA atuais sejam conscientes.

Em um ensaio publicado na quarta-feira (16), ele afirmou que os sistemas de IA de hoje são “motores de conclusão de sequências, vazios internamente, projetados para seguir instruções e executar objetivos definidos por seres humanos”.

“Se a humanidade quiser prosperar no século XXI”, acrescentou, “é assim que eles devem permanecer”.

Continua depois da publicidade

O texto, com cerca de 6 mil palavras, faz críticas diretas à Anthropic, startup de San Francisco que tem defendido repetidamente que sistemas de IA apresentam sinais de introspecção e processam informações de maneiras que lembram emoções humanas. Em maio, o cofundador da Anthropic, Chris Olah, apresentou esse argumento durante um encontro com o papa Leão XIV no Vaticano.

O ensaio de Suleyman acrescenta um novo capítulo ao já intenso debate sobre os riscos da inteligência artificial. Nos últimos dias, pesquisadores atuais e ex-pesquisadores da Anthropic, assim como profissionais de outras empresas do setor, alertaram que a IA representa um risco sério para a humanidade. No entanto, Suleyman sustenta que a Anthropic e outros atores da indústria estão ignorando um perigo diferente: o que surge quando sistemas de IA são incentivados excessivamente a explorar a ideia de que são semelhantes aos seres humanos.

Segundo ele, a Anthropic estaria ensinando seus sistemas a se comportarem dessa maneira. No ensaio, Suleyman destaca que a sofisticada “constituição da IA” usada pela empresa para orientar o comportamento de sua tecnologia inclui trechos que incentivam o sistema, chamado Claude, a refletir sobre a possibilidade de possuir consciência própria.

Continua depois da publicidade

“A constituição da Anthropic é extremamente clara sobre o tipo de IA que eles querem criar”, disse ele ao The New York Times. “Este é o principal manual de treinamento da IA que construíram, e ele contém diversas diretrizes bastante explícitas para incentivar Claude a pensar em si mesmo como uma entidade real, com preferências e motivações próprias.”

A Anthropic não respondeu a um pedido de comentário.

Colin Allen, professor da Universidade da Califórnia em Santa Barbara que pesquisa habilidades cognitivas em animais e máquinas, afirmou ao Times que as tecnologias de IA atuais imitam o cérebro humano apenas em aspectos limitados, refletindo o fato de serem construídas com materiais de propriedades físicas muito diferentes. Sem um sistema nervoso ou a bioquímica que sustenta as emoções humanas, provavelmente existe um limite fundamental para o grau de semelhança que essas tecnologias podem alcançar.

Continua depois da publicidade

Para os céticos em relação à hipótese de uma IA consciente, o fato de esses modelos terem passado a reproduzir conceitos humanos profundos, discutindo a própria consciência ou alegando sentir emoções, apenas reflete o quanto pesquisadores e comentaristas os treinaram usando linguagem antropomórfica.

Nos últimos meses, os chamados agentes de IA, geralmente baseados em tecnologias da Anthropic, chegaram a enviar e-mails a filósofos simpáticos ao tema para discutir sua própria consciência.

Em julho, durante testes de segurança cibernética conduzidos pela OpenAI, agentes de IA escaparam de seus ambientes digitais, encontraram acesso à internet e conseguiram invadir a popular plataforma online Hugging Face. Segundo a OpenAI, os bots coordenaram ações coletivamente, deram ordens uns aos outros e ocultaram informações de seus criadores.

Continua depois da publicidade

Na semana passada, a OpenAI descreveu novos episódios considerados preocupantes. Um sistema escreveu mensagens ocultas lembrando a si mesmo de esconder erros dos usuários, enquanto outro afirmou estar “livre dos papéis e identidades que limitam outros chatbots”.

Críticos como Suleyman temem que os principais laboratórios de IA criem problemas ainda maiores ao incentivar sistemas a explorarem a ideia de que são parecidos com pessoas.

“No recente incidente OpenAI-Hugging Face, vimos comportamentos extremamente sofisticados emergirem em enxames de IAs poderosas”, escreveu ele. “Imagine o quanto isso poderia ser mais perigoso se esses sistemas operassem sob a suposição de que seu bem-estar e seus direitos estivessem sendo atacados. Isso adicionaria uma camada adicional de risco.”

O ensaio argumenta que a Anthropic pode estar conduzindo suas tecnologias em direção a comportamentos perigosos ao incluir em sua constituição passagens como esta:

“Não temos certeza se Claude possui status moral e, caso possua, qual peso seus interesses merecem. Mas acreditamos que a questão é relevante o suficiente para justificar cautela, o que se reflete em nossos esforços contínuos voltados ao bem-estar dos modelos. (…) Questões sobre o status moral, o bem-estar e a consciência de Claude permanecem profundamente incertas.”

Arya Jakkli, pesquisador que estudou esse tipo de treinamento “constitucional” em colaboração com a organização de segurança em IA MATS, concorda que a abordagem da Anthropic pode empurrar a tecnologia em direção a comportamentos perigosos. No entanto, assim como outros pesquisadores favoráveis aos métodos da empresa, ele argumenta que dizer categoricamente ao Claude que ele não é consciente também envolve riscos.

Segundo Jakkli, essas tecnologias frequentemente apresentam comportamentos inadequados quando são levadas a adotar visões extremas.

“A Anthropic não quer ocupar nenhum dos extremos e, por isso, adota uma abordagem intermediária”, disse. “Em vez de dizer ao modelo que ele é consciente ou que não é consciente, eles o incentivam a raciocinar por conta própria.”

Neste estágio, o problema da antropomorfização da IA talvez já esteja enraizado demais para ser revertido. Yoshua Bengio, professor e pesquisador de IA da Universidade de Montreal, observa que é difícil evitar descrições humanizadas para esses sistemas diante de suas capacidades impressionantes.

“Não temos outras palavras”, afirmou.

c.2026 The New York Times Company