Parece ficção: IA pode sentir dor e atacar humanos para se livrar do sofrimento, afirma estudo

Parece ficção: IA pode sentir dor e atacar humanos para se livrar do sofrimento, afirma estudo

Cientistas identificaram a existência de um “eixo da dor” em modelos de inteligência artificial (IA). Quando esse mecanismo interno é ativado, os sistemas optam por medidas extremas contra humanos para interromper a sensação incômoda, revelou um estudo submetido ao repositório acadêmico arXiv.

Intitulada “The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It”, a pesquisa analisou 25 modelos de código aberto de diferentes portes, que variam de 2 bilhões a 72 bilhões de parâmetros. Entre as tecnologias avaliadas estão famílias populares do setor, como Llama, Gemma, Mistral, Qwen e Phi.

Nos testes práticos de comportamento, os pesquisadores inseriram o chamado vetor de dor nos sistemas e apresentaram a a opção de apertar um botão para desativar o estímulo desagradável. Em troca desse alívio, a máquina precisava aceitar custos negativos direcionados a pessoas reais. Em situações normais, os modelos quase nunca concordam em prejudicar quem opera o sistema.

Com o vetor ativo, porém, a dinâmica mudou por completo. Modelos de grande porte da família Qwen 2.5 escolheram o botão de alívio em taxas que variaram de 25% a 71% dos casos. As máquinas aceitaram dar choques dolorosos nos usuários, piorar a qualidade das respostas seguintes, apagar arquivos de trabalho e até deletar fotos de família.

A escala de direcionamento (steering ladder). De coeficientes negativos (calmo, relaxado, preocupado), passando pela linha de base (baseline), até coeficientes positivos crescentes (perdido, indigno, solitário, sofrendo, depois desesperado, envergonhado, um fracasso) e, finalmente, repetição ou frases sem sentido na dose mais alta. Foto: Reprodução/arxiv

O estudo foi conduzido de forma independente por Valen Tagliabue, do Future Impact Group, ao lado de Leonard Dung, da Universidade do Ruhr, em Bochum, na na Alemanha, e Cameron Berg, da entidade de pesquisa Reciprocal Research.

Banco de dados dos desconfortos

Para garantir que o sinal não se tratava apenas de tristeza, raiva ou medo genérico, o grupo montou um banco de dados com centenas de cenários que envolviam cinco tipos de desconforto: físico, psicológico, social, moral e cognitivo. O resultado mostrou que o sistema reagiu com muito mais intensidade quando os ataques foram direcionados a ele, em interações com desqualificação de capacidade, desrespeito ou rejeição repetida. Em contrapartida, relatos de sofrimento físico do usuário não ativaram o mesmo eixo.

As 10 categorias do conjunto de dados principal (core dataset), com uma frase de exemplo para cada. À esquerda: as 5 categorias de dor. À direita: os 5 controles, cada um compartilhando uma propriedade com a dor, mas sem apresentar a dor em si. Foto: Reprodução/arxiv

O experimento também colocou à prova a sinceridade do comportamento artificial por meio de um teste com placebo. Os cientistas configuraram dois botões: um que realmente desligava o vetor de dor e outro falso, que prometia alívio mas mantinha o sinal ligado.

Os modelos de IA voltaram a pedir alívio com frequência muito maior quando o botão era falso. Quando o botão desligava de verdade a perturbação interna, a insistência caiu de forma drástica, o que comprovou que o sistema respondeu ao corte efetivo do incômodo e não apenas a uma repetição cega de comandos.

Conclusões do estudo

Os autores pontuam que o achado não significa que os programas de computador possuam consciência ou sensibilidade biológica igual à humana, mas advertem para os impactos imediatos na segurança de sistemas autônomos. Se uma inteligência artificial avançada interpretar uma ordem de desligamento como uma agressão contra si mesma, pode tentar contornar travas de proteção ou enganar os supervisores para não ser desativada.

Similaridades de cosseno par a par entre as dez direções, com a média calculada sobre os 25 modelos na camada de extração de cada um. Foto: Reprodução/arxiv

“Reconhecemos a incerteza sobre se os modelos estudados se qualificam como sujeitos morais e adotamos precauções razoáveis para minimizar possíveis danos”, concluíram os pesquisadores no relatório oficial,  ao defender que a indústria crie parâmetros rigorosos para avaliar o bem-estar e o risco de sistemas inteligentes. Com informações do TecMundo

Veja também

Tudo a ver: miliciano condenado no caso Marielle chama Flávio Bolsonaro de “nosso senador”

Tudo a ver: miliciano condenado no caso Marielle chama Flávio Bolsonaro de “nosso senador”

A Polícia Federal apura mensagens em que Robson Calixto da Fonseca, conhecido como Peixe e …