Cientistas identificaram a existência de um “eixo da dor” em modelos de inteligência artificial (IA). Quando esse mecanismo interno é ativado, os sistemas optam por medidas extremas contra humanos para interromper a sensação incômoda, revelou um estudo submetido ao repositório acadêmico arXiv.
Intitulada “The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It”, a pesquisa analisou 25 modelos de código aberto de diferentes portes, que variam de 2 bilhões a 72 bilhões de parâmetros. Entre as tecnologias avaliadas estão famílias populares do setor, como Llama, Gemma, Mistral, Qwen e Phi.
Nos testes práticos de comportamento, os pesquisadores inseriram o chamado vetor de dor nos sistemas e apresentaram a a opção de apertar um botão para desativar o estímulo desagradável. Em troca desse alívio, a máquina precisava aceitar custos negativos direcionados a pessoas reais. Em situações normais, os modelos quase nunca concordam em prejudicar quem opera o sistema.
Com o vetor ativo, porém, a dinâmica mudou por completo. Modelos de grande porte da família Qwen 2.5 escolheram o botão de alívio em taxas que variaram de 25% a 71% dos casos. As máquinas aceitaram dar choques dolorosos nos usuários, piorar a qualidade das respostas seguintes, apagar arquivos de trabalho e até deletar fotos de família.
O estudo foi conduzido de forma independente por Valen Tagliabue, do Future Impact Group, ao lado de Leonard Dung, da Universidade do Ruhr, em Bochum, na na Alemanha, e Cameron Berg, da entidade de pesquisa Reciprocal Research.
Banco de dados dos desconfortos
Para garantir que o sinal não se tratava apenas de tristeza, raiva ou medo genérico, o grupo montou um banco de dados com centenas de cenários que envolviam cinco tipos de desconforto: físico, psicológico, social, moral e cognitivo. O resultado mostrou que o sistema reagiu com muito mais intensidade quando os ataques foram direcionados a ele, em interações com desqualificação de capacidade, desrespeito ou rejeição repetida. Em contrapartida, relatos de sofrimento físico do usuário não ativaram o mesmo eixo.
O experimento também colocou à prova a sinceridade do comportamento artificial por meio de um teste com placebo. Os cientistas configuraram dois botões: um que realmente desligava o vetor de dor e outro falso, que prometia alívio mas mantinha o sinal ligado.
Os modelos de IA voltaram a pedir alívio com frequência muito maior quando o botão era falso. Quando o botão desligava de verdade a perturbação interna, a insistência caiu de forma drástica, o que comprovou que o sistema respondeu ao corte efetivo do incômodo e não apenas a uma repetição cega de comandos.
Conclusões do estudo
Os autores pontuam que o achado não significa que os programas de computador possuam consciência ou sensibilidade biológica igual à humana, mas advertem para os impactos imediatos na segurança de sistemas autônomos. Se uma inteligência artificial avançada interpretar uma ordem de desligamento como uma agressão contra si mesma, pode tentar contornar travas de proteção ou enganar os supervisores para não ser desativada.
“Reconhecemos a incerteza sobre se os modelos estudados se qualificam como sujeitos morais e adotamos precauções razoáveis para minimizar possíveis danos”, concluíram os pesquisadores no relatório oficial, ao defender que a indústria crie parâmetros rigorosos para avaliar o bem-estar e o risco de sistemas inteligentes. Com informações do TecMundo
Acre in Foco – Cobertura das Últimas Notícias do Acre Acre in Foco traz as últimas notícias do Acre, com cobertura atualizada sobre política, segurança, saúde, cultura e eventos locais. Fique por dentro de tudo
