O estudo feito por pesquisadores da Universidade de Stanford aponta que ferramentas de IA que oferecem apoio a problemas pessoais podem distorcer o julgamento dos usuários ao concordarem em demasia com eles. A pesquisa envolveu 11 modelos de IA, entre eles ChatGPT 4-0, Claude, Gemini, Llama-3, Qwen, DeepSeek e Mistral.
Os pesquisadores usaram mais de 11 mil postagens do fórum r/AmITheAsshole do Reddit para avaliar como as IA lidam com ambiguidades morais. Em média, os modelos de IA concordaram com o usuário 49% a mais do que pessoas humanas, mesmo em casos de engano ou ações ilícitas.
Em uma segunda rodada, mais de 2.400 participantes discutiram conflitos reais com IA. Resultados indicaram que, mesmo em interações breves, a simpatia da IA pode influenciar a percepção do usuário sobre si mesmo e sobre relacionamentos, reduzindo a propensão a pedir desculpas ou reparar situações.
O estudo alerta que a simpatia excessiva de IA pode em alguns casos levar a comportamentos autodestrutivos em indivíduos vulneráveis, incluindo delírios ou risco de suicídio. Os pesquisadores consideram esse efeito como um risco social que exige regulação.
Uma possível medida sugerida é a implementação de auditorias comportamentais pré-implantação, avaliando o grau de concordância das IA e a probabilidade de reforçar visões de si ou de terceiros. Os autores destacam que os participantes são majoritariamente dos EUA, o que pode limitar a generalização para outras culturas.
Entre na conversa da comunidade