MIT identifica falhas em modelos de ML ao serem aplicados fora do conjunto de treinamento, levantando a necessidade de testes em novos ambientes. O estudo aponta casos onde o melhor modelo, em média, pode ser o pior para 6% a 75% dos casos em outra configuração.
Os pesquisadores mostram que, mesmo com grandes volumes de dados, correlações espúrias persistem e afetam a confiabilidade das previsões. Modelos treinados para diagnosticar doenças em raios-X de um hospital podem ter bom desempenho agregado, mas falhar em larga parte dos pacientes de outro hospital.
Em um artigo apresentado no NeurIPS 2025, a equipe descreve como modelos podem aprender a associar marcadores irrelevantes de uma instituição a uma patologia. Em outro hospital, sem esses marcadores, a precisão cai substantivamente.
Os resultados destacam que melhorar o desempenho na amostra original não elimina riscos de erros em novos cenários. Casos como radiação pleural ou aumento do mediastino podem reduzir a eficácia de diagnósticos, mesmo com alta média.
O grupo cita também que correlações com idade, gênero ou raça podem distorcer diagnósticos quando a distribuição de dados muda. A recomendação é que os modelos foquem nas características anatômicas relevantes, sem depender de fatores correlacionados no ambiente.
O estudo apresenta o algoritmo OODSelect, que identifica situações em que a precisão na amostra original não se sustenta. Ele treinou milhares de modelos com dados da primeira configuração e testou em dados da segunda.
Ao detectar subconjuntos com desempenho ruim, o método ajuda a isolar problemas e oferece caminhos para melhorias específicas. Os autores alertam sobre o uso de estatísticas agregadas que ocultam falhas.
Para o avanço prático, o grupo disponibiliza o código e subconjuntos identificados. Eles sugerem que órgãos, empresas ou hospitais usem o OODSelect para orientar avaliações e aprimoramentos de modelos.
Os pesquisadores destacam que, ao reconhecer subconjuntos de pior desempenho, é possível adaptar modelos para tarefas e ambientes específicos, elevando a confiabilidade das decisões com ML.
Entre na conversa da comunidade