Converse com o Telinha

Telinha
Oi! Posso responder perguntas apenas com base nesta matéria. O que você quer saber?

É crucial ir além de métricas excessivamente agregadas no aprendizado de máquina

MIT revela falhas de modelos diagnósticos em novos ambientes, com até 75% de erros em dados não vistos, exigindo uso de OODSelect

“We demonstrate that even when you train models on large amounts of data, and choose the best average model, in a new setting this ‘best model’ could be the worst model for 6-75 percent of the new data,” says Associate Professor Marzyeh Ghassemi.
0:00
Carregando...
0:00

MIT identifica falhas em modelos de ML ao serem aplicados fora do conjunto de treinamento, levantando a necessidade de testes em novos ambientes. O estudo aponta casos onde o melhor modelo, em média, pode ser o pior para 6% a 75% dos casos em outra configuração.

Os pesquisadores mostram que, mesmo com grandes volumes de dados, correlações espúrias persistem e afetam a confiabilidade das previsões. Modelos treinados para diagnosticar doenças em raios-X de um hospital podem ter bom desempenho agregado, mas falhar em larga parte dos pacientes de outro hospital.

Em um artigo apresentado no NeurIPS 2025, a equipe descreve como modelos podem aprender a associar marcadores irrelevantes de uma instituição a uma patologia. Em outro hospital, sem esses marcadores, a precisão cai substantivamente.

Os resultados destacam que melhorar o desempenho na amostra original não elimina riscos de erros em novos cenários. Casos como radiação pleural ou aumento do mediastino podem reduzir a eficácia de diagnósticos, mesmo com alta média.

O grupo cita também que correlações com idade, gênero ou raça podem distorcer diagnósticos quando a distribuição de dados muda. A recomendação é que os modelos foquem nas características anatômicas relevantes, sem depender de fatores correlacionados no ambiente.

O estudo apresenta o algoritmo OODSelect, que identifica situações em que a precisão na amostra original não se sustenta. Ele treinou milhares de modelos com dados da primeira configuração e testou em dados da segunda.

Ao detectar subconjuntos com desempenho ruim, o método ajuda a isolar problemas e oferece caminhos para melhorias específicas. Os autores alertam sobre o uso de estatísticas agregadas que ocultam falhas.

Para o avanço prático, o grupo disponibiliza o código e subconjuntos identificados. Eles sugerem que órgãos, empresas ou hospitais usem o OODSelect para orientar avaliações e aprimoramentos de modelos.

Os pesquisadores destacam que, ao reconhecer subconjuntos de pior desempenho, é possível adaptar modelos para tarefas e ambientes específicos, elevando a confiabilidade das decisões com ML.

Comentários 0

Entre na conversa da comunidade

Os comentários não representam a opinião do Portal Tela; a responsabilidade é do autor da mensagem. Conecte-se para comentar

Veja Mais