Um grupo de pesquisadores do MIT apresentou uma abordagem híbrida baseada em IA generativa para planejar tarefas visuais de longo prazo, como navegação de robôs. O método combina modelos de visão e linguagem para interpretar cenas e simular ações.
A segunda etapa transforma essas simulações em arquivos de definição de domínio e problema na linguagem de planejamento PDDL. Um solucionador clássico gera o plano passo a passo, com refinamento via comparação com a simulação.
O sistema, denominado VLMFP, utiliza dois modelos especializados. SimVLM descreve a cena e simula ações; GenVLM produz arquivos PDDL a partir dessas descrições e é refinado pelo simulador.
Segundo os pesquisadores, o VLMFP obteve taxa de sucesso média de cerca de 70% em planos longos, o que supera as melhores técnicas de referência, em torno de 30%.
Resultados mostram boa capacidade de generalização para problemas não vistos previamente, incluindo ambientes com mudanças súbitas e tarefas de cooperação multirobot.
Desempenho e aplicações
Em tarefas 2D, o VLMFP alcançou cerca de 60% de sucesso; em cenários 3D, passou de 80%, com planos válidos em mais de 50% dos casos não vistos.
Os autores destacam que o sistema pode se adaptar a novos problemas mantendo o domínio estável, graças à separação entre descrição da cena e plano de ação.
O trabalho foi apresentado na conferência internacional sobre Representações de Aprendizado (ICLR) e financiado, parcialmente, pelo MIT-IBM Watson AI Lab.
Entre na conversa da comunidade