Pesquisa

Pesquisadores apontam limites dos modelos de IA para generalizar ações em robôs

Enquanto executivos projetam humanoides autônomos no curto prazo, especialistas alertam que a escassez de dados físicos e as falhas dos modelos de visão-linguagem-ação travam tarefas fora dos laboratórios.

Capa ilustrativa da editoria Pesquisa

Por que importa. Para desenvolvedores de robótica e agentes corporificados, a barreira mostra que replicar a receita dos LLMs no controle motor exige novos paradigmas, como modelos de mundo, antes de viabilizar produtos comerciais seguros.

A promessa de que avanços recentes em inteligência artificial levarão robôs humanoides a residências e fábricas em ritmo acelerado enfrenta ceticismo no meio acadêmico e na indústria de hardware. Executivos como Elon Musk, da Tesla, e Jensen Huang, da Nvidia, têm defendido que máquinas de uso geral logo assumirão o trabalho braçal humano. Contudo, pesquisadores ouvidos pela MIT Technology Review apontam que transferir o aprendizado estatístico baseado em texto e imagens para a manipulação no mundo físico expõe gargalos técnicos profundos.

A principal mudança recente na área foi a substituição de regras manuais de controle por modelos de visão-linguagem-ação (VLA). Em vez de engenheiros programarem cada milímetro de um movimento, sistemas como o Gemini Robotics, testado pela Google DeepMind na bancada bimanual ALOHA 2, aprendem a associar instruções e imagens a trajetórias físicas gravadas durante teleoperações humanas. Esse método permitiu que braços robóticos realizassem ações como fechar embalagens, segurar pinças ou manipular objetos frágeis.

Gargalo de dados e falhas fora do treino

Apesar dos sucessos demonstrados em laboratório, os modelos VLA apresentam uma fraqueza crítica: quando uma tarefa se afasta do conjunto de dados de treino, o sistema tende a falhar. Conforme explicou Edward Johns, professor de robótica no Imperial College London, as políticas atuais conseguem operar apenas em pontos isolados do espectro total de tarefas possíveis, longe de constituir uma inteligência de uso geral.

A coleta de dados para treinar essas redes também não possui a mesma escala da internet textual usada em LLMs. Amostras de teleoperação humana são caras e lentas de obter, vídeos gravados de humanos geram sinais ruidosos para comandos motores, e liberar robôs no mundo real para coletar dados gera riscos de colisão e segurança.

A disputa entre mais dados e modelos de mundo

A divergência divide os próprios roboticistas. Jonathan Hurst, cofundador da Agility Robotics e professor na Universidade Estadual do Oregon, considera falha a premissa de que basta injetar mais dados para cobrir as infinitas variações de ambientes cotidianos, como cozinhas e ferramentas distintas. Para ele, atingir generalização exigiria uma cobertura de dados quase inalcançável.

Em fóruns recentes, o pesquisador Yann LeCun também reiterou que as técnicas bem-sucedidas em modelos de linguagem não se adaptam a dados contínuos e ruidosos da física. A alternativa defendida por setores da pesquisa é o desenvolvimento de modelos de mundo, arquiteturas treinadas em vídeos, sensores e varreduras tridimensionais projetadas para compreender relações causais, gravidade e colisões antes de tentar movimentar um atuador mecânico.

Fontes

Reportagem produzida pela redação do Flipters com apoio de inteligência artificial, a partir das fontes acima. Como trabalhamos.

WhatsAppLinkedInX
Voltar para a edição

Mais em Pesquisa

Ver todas

Quem constrói lê

Receba o Flipters no seu e-mail. A newsletter de IA para quem está tirando produto do papel.