Um grupo de pesquisadores da Universidade de Zhejiang, em parceria com a Universidade Cornell, a Universidade Nacional de Singapura e a Universidade Xidian, criou um sistema revolucionário de raciocínio visual que permite que robôs “pensem” usando informações visuais, ao invés de dependerem de monólogos internos baseados em linguagem.
Denominado VisualThink-VLA, esse sistema apresenta uma notável melhoria na velocidade de processamento, sendo 22,8 vezes mais rápido do que as abordagens tradicionais que utilizam raciocínio textual, sem comprometer a precisão.
A essência do VisualThink-VLA reside no fato de que os modelos convencionais Vision-Language-Action costumam realizar um raciocínio sequencial baseado em texto. Nesse contexto, o robô precisa elaborar internamente um texto explicando cada etapa antes de agir, um processo que leva em média 8,377 segundos por etapa. Em contrapartida, o VisualThink-VLA utiliza tokens visuais para substituir os tokens textuais, reduzindo significativamente o tempo necessário para apenas 0,367 segundos por etapa.
O sistema é baseado em uma arquitetura composta por quatro canais de evidência visual: Caixa Delimitadora, Borda, Movimento e Relação. Ao invés de utilizar todos esses canais simultaneamente, o VisualThink-VLA implementa um mecanismo adaptativo que escolhe, em média, apenas 2,22 canais por etapa. Isso otimiza o uso dos recursos computacionais e melhora a qualidade do raciocínio.
A realização de testes em oito benchmarks resultou em uma taxa média de sucesso impressionante de 92,63%, superando a abordagem ECoT baseada em texto que obteve 85,09%. A diferença na velocidade é ainda mais acentuada: 22,8 vezes mais rápido e com maior precisão – uma combinação rara nos sistemas de inteligência artificial onde normalmente ocorre um trade-off entre velocidade e qualidade.
Os pesquisadores testaram o sistema utilizando um braço robótico PIPER NERO com sete graus de liberdade e demonstraram sua eficácia em tarefas como pegar e colocar múltiplos objetos. O sistema se destacou também em operações onde as relações espaciais são importantes e na execução de tarefas compostas que exigem um raciocínio sequencial.
Os dados utilizados para treinamento são conhecidos como VisualEvidence-Set e contêm 754.700 instruções englobando diversos cenários relacionados à manipulação.
Uma característica significativa do design é que o VisualThink-VLA pode ser integrado como um módulo adicional aos sistemas VLA já existentes. Isso implica que robôs que atualmente utilizam raciocínio textual podem ser atualizados sem a necessidade de reestruturar completamente sua arquitetura subjacente.
O artigo que detalha esta pesquisa está disponível no arXiv sob o identificador 2605.30011.
Esse trabalho representa uma transformação significativa no paradigma tradicional de agir após escrever um ensaio; agora se propõe um modelo onde ver-pensar-agir se torna realidade. Isso aproxima o raciocínio robótico do funcionamento humano natural ao permitir o processamento direto das informações visuais sem intermediários linguísticos.
Material de referência publicado por Pandaily.
