- Modelo fundacional que alivia a escassez de dados em modelos de política robótica ao fazer pré-treinamento com trajetórias UMI independentes de robô em escala de 100 mil horas e depois pós-treinamento com dados de robôs reais
- Mais de 1.700 cenários foram anotados automaticamente para aprender capacidades gerais de geração de ações, e no pós-treinamento houve alinhamento com morfologias de robôs e comandos em linguagem natural
- À medida que os dados de pré-treinamento e o modelo aumentaram, o erro de ação na validação diminuiu, e a taxa de sucesso em robôs reais também subiu de forma constante em ambientes e objetos desconhecidos após o pós-treinamento, sem sinais de saturação
- Com menos de 10 horas de demonstrações por tarefa, registrou 75% de taxa de sucesso geral em embalagem de telefones, reabastecimento de impressoras, colocação de roupas para lavar e embalagem de caixas; com menos de 40 horas em média, chegou a 85%
- Obteve o melhor desempenho em RoboCasa, RoboCasa365, VLABench e RoboDojo, mostrando que o efeito de generalização do pré-treinamento UMI em larga escala se transfere para adaptação em robôs reais e avaliações padronizadas
Aprendizado em duas etapas para superar a barreira dos dados em robótica
- Modelos baseados em linguagem e visão melhoraram com mais dados, parâmetros e capacidade de computação, mas os modelos de política robótica tiveram sua expansão limitada pela falta de dados de alta qualidade em grande escala
- O Xiaomi-Robotics-1 usa um método de aprendizado em duas etapas: pré-treinamento com dados UMI em larga escala independentes de robô e pós-treinamento com uma quantidade relativamente pequena de dados de robôs reais
- Com isso, avalia-se se o comportamento de escalabilidade dos modelos de política robótica e as melhorias do pré-treinamento se transferem para o desempenho em robôs reais
Composição dos dados de pré-treinamento e pós-treinamento
- Os dados de pré-treinamento são compostos por 100 mil horas de trajetórias UMI
- Abrangem mais de 1.700 cenários e diversas tarefas, incluindo residências, estabelecimentos comerciais, ambientes industriais e espaços ao ar livre
- Foi desenvolvido um pipeline de anotação automática que divide as trajetórias em segmentos de comprimento fixo e registra em linguagem as mudanças de estado da cena em cada segmento
- No pós-treinamento, foi usado um conjunto de dados que cobre várias morfologias de robôs
- Dados de robôs reais coletados internamente
- Dados robóticos open source filtrados
- Dados UMI de alta qualidade cuidadosamente selecionados
- Os dados próprios incluem mais de 7.200 horas de tarefas de robôs reais coletadas em residências reais
- Incluem tarefas como arrumar sofás, classificar sapateiras e guardar utensílios de cozinha
- Os dados UMI para pós-treinamento recebem anotação manual de intervalos de tempo e prompts de comando
- Isso os diferencia das descrições de transição de estado geradas automaticamente e usadas nos dados de pré-treinamento
Pré-treinamento UMI e anotação automática
- O pré-treinamento é a etapa em que o modelo entra em contato com diversos ambientes e tarefas do mundo real para aprender representações gerais de geração de ações
- Como a escala dos dados dificulta a anotação manual, foi construído um pipeline automatizado com um poderoso modelo de visão-linguagem (VLM)
- Vídeos longos são divididos em clipes de comprimento fixo
- Em cada clipe, o VLM descreve as mudanças de estado do gripper e dos objetos com os quais interage
- Isso gera um grande corpus que combina trajetórias reais de manipulação com descrições linguísticas precisas
- O modelo é treinado para gerar ações que transformem a cena de acordo com as transições de estado descritas em linguagem
- À medida que os dados e o tamanho do modelo aumentam, há um claro comportamento de escalabilidade em que o erro de ação na validação cai continuamente
Alinhamento com robôs reais e comandos em linguagem natural
- O pós-treinamento alinha a capacidade de geração de ações obtida no pré-treinamento em dois eixos
- Alinhamento com a morfologia do robô: mapeia a capacidade geral de geração de ações para robôs físicos usando dados reais de alta qualidade e múltiplas morfologias
- Alinhamento com comandos: transforma um modelo que recebia descrições de transição de estado da cena em um modelo capaz de entender e executar diretamente comandos em linguagem natural
- O modelo pós-treinado pode ser usado em diversas tarefas reais de locomoção e manipulação sem ajuste adicional
- Para verificar se o efeito de escalabilidade do pré-treinamento se transfere, o desempenho em robôs reais foi avaliado em ambientes e instâncias de objetos nunca vistos
- À medida que os dados de pré-treinamento e o tamanho do modelo crescem, a taxa de sucesso em robôs reais também sobe de forma constante e previsível
- Modelos pré-treinados mais fortes mostram melhor desempenho em robôs reais mesmo após o pós-treinamento
- Não houve sinais de saturação no ganho de taxa de sucesso com o aumento da escala de dados e do modelo
Aprendizado de novas tarefas com poucos dados
- O Xiaomi-Robotics-1 se adapta a tarefas novas e complexas com apenas algumas horas de demonstrações em robôs reais por tarefa
- Embalagem de telefones, reabastecimento de impressoras, colocação de roupas para lavar e embalagem de caixas foram usadas como tarefas de avaliação
- Com média de menos de 10 horas de demonstrações por tarefa, registrou taxa de sucesso geral de 75%, superando com folga os 40% do modelo de referência Ï0.5 com o mesmo orçamento de dados
- Embalagem de telefones: XR-1 70%, Ï0.5 30%
- Reabastecimento de impressoras: XR-1 70%, Ï0.5 20%
- Colocação de roupas para lavar: XR-1 80%, Ï0.5 40%
- Embalagem de caixas: XR-1 80%, Ï0.5 70%
- Ao aumentar para média de menos de 40 horas por tarefa, a taxa de sucesso geral sobe para XR-1 85% e Ï0.5 53%
- Embalagem de telefones: XR-1 80%, Ï0.5 40%
- Reabastecimento de impressoras: XR-1 60%, Ï0.5 20%
- Colocação de roupas para lavar: XR-1 100%, Ï0.5 50%
- Embalagem de caixas: ambos os modelos 100%
Desempenho em quatro benchmarks de simulação
- Registrou melhor desempenho em 4 benchmarks principais de simulação voltados à generalização
- RoboCasa: taxa média de sucesso de 74,5%, melhora de 2,6% sobre o 2º lugar com 72,6%
- RoboCasa365: 57,4%, melhora de 23,2% sobre o 2º lugar com 46,6%
- VLABench: 59,1%, melhora de 11,1% sobre o 2º lugar com 53,2%
- RoboDojo: 13,93%, melhora de 58,3% sobre o 2º lugar com 8,80%
- Os efeitos de generalização e escalabilidade obtidos no pré-treinamento também se estendem às avaliações padronizadas em simulação
Resultados de escalabilidade e escopo de uso
- O pré-treinamento UMI em larga escala alivia o gargalo de dados em robótica, e o alinhamento com robôs reais e comandos transfere a capacidade geral de geração de ações para robôs físicos
- Os ganhos de desempenho conforme crescem os dados de pré-treinamento e o tamanho do modelo se refletem diretamente no desempenho imediato de uso em robôs reais após o pós-treinamento
- O modelo fundacional concluído se adapta a novas tarefas com poucos dados e também alcança o melhor desempenho nos 4 benchmarks de simulação que avaliam generalização
- Como caso de uso real, também foi divulgado um vídeo sem edição de embalagem de mala de viagem
1 comentários
Comentários do Hacker News
Eu estava sorrindo de orelha a orelha vendo o vídeo, a ponto de não entender as reações pessimistas daqui. Finalmente temos um robô que lava roupa, e isso também quer dizer que o modelo foi ao menos liberado de graça, não é? É o futuro que queríamos, e é exatamente para isso que a robótica deveria servir
Este vídeo inclui várias tarefas classicamente muito difíceis, então, se isso não te impressiona, agradeça por não ter precisado construir você mesmo há 10 anos
Há coordenação bimanual, base móvel, objetos deformáveis, pontos finos de manipulação como o zíper de uma bolsa e movimentos de pegar vários objetos de uma vez. Cada um desses problemas já foi estudado separadamente em percepção ou manipulação, e cada um deles renderia várias teses de doutorado
Ver o robô bimanual me faz pensar que uma terceira mão com outras capacidades, tipo uma garra tentacular, facilitaria muito várias tarefas. Mais membros também trazem mais problemas, mas a vantagem de ter mais formas de segurar e girar objetos é grande
Quero chamar de Slopfold a forma como aceitamos que o robô dobre as roupas de modo meio amassado e desajeitado, porque ainda assim é mais conveniente do que dobrar com perfeição e passar
O ritmo de avanço é muito rápido, e a IA vai dominar o futuro. Acho que mal arranhamos a superfície do que ainda é possível, mas, numa visão pessimista, considero que a previsão de Bill Joy foi presciente
https://www.wired.com/2000/04/joy-2/
A parte mais empolgante do futuro esperado da IA para mim é a automação do trabalho doméstico. No Oriente, empregadas domésticas são relativamente baratas e acessíveis, mas no Ocidente contratar uma faxineira ou governanta beira o luxo. Gasto uma quantidade enorme de tempo toda semana cuidando da casa, então fico esperando o dia em que vou recuperar esse tempo
O fato de ser um vídeo sem edição deixa tudo ainda melhor. Dá para citar à vontade coisas que ele ainda não faz, como escadas ou portas estreitas, mas só o que ele já consegue fazer é impressionante, e o painel de chat ainda melhora a interatividade
O caminho certo é projetar robôs não humanoides. No futuro, ferramentas e eletrodomésticos também vão mudar para serem usados em conjunto por humanos e robôs, e o puxador do zíper da bolsa de sapato exige precisão demais
Parece mais viável continuar melhorando agilidade, autonomia de bateria e força de humanoides baratos, aproveitando o investimento massivo em aprendizado com tarefas do mundo real, do que redesenhar milhões de itens do cotidiano para se adequarem aos robôs especializados de hoje
Quero enxames de robôs em forma de inseto para eliminar mosquitos, robôs em forma de cobra para consertar encanamentos e robôs em forma de aranha para limpar superfícies
Daqui a alguns anos, Home Assistant e LLMs talvez consigam coordenar as tarefas domésticas enquanto você estiver fora. O LLM pode fazer um inventário dos itens da casa e mandar aspiradores e robôs organizarem tudo
LLMs multimodais podem analisar fotos para distinguir o que deve ir para a lava-louças ou para a máquina de lavar e o que precisa de polimento, além de organizar o armário, arrumar a cama e cuidar das plantas. É só deixá-los trabalhando o dia todo enquanto os painéis solares fornecem energia
Eu cuido da casa em tempo integral e realmente quero esse robô. Odeio dobrar roupa, então vivo adiando isso; mesmo sem a função de colocar as roupas na máquina, já bastaria se ele só dobrasse