4 pontos por GN⁺ 15 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Modelo fundacional que alivia a escassez de dados em modelos de política robótica ao fazer pré-treinamento com trajetórias UMI independentes de robô em escala de 100 mil horas e depois pós-treinamento com dados de robôs reais
  • Mais de 1.700 cenários foram anotados automaticamente para aprender capacidades gerais de geração de ações, e no pós-treinamento houve alinhamento com morfologias de robôs e comandos em linguagem natural
  • À medida que os dados de pré-treinamento e o modelo aumentaram, o erro de ação na validação diminuiu, e a taxa de sucesso em robôs reais também subiu de forma constante em ambientes e objetos desconhecidos após o pós-treinamento, sem sinais de saturação
  • Com menos de 10 horas de demonstrações por tarefa, registrou 75% de taxa de sucesso geral em embalagem de telefones, reabastecimento de impressoras, colocação de roupas para lavar e embalagem de caixas; com menos de 40 horas em média, chegou a 85%
  • Obteve o melhor desempenho em RoboCasa, RoboCasa365, VLABench e RoboDojo, mostrando que o efeito de generalização do pré-treinamento UMI em larga escala se transfere para adaptação em robôs reais e avaliações padronizadas

Aprendizado em duas etapas para superar a barreira dos dados em robótica

  • Modelos baseados em linguagem e visão melhoraram com mais dados, parâmetros e capacidade de computação, mas os modelos de política robótica tiveram sua expansão limitada pela falta de dados de alta qualidade em grande escala
  • O Xiaomi-Robotics-1 usa um método de aprendizado em duas etapas: pré-treinamento com dados UMI em larga escala independentes de robô e pós-treinamento com uma quantidade relativamente pequena de dados de robôs reais
  • Com isso, avalia-se se o comportamento de escalabilidade dos modelos de política robótica e as melhorias do pré-treinamento se transferem para o desempenho em robôs reais

Composição dos dados de pré-treinamento e pós-treinamento

  • Os dados de pré-treinamento são compostos por 100 mil horas de trajetórias UMI
    • Abrangem mais de 1.700 cenários e diversas tarefas, incluindo residências, estabelecimentos comerciais, ambientes industriais e espaços ao ar livre
    • Foi desenvolvido um pipeline de anotação automática que divide as trajetórias em segmentos de comprimento fixo e registra em linguagem as mudanças de estado da cena em cada segmento
  • No pós-treinamento, foi usado um conjunto de dados que cobre várias morfologias de robôs
    • Dados de robôs reais coletados internamente
    • Dados robóticos open source filtrados
    • Dados UMI de alta qualidade cuidadosamente selecionados
  • Os dados próprios incluem mais de 7.200 horas de tarefas de robôs reais coletadas em residências reais
    • Incluem tarefas como arrumar sofás, classificar sapateiras e guardar utensílios de cozinha
  • Os dados UMI para pós-treinamento recebem anotação manual de intervalos de tempo e prompts de comando
    • Isso os diferencia das descrições de transição de estado geradas automaticamente e usadas nos dados de pré-treinamento

Pré-treinamento UMI e anotação automática

  • O pré-treinamento é a etapa em que o modelo entra em contato com diversos ambientes e tarefas do mundo real para aprender representações gerais de geração de ações
  • Como a escala dos dados dificulta a anotação manual, foi construído um pipeline automatizado com um poderoso modelo de visão-linguagem (VLM)
    • Vídeos longos são divididos em clipes de comprimento fixo
    • Em cada clipe, o VLM descreve as mudanças de estado do gripper e dos objetos com os quais interage
    • Isso gera um grande corpus que combina trajetórias reais de manipulação com descrições linguísticas precisas
  • O modelo é treinado para gerar ações que transformem a cena de acordo com as transições de estado descritas em linguagem
  • À medida que os dados e o tamanho do modelo aumentam, há um claro comportamento de escalabilidade em que o erro de ação na validação cai continuamente

Alinhamento com robôs reais e comandos em linguagem natural

  • O pós-treinamento alinha a capacidade de geração de ações obtida no pré-treinamento em dois eixos
    • Alinhamento com a morfologia do robô: mapeia a capacidade geral de geração de ações para robôs físicos usando dados reais de alta qualidade e múltiplas morfologias
    • Alinhamento com comandos: transforma um modelo que recebia descrições de transição de estado da cena em um modelo capaz de entender e executar diretamente comandos em linguagem natural
  • O modelo pós-treinado pode ser usado em diversas tarefas reais de locomoção e manipulação sem ajuste adicional
  • Para verificar se o efeito de escalabilidade do pré-treinamento se transfere, o desempenho em robôs reais foi avaliado em ambientes e instâncias de objetos nunca vistos
  • À medida que os dados de pré-treinamento e o tamanho do modelo crescem, a taxa de sucesso em robôs reais também sobe de forma constante e previsível
    • Modelos pré-treinados mais fortes mostram melhor desempenho em robôs reais mesmo após o pós-treinamento
    • Não houve sinais de saturação no ganho de taxa de sucesso com o aumento da escala de dados e do modelo

Aprendizado de novas tarefas com poucos dados

  • O Xiaomi-Robotics-1 se adapta a tarefas novas e complexas com apenas algumas horas de demonstrações em robôs reais por tarefa
  • Embalagem de telefones, reabastecimento de impressoras, colocação de roupas para lavar e embalagem de caixas foram usadas como tarefas de avaliação
  • Com média de menos de 10 horas de demonstrações por tarefa, registrou taxa de sucesso geral de 75%, superando com folga os 40% do modelo de referência Ï0.5 com o mesmo orçamento de dados
    • Embalagem de telefones: XR-1 70%, Ï0.5 30%
    • Reabastecimento de impressoras: XR-1 70%, Ï0.5 20%
    • Colocação de roupas para lavar: XR-1 80%, Ï0.5 40%
    • Embalagem de caixas: XR-1 80%, Ï0.5 70%
  • Ao aumentar para média de menos de 40 horas por tarefa, a taxa de sucesso geral sobe para XR-1 85% e Ï0.5 53%
    • Embalagem de telefones: XR-1 80%, Ï0.5 40%
    • Reabastecimento de impressoras: XR-1 60%, Ï0.5 20%
    • Colocação de roupas para lavar: XR-1 100%, Ï0.5 50%
    • Embalagem de caixas: ambos os modelos 100%

Desempenho em quatro benchmarks de simulação

  • Registrou melhor desempenho em 4 benchmarks principais de simulação voltados à generalização
    • RoboCasa: taxa média de sucesso de 74,5%, melhora de 2,6% sobre o 2º lugar com 72,6%
    • RoboCasa365: 57,4%, melhora de 23,2% sobre o 2º lugar com 46,6%
    • VLABench: 59,1%, melhora de 11,1% sobre o 2º lugar com 53,2%
    • RoboDojo: 13,93%, melhora de 58,3% sobre o 2º lugar com 8,80%
  • Os efeitos de generalização e escalabilidade obtidos no pré-treinamento também se estendem às avaliações padronizadas em simulação

Resultados de escalabilidade e escopo de uso

  • O pré-treinamento UMI em larga escala alivia o gargalo de dados em robótica, e o alinhamento com robôs reais e comandos transfere a capacidade geral de geração de ações para robôs físicos
  • Os ganhos de desempenho conforme crescem os dados de pré-treinamento e o tamanho do modelo se refletem diretamente no desempenho imediato de uso em robôs reais após o pós-treinamento
  • O modelo fundacional concluído se adapta a novas tarefas com poucos dados e também alcança o melhor desempenho nos 4 benchmarks de simulação que avaliam generalização
  • Como caso de uso real, também foi divulgado um vídeo sem edição de embalagem de mala de viagem

1 comentários

 
Comentários do Hacker News
  • Eu estava sorrindo de orelha a orelha vendo o vídeo, a ponto de não entender as reações pessimistas daqui. Finalmente temos um robô que lava roupa, e isso também quer dizer que o modelo foi ao menos liberado de graça, não é? É o futuro que queríamos, e é exatamente para isso que a robótica deveria servir

    • O HN tem bastante sentimento anti-China, às vezes sutil, às vezes explícito, então isso provavelmente influenciou bastante as reações pessimistas
    • Os resultados recentes da China em IA e robótica trouxeram um grande ganho líquido para o mundo todo. Open source é algo bom independentemente da origem
    • A melhor IA ou os melhores modelos de linguagem não vão surgir em mais um chatbot de perguntas e respostas ou na automação de e-mails e redações, mas sim na robótica. Quero que lavem a louça e a roupa, e até encontrem objetos que esqueci onde deixei
    • O fato de um link mostrando uma tecnologia que era impossível poucos anos atrás ter ficado soterrado abaixo de uma notícia sobre o navegador semelhante do Kagi mostra bem as prioridades do público do HN. O Ocidente pode acabar ficando para trás em robótica por causa das prioridades erradas de investidores de risco e desenvolvedores
    • É a tecnologia mais impressionante que vi na vida, a ponto de parecer que a singularidade já chegou. Em breve, talvez robôs assim até cuidem e criem bebês
  • Este vídeo inclui várias tarefas classicamente muito difíceis, então, se isso não te impressiona, agradeça por não ter precisado construir você mesmo há 10 anos
    coordenação bimanual, base móvel, objetos deformáveis, pontos finos de manipulação como o zíper de uma bolsa e movimentos de pegar vários objetos de uma vez. Cada um desses problemas já foi estudado separadamente em percepção ou manipulação, e cada um deles renderia várias teses de doutorado

  • Ver o robô bimanual me faz pensar que uma terceira mão com outras capacidades, tipo uma garra tentacular, facilitaria muito várias tarefas. Mais membros também trazem mais problemas, mas a vantagem de ter mais formas de segurar e girar objetos é grande

    • Para treinar uma terceira mão, seria preciso uma grande quantidade de dados de teleoperação humana. Para duas mãos, há muitos vídeos de comportamento humano, mas para membros extras não, então no futuro os robôs provavelmente terão de se autoaperfeiçoar ou surgir novos métodos de otimização
    • No romance de ficção científica The Mote in God's Eye, aparecem alienígenas com três mãos. Eles têm uma mão para segurar objetos perto do abdômen e duas mãos para trabalho de precisão, o que até gerou expressões como “por um lado, por outro lado, e com a mão que segura”
    • Quem já fez manutenção em carro sabe que uma mão a mais sempre seria útil
    • Precisamos de algo como a lei de Amdahl também para o número de membros
  • Quero chamar de Slopfold a forma como aceitamos que o robô dobre as roupas de modo meio amassado e desajeitado, porque ainda assim é mais conveniente do que dobrar com perfeição e passar

    • As máquinas de café no começo também eram piores que um barista, mas foram evoluindo e hoje em muitos casos fazem melhor. A tecnologia geralmente começa assim, como uma conveniência imperfeita que depois melhora
    • Ver o robô dobrando roupa me fez perceber que ele já faz melhor do que eu
    • Dobrar roupa em si já é um meio-termo entre deixar espalhado e pendurar em cabides
  • O ritmo de avanço é muito rápido, e a IA vai dominar o futuro. Acho que mal arranhamos a superfície do que ainda é possível, mas, numa visão pessimista, considero que a previsão de Bill Joy foi presciente
    https://www.wired.com/2000/04/joy-2/

  • A parte mais empolgante do futuro esperado da IA para mim é a automação do trabalho doméstico. No Oriente, empregadas domésticas são relativamente baratas e acessíveis, mas no Ocidente contratar uma faxineira ou governanta beira o luxo. Gasto uma quantidade enorme de tempo toda semana cuidando da casa, então fico esperando o dia em que vou recuperar esse tempo

    • Nem no Oriente a maioria das pessoas consegue usar ajuda doméstica de forma barata e fácil. Isso só parece verdade porque os pobres foram excluídos dessa “maioria”
    • Para limpeza doméstica real, acho que um robô mais avançado que um Roomba dificilmente será mais barato do que uma empregada doméstica
    • Fico curioso sobre o que você faria com esse tempo livre que tanto quer recuperar
  • O fato de ser um vídeo sem edição deixa tudo ainda melhor. Dá para citar à vontade coisas que ele ainda não faz, como escadas ou portas estreitas, mas só o que ele já consegue fazer é impressionante, e o painel de chat ainda melhora a interatividade

  • O caminho certo é projetar robôs não humanoides. No futuro, ferramentas e eletrodomésticos também vão mudar para serem usados em conjunto por humanos e robôs, e o puxador do zíper da bolsa de sapato exige precisão demais

    • Já há evidência suficiente de que essa visão está errada. Até poucos meses atrás era praticamente a opinião padrão da robótica, mas os preços dos robôs humanoides caíram rapidamente antes mesmo de a produção em massa começar
      Parece mais viável continuar melhorando agilidade, autonomia de bateria e força de humanoides baratos, aproveitando o investimento massivo em aprendizado com tarefas do mundo real, do que redesenhar milhões de itens do cotidiano para se adequarem aos robôs especializados de hoje
    • Robôs não humanoides para fazer tarefas tediosas já são amplamente usados, como em manutenção subaquática. Só porque fazem tarefas parecidas com as humanas não significa que precisem ser humanoides
      Quero enxames de robôs em forma de inseto para eliminar mosquitos, robôs em forma de cobra para consertar encanamentos e robôs em forma de aranha para limpar superfícies
    • É melhor misturar as duas abordagens. Há coisas como portas que já são feitas para mãos e pés, mas outros tipos de garra ou um braço extra podem ajudar
    • Robôs não precisam parecer humanos; alguns braços já bastam para executar as tarefas com eficiência
  • Daqui a alguns anos, Home Assistant e LLMs talvez consigam coordenar as tarefas domésticas enquanto você estiver fora. O LLM pode fazer um inventário dos itens da casa e mandar aspiradores e robôs organizarem tudo
    LLMs multimodais podem analisar fotos para distinguir o que deve ir para a lava-louças ou para a máquina de lavar e o que precisa de polimento, além de organizar o armário, arrumar a cama e cuidar das plantas. É só deixá-los trabalhando o dia todo enquanto os painéis solares fornecem energia

  • Eu cuido da casa em tempo integral e realmente quero esse robô. Odeio dobrar roupa, então vivo adiando isso; mesmo sem a função de colocar as roupas na máquina, já bastaria se ele só dobrasse