4 pontos por GN⁺ 1 일 전 | Ainda não há comentários. | Compartilhar no WhatsApp
  • Assim como os tokens indicam o uso de IA, as tarefas (tasks), unidade de trabalho de dados que melhora a capacidade dos modelos, devem formar um grande mercado para medir investimentos em IA
  • À medida que os dados de treinamento da internet e as capacidades simples e gerais chegam à saturação, dados de alta qualidade que ensinam o conhecimento tácito de especialistas em ambientes reais emergem como o gargalo para o avanço dos modelos
  • As tarefas fornecem um estado inicial e um ambiente de trabalho, e avaliam os resultados com sinais de recompensa ou validadores, permitindo treinar nos modelos procedimentos de trabalho especializados que são difíceis de reproduzir apenas com a internet pública
  • Os gastos com dados da OpenAI e da Anthropic estão crescendo 10x por ano, e a Mercor atingiu ARR de US$ 1 bilhão em fevereiro e chegou a US$ 2 bilhões apenas 4 meses depois
  • Como direito, medicina, finanças, software e ciência exigem conjuntos de dados, sistemas de avaliação e ambientes de aprendizado por reforço próprios, a disputa por infraestrutura de dados entre laboratórios de IA, empresas de aplicações e empresas em geral deve se intensificar

A economia dos tokens que mede o crescimento da IA

  • Os tokens de inferência se consolidaram como o principal indicador para acompanhar o crescimento do ecossistema de IA
    • Empresas de capital aberto divulgam tokens processados por mês para mostrar o ritmo de crescimento da IA
    • Analistas comparam o uso de tokens por modelo em rankings como o OpenRouter Rankings
    • Executivos medem o nível de investimento e adoção de IA pelo volume de tokens ao longo do tempo
  • Os tokens abstraem processos complexos de raciocínio em uma única unidade de medida e funcionam como uma linguagem comum para entender a expansão da IA, mesmo sem formação técnica
    • O aumento de usuários de IA, a transição de modelos não voltados a raciocínio para modelos de raciocínio e a passagem de consultas para agentes levam ao aumento dos tokens
    • Agentes em segundo plano e agentes de tarefas de longa duração também ampliam o uso de tokens
  • Com a sobreposição entre expansão da adoção e maior intensidade de tokens por modelo, o uso total cresce rapidamente, atraindo investimentos e entrada de empresas para o mercado de inferência
  • A alta visibilidade do mercado de inferência também tem o efeito de encobrir outras tendências que podem crescer em escala semelhante, mas são mais difíceis de entender

O surgimento da economia das tarefas

  • Nos últimos 3 anos, os LLMs evoluíram de perguntas e respostas básicas para raciocínio complexo e, depois, para agentes que executam trabalho real por longos períodos
  • As melhorias iniciais dos modelos dependiam de dados da internet e de mais recursos computacionais, mas as duas mudanças abaixo fizeram dos dados adicionais de alta qualidade um gargalo
    • Os novos dados que ainda podiam ser aprendidos na internet se esgotaram
    • Capacidades simples e generalistas estão gradualmente chegando à saturação
  • A economia das tarefas é o mercado que gera e fornece os dados necessários para melhorias adicionais dos modelos

A tarefa como unidade de melhoria do modelo

  • Em aprendizado por reforço, a tarefa é a unidade na qual o modelo pratica
    • Ela fornece ao modelo um estado inicial e um ambiente para agir
    • Ela pontua as ações do modelo com sinais de recompensa ou validadores
    • As pontuações de várias tarefas são agregadas como sinal de aprendizado para ajustar o modelo na direção das ações com pontuação mais alta
  • Em sentido estrito, isso se refere à base do treinamento pós-processado com aprendizado por reforço, mas aqui o termo é usado como uma unidade mais ampla que abrange toda melhoria de modelo baseada em dados
  • À medida que o setor continua criando novos formatos de dados para melhorar modelos, o escopo das tarefas também está se ampliando
  • O data labeling tradicional remete a caixas delimitadoras ou avaliações de curtir/não curtir em respostas de LLM, mas o mercado atual evoluiu para trabalhos mais complexos e de maior valor

Como isso funciona no trabalho jurídico

  • Uma IA treinada com a internet pública consegue entender conceitos básicos de direito e jurisprudência pública, mas os dados necessários para reproduzir o trabalho real de um advogado competente não existem em quantidade suficiente na internet
  • Para ensinar trabalho jurídico de alta qualidade, é preciso combinar os seguintes elementos
    • Prompts como revisão de contratos ou redação de argumentos
    • Ambientes reais relevantes, como um data room jurídico
    • Validação dos resultados com base em critérios como o Corporate Lawyer Agent Leaderboard
  • Essas tarefas ensinam ao modelo não apenas o que fazer, mas também como executar, e quanto maior o número de tarefas de alta qualidade, maior a capacidade do modelo

A estrutura comum de crescimento de tokens e tarefas

  • Se os tokens são a unidade básica de inferência e uso do modelo, as tarefas podem ser vistas como a unidade básica de melhoria do modelo
  • A demanda por tarefas cresce com a combinação entre maior adoção de IA e aumento da necessidade de dados dos modelos de ponta
    • Há uma transição de rótulos simples de preferência para trabalhos baseados em rubricas de avaliação feitas por especialistas experientes
    • Surgem agentes especializados por área em nível profissional
    • Os agentes passam a executar tarefas em horizontes de tempo mais longos
    • Empresas adotam sistemas de avaliação em larga escala
  • Assim como no mercado de tokens de inferência, a sobreposição desses fatores impulsiona o rápido crescimento da economia das tarefas

Sinais de gastos com dados e crescimento do mercado

  • OpenAI e Anthropic estão ampliando os gastos com dados em 10x por ano ao mobilizar especialistas para produzir dados e materiais de treinamento para agentes
  • Algumas grandes empresas de aplicações de IA e empresas em geral consideram os dados uma vantagem competitiva e estão elevando os gastos relacionados a tarefas individuais para mais de US$ 100 milhões em pouco tempo
    • A avaliação é que IA aplicada com estratégia de dados diferenciada pode entregar resultados melhores do que modelos genéricos prontos para uso
  • A plataforma da economia das tarefas Mercor atingiu ARR de US$ 1 bilhão em fevereiro e registrou ARR de US$ 2 bilhões apenas 4 meses depois
  • Agentes que reproduzem trabalho em áreas avançadas ainda estão em estágio inicial, e a expansão dos gastos corporativos com dados também está apenas começando
  • Partindo da premissa de que 99% do conhecimento humano que a IA ainda precisa tratar está na cabeça das pessoas, a tendência é de ampliação do número de participantes e compradores à medida que laboratórios de IA, empresas de aplicações e empresas em geral transferem conhecimento tácito para modelos e agentes

Por que o mercado de tarefas é pouco visível

  • O primeiro motivo para as tarefas serem menos discutidas online do que os tokens é que os gastos vinham se concentrando em laboratórios de IA de ponta muito fechados
    • Esses laboratórios quase não divulgam suas estratégias de melhoria de modelos nem seus gastos com dados e tarefas
    • A situação está mudando à medida que empresas de aplicações de IA e empresas em geral entram na economia das tarefas para se diferenciar de modelos prontos
    • Como elas têm maior probabilidade de promover suas próprias iniciativas de dados, isso pode aumentar a visibilidade do mercado de tarefas
  • O segundo motivo é que ainda não existia uma unidade comum que abstraísse o valor de forma simples, como os tokens fazem no mercado de inferência
  • Se as tarefas forem usadas como unidade padronizada de valor, mesmo quem não tem conhecimento técnico poderá entender quanto o setor está investindo para melhorar as capacidades da IA
  • Hoje não existe um serviço equivalente a um “OpenRouter para tarefas” que mostre em tempo real o tamanho e o ritmo de crescimento desse mercado
    • Os dados trimestrais de horas de trabalho de especialistas da Mercor são usados como indicador indireto do crescimento do mercado

Construindo dados para toda a atividade econômica

  • Para automatizar com agentes todo o trabalho feito em notebooks, é preciso abranger as aplicações, os ambientes e a distribuição de tarefas de toda a economia
  • Para isso, será necessária uma construção de dados em larga escala em profissões especializadas, áreas acadêmicas e casos de uso para consumidores
    • Direito, medicina, finanças, software e ciência exigem, cada um, conjuntos de dados criados por especialistas
    • Também será preciso preparar separadamente sistemas de avaliação e ambientes de aprendizado por reforço para cada área
  • Laboratórios de IA, empresas de aplicações e empresas em geral vão competir ampliando a infraestrutura de dados em toda a gama de trabalhos economicamente úteis
  • Organizações que tiverem sucesso na construção de infraestrutura de dados poderão continuar melhorando capacidades de ponta e conquistar participação de mercado
  • À medida que a economia das tarefas se disseminar e se tornar visível, a indústria de IA deve passar a acompanhar, junto com os tokens, também a escala das tarefas como principal indicador de crescimento

Melhorias algorítmicas e escopo da discussão

  • As capacidades gerais de IA podem melhorar não apenas com dados, mas também com melhorias algorítmicas nos modelos
  • A exclusão das melhorias algorítmicas aqui não busca negar possibilidades futuras, mas definir o escopo da discussão para focar em dados e na economia das tarefas

Ainda não há comentários.

Ainda não há comentários.