1 pontos por GN⁺ 3 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Echo combina, por solicitação, vários modelos de pesos abertos, como GLM-5.2 e Kimi K2.7, para contornar as limitações de delegar todas as tarefas a um único modelo
  • Para cada solicitação, define a quantidade de computação e os modelos participantes, além de ajustar até a forma de combinar os resultados, usando menos recursos de inferência para prompts simples
  • Na primeira configuração de avaliação, superou de forma consistente o melhor modelo individual do pool e alcançou resultados gerais semelhantes aos do Fable com cerca de um terço do custo de inferência
  • Mesmo modelos mais fracos no geral podem ser úteis em problemas ou combinações específicas, pois suas capacidades são complementares, mas ainda há casos de decisões incorretas de alocação e combinação
  • Foram disponibilizadas uma interface de chat e uma API compatível com OpenAI, e a equipe está testando se a mesma abordagem funciona em tarefas de codificação e de agentes, nas quais medir a qualidade é mais difícil

Seleção de modelos e combinação de resultados

  • Nos experimentos iniciais, GLM-5.2, Kimi K2.7 e outros foram usados na mesma avaliação, medindo os resultados sob a suposição de que, para cada problema, já se sabia de antemão quais modelos seriam úteis e qual seria o método adequado de combinação das saídas
    • Esse sistema hipotético teve desempenho muito superior ao de qualquer modelo individual incluído no pool
    • Como boas decisões só podiam ser identificadas depois de verificar os resultados, isso não pode ser usado em uma implantação real; Echo é uma tentativa de recuperar parte desse benefício sem informações prévias
  • De acordo com as características da solicitação, escolhe a quantidade de computação necessária, os modelos participantes e a forma de combinar os resultados
    • Para prompts simples, aloca relativamente menos inferência
    • Em outros problemas, configura vários modelos para tratar partes diferentes
  • As capacidades dos modelos são complementares, de modo que até modelos com desempenho geral claramente inferior podem ser muito úteis em problemas ou combinações específicas

Resultados da avaliação e testes públicos

  • Na primeira configuração de avaliação, registrou desempenho consistentemente superior ao do melhor modelo individual e alcançou resultados gerais aproximadamente equivalentes aos do Fable, referência da comparação, com cerca de um terço do custo
  • Em algumas solicitações, toma decisões incorretas de alocação de computação ou combinação de modelos, e esses casos de falha estão sendo analisados no momento
  • Em tarefas de codificação e de agentes, é muito mais difícil medir a qualidade de cada decisão, por isso a equipe está testando separadamente se a mesma abordagem se mantém
  • Para testes externos, oferece a interface de chat do Echo e uma API compatível com OpenAI
  • Foram publicados um vídeo de introdução ao funcionamento e detalhes sobre metodologia de avaliação, resultados de modelos individuais, custos e limitações atuais, e a equipe pede feedback sobre falhas anormais ou casos de alocação de recursos pouco intuitivos

1 comentários

 
GN⁺ 3 시간 전
Comentários do Hacker News
  • É um típico dark pattern: mostra uma caixa de entrada de mensagens do Echo que parece aceitar resposta e depois manda para a página de cadastro
    Fui travado já na primeira ação induzida pelo site, então saí na hora e não vou voltar

    • Senti exatamente a mesma coisa, e odeio tanto esse tipo de dark pattern que agora não tenho nenhum interesse neste produto
    • Estamos removendo isso agora
    • Por outro lado, se permitirem pedidos antes do login, o criador precisa arcar com o custo das consultas iniciais, e isso pode gerar contas enormes por abuso
      Do ponto de vista de quem cria produtos de IA, também é uma escolha compreensível
  • Obrigado a todos que usaram o Echo e deram feedback; foi exatamente por isso que lançamos cedo
    Vamos continuar publicando avaliações que mostrem com mais precisão a diferença em relação ao estado da arte atual, incluindo benchmarks mais difíceis de coding e agentes, e também expandir o painel público de avaliações. Os problemas encontrados na UI do painel de avaliações e no fluxo de cadastro já foram corrigidos em produção
    A experiência com o Echo não exige cartão de crédito, e cada conta recebe US$ 10 em créditos grátis para usar na API e no chat
    Estamos explorando, de forma mais ampla do que simples roteamento de modelos, como alocar recursos de inferência com eficiência entre modelos de pesos abertos. Isso decide não só qual modelo usar, mas também quanto de computação investir em cada pedido e como combinar resultados intermediários
    Ensemble em si já é conhecido desde antes de random forest, mas o ponto central do Echo é modelar e aproveitar isso sem pagar o custo do ensemble completo em toda requisição. Pode ter semelhanças conceituais com Fusion ou Fugu, mas a arquitetura e os objetivos de otimização são diferentes

    • Como pequeno feedback, create password exige caractere especial, mas a senha gerada por padrão pelo gerenciador de senhas do Google não tem caractere especial
      Uma combinação alfanumérica de dois dígitos de comprimento já parece suficiente, mas a ideia em si é ótima
    • Fico me perguntando por que usaram dark pattern. Eu estava interessado, mas agora passou
    • Tentei me cadastrar só uma vez e mesmo assim apareceu o erro too many authentication attempts
    • Vocês precisam remover o dark pattern
    • Continuam enfatizando pesos abertos, mas não revelam quais modelos usam
      Sem transparência, não vejo que vantagem usar modelos de pesos abertos traz para o usuário final
  • A descrição resultados nível Fable por um terço do custo não parece muito atraente para usuários do plano de US$ 200 por mês fortemente subsidiado
    Não sei até quando esse plano vai durar, mas enquanto isso um terço do preço da API pública também não parece tão atraente

    • No plano de US$ 200 por mês, depois de esgotar o uso semanal do Fable, rodei um plano de coding de porte médio com US$ 200 em créditos promocionais e gastei US$ 120 em 1 hora e 15 minutos
      Vários subagentes rodaram ao mesmo tempo, e o Claude esqueceu a instrução de usar modelos baratos, então várias instâncias do Fable ficaram em execução, mas a cobrança por token é difícil de sustentar. US$ 200 por mês já é caro, mas US$ 200 em uma noite é absurdo
    • Clientes corporativos que usam isso no trabalho não podem usar um plano subsidiado, então é provável que esse tipo de plano represente uma minoria do uso total
    • Esse plano deve continuar até o IPO, mas provavelmente não muito depois disso
      Se um usuário de US$ 200 por mês consumir US$ 10.000 em créditos de API, a margem por usuário é de -98%, o que não ajuda no resultado financeiro
    • A conversa muda se o objetivo for evitar limites de uso ou suspensão de conta ao cruzar certos limites
    • Segundo um e-mail que recebi hoje da Anthropic, o Fable 5 vai mudar para um sistema de créditos de uso a partir de 20 de julho
      Ainda será possível usá-lo, mas serão necessários créditos pay-as-you-go, e isso não contará nos limites de uso do plano de assinatura
  • Não me surpreenderia se, nos próximos anos, o conceito de melhor modelo virasse algo de nicho
    Na maioria dos sistemas em operação, o vencedor pode ser o orquestrador que sabe quando usar um modelo barato, quando trocar para um modelo forte e quando combinar várias saídas

    • Será que essa não é a ideia do Gemini CLI?
    • Há muitos caminhos possíveis de evolução, mas no fim parece que tudo converge para uma direção em que o melhor modelo vira um conceito de nicho
      A grande tendência são os modelos embarcados no dispositivo, e também pode haver um modelo em que o modelo fique no die do chip e o chipset seja trocado a cada poucos anos. Nesse cenário, os grandes provedores de nuvem sairiam perdendo
  • Uma das conclusões mais interessantes é que a escolha do modelo pode ser mais importante que o tamanho do modelo
    O setor tem focado em modelos maiores, mas parece que rotear solicitações de forma inteligente para a combinação certa de modelos especializados pode gerar melhorias muito maiores a um custo bem menor
    Modelos fracos também não ficaram inúteis; cada um se destaca em áreas diferentes, e seu valor pode aumentar muito quando combinado com outros modelos. Ainda assim, fico curioso se isso também vale para tarefas de coding e agentes, em que a seleção adequada de modelos é muito mais difícil

    • Dá para obter resultados muito interessantes fazendo ensemble forte de modelos pequenos especializados em cada tarefa e com baixa correlação entre si
      Tarefas de agentes e coding são mais complexas por causa da granularidade. É preciso decidir quando e como usar cada modelo, e em qual camada de abstração — sessão, objetivo, tarefa, turno da conversa ou chamada de ferramenta — e isso está sendo pesquisado ativamente agora
  • De fato encontrei alguns problemas de experiência do usuário
    Thinking fica aparecendo o tempo todo, dando a impressão de que travou ou houve problema de rede, e não dá para expandir nem redimensionar o painel esquerdo onde se digita o prompt. Quando peço para gerar código, a saída continua sendo interrompida e reiniciada do zero, sem conseguir continuar a conversa anterior

  • Essa abordagem não funciona bem se você não souber antecipadamente a complexidade do problema e não houver garantia de que as conversas seguintes serão enviadas ao mesmo modelo
    Se a mesma conversa for enviada em round robin para vários modelos, o cache se quebra, e isso pode acabar custando mais do que um sistema que leva cache em conta

  • Usei o Anthropic Opus 4.8 e o Fable 5 por um tempo, e também testei os modelos mais recentes da OpenAI, mas todos geram saída desnecessária em excesso
    Comecei a testar outros modelos não por preço, mas por qualidade, e na minha área de trabalho o GLM 5.2 é muito superior ao Fable 5 em todos os aspectos. É quase surpreendente quando ele não consegue concluir uma tarefa com sucesso
    O Kimi K2.7 exige um pouco mais de instrução, mas oferece uma experiência melhor que o Opus 4.8; ainda não consegui testar o K3. Os modelos mais recentes da OpenAI são absurdamente ruins em projeto e implementação de software
    Essa avaliação se limita à minha área de trabalho, que envolve muita análise de dados, machine learning e engenharia de software

  • Não há benchmarks nem informação sobre os modelos usados, só um vídeo gerado por IA e uma página de cadastro
    Isso me lembra a piada de arquitetura: “transformamos o monólito em microsserviços e fizemos cada falha parecer um mistério de assassinato”

    • O avaliador público está em https://echo.tracerml.ai/eval/
      No momento, ele expõe 907 linhas salvas em 7 famílias de benchmarks, e é possível ver prompts, saídas, avaliações e registros de custo; pretendem adicionar mais
      Como a própria política de roteamento por requisição é o produto, ela não é divulgada, mas eles podem divulgar parte da lista de modelos open weight utilizáveis, datas de versão, proporções totais de alocação e configurações de avaliação, desde que isso não revele o segredo por requisição. Um novo vídeo também está sendo produzido
    • Os benchmarks estão em https://echo.tracerml.ai/eval/
      Não são bons benchmarks, mas pelo menos existem
    • Essencialmente, parece uma tentativa de recriar o OpenRouter. O OpenRouter é uma abstração de infraestrutura inteligente que abstrai provedores específicos com failover, medição de uso, troca automática etc., e funciona muito bem
      É uma pena porque parece mais uma tentativa de dizer aos investidores “o OpenRouter virou unicórnio, então eu também posso fazer algo parecido com vibe coding” do que de resolver um problema real
      Chamar isso de nível Fable também parece intelectualmente preguiçoso ou desonesto
    • Isso me lembra a frase do tenderlove: “microsserviços transformam chamada de função em um problema de computação distribuída
    • Pelo que eu sei, apps protegidos por login não são permitidos no Show HN
  • Fico me perguntando se isso é fazer o Dogpile.com de novo, agregando resultados do Ask Jeeves, AltaVista e Lycos. Parece que o tempo é cíclico

    • Boas ideias, em geral, continuam boas mesmo quando a época e as ferramentas mudam
    • Modelos em ensemble sempre tiveram o melhor desempenho no Kaggle
      Nós também implementamos a mesma abordagem: https://trustedrouter.com/blog/prometheus-2-new-draco-state-...
    • É uma abordagem de não usar o mesmo tamanho de instância EC2 para todo tipo de trabalho do serviço
    • Você até pode fazer uma roda triangular, mas existe um motivo para rodas serem redondas
    • Pode ser visto como uma Mistura de Modelos (Mixture of Models)
      Outros produtos recentes de gateway de IA, como OpenRouter, JusCode e Fireworks, também recomendam essa mesma composição, então é bem possível que haja utilidade nisso