- Echo combina, por solicitação, vários modelos de pesos abertos, como GLM-5.2 e Kimi K2.7, para contornar as limitações de delegar todas as tarefas a um único modelo
- Para cada solicitação, define a quantidade de computação e os modelos participantes, além de ajustar até a forma de combinar os resultados, usando menos recursos de inferência para prompts simples
- Na primeira configuração de avaliação, superou de forma consistente o melhor modelo individual do pool e alcançou resultados gerais semelhantes aos do Fable com cerca de um terço do custo de inferência
- Mesmo modelos mais fracos no geral podem ser úteis em problemas ou combinações específicas, pois suas capacidades são complementares, mas ainda há casos de decisões incorretas de alocação e combinação
- Foram disponibilizadas uma interface de chat e uma API compatível com OpenAI, e a equipe está testando se a mesma abordagem funciona em tarefas de codificação e de agentes, nas quais medir a qualidade é mais difícil
Seleção de modelos e combinação de resultados
- Nos experimentos iniciais, GLM-5.2, Kimi K2.7 e outros foram usados na mesma avaliação, medindo os resultados sob a suposição de que, para cada problema, já se sabia de antemão quais modelos seriam úteis e qual seria o método adequado de combinação das saídas
- Esse sistema hipotético teve desempenho muito superior ao de qualquer modelo individual incluído no pool
- Como boas decisões só podiam ser identificadas depois de verificar os resultados, isso não pode ser usado em uma implantação real; Echo é uma tentativa de recuperar parte desse benefício sem informações prévias
- De acordo com as características da solicitação, escolhe a quantidade de computação necessária, os modelos participantes e a forma de combinar os resultados
- Para prompts simples, aloca relativamente menos inferência
- Em outros problemas, configura vários modelos para tratar partes diferentes
- As capacidades dos modelos são complementares, de modo que até modelos com desempenho geral claramente inferior podem ser muito úteis em problemas ou combinações específicas
Resultados da avaliação e testes públicos
- Na primeira configuração de avaliação, registrou desempenho consistentemente superior ao do melhor modelo individual e alcançou resultados gerais aproximadamente equivalentes aos do Fable, referência da comparação, com cerca de um terço do custo
- Em algumas solicitações, toma decisões incorretas de alocação de computação ou combinação de modelos, e esses casos de falha estão sendo analisados no momento
- Em tarefas de codificação e de agentes, é muito mais difícil medir a qualidade de cada decisão, por isso a equipe está testando separadamente se a mesma abordagem se mantém
- Para testes externos, oferece a interface de chat do Echo e uma API compatível com OpenAI
- Foram publicados um vídeo de introdução ao funcionamento e detalhes sobre metodologia de avaliação, resultados de modelos individuais, custos e limitações atuais, e a equipe pede feedback sobre falhas anormais ou casos de alocação de recursos pouco intuitivos
1 comentários
Comentários do Hacker News
É um típico dark pattern: mostra uma caixa de entrada de mensagens do Echo que parece aceitar resposta e depois manda para a página de cadastro
Fui travado já na primeira ação induzida pelo site, então saí na hora e não vou voltar
Do ponto de vista de quem cria produtos de IA, também é uma escolha compreensível
Obrigado a todos que usaram o Echo e deram feedback; foi exatamente por isso que lançamos cedo
Vamos continuar publicando avaliações que mostrem com mais precisão a diferença em relação ao estado da arte atual, incluindo benchmarks mais difíceis de coding e agentes, e também expandir o painel público de avaliações. Os problemas encontrados na UI do painel de avaliações e no fluxo de cadastro já foram corrigidos em produção
A experiência com o Echo não exige cartão de crédito, e cada conta recebe US$ 10 em créditos grátis para usar na API e no chat
Estamos explorando, de forma mais ampla do que simples roteamento de modelos, como alocar recursos de inferência com eficiência entre modelos de pesos abertos. Isso decide não só qual modelo usar, mas também quanto de computação investir em cada pedido e como combinar resultados intermediários
Ensemble em si já é conhecido desde antes de random forest, mas o ponto central do Echo é modelar e aproveitar isso sem pagar o custo do ensemble completo em toda requisição. Pode ter semelhanças conceituais com Fusion ou Fugu, mas a arquitetura e os objetivos de otimização são diferentes
create passwordexige caractere especial, mas a senha gerada por padrão pelo gerenciador de senhas do Google não tem caractere especialUma combinação alfanumérica de dois dígitos de comprimento já parece suficiente, mas a ideia em si é ótima
too many authentication attemptsSem transparência, não vejo que vantagem usar modelos de pesos abertos traz para o usuário final
A descrição
resultados nível Fable por um terço do custonão parece muito atraente para usuários do plano de US$ 200 por mês fortemente subsidiadoNão sei até quando esse plano vai durar, mas enquanto isso um terço do preço da API pública também não parece tão atraente
Vários subagentes rodaram ao mesmo tempo, e o Claude esqueceu a instrução de usar modelos baratos, então várias instâncias do Fable ficaram em execução, mas a cobrança por token é difícil de sustentar. US$ 200 por mês já é caro, mas US$ 200 em uma noite é absurdo
Se um usuário de US$ 200 por mês consumir US$ 10.000 em créditos de API, a margem por usuário é de -98%, o que não ajuda no resultado financeiro
Ainda será possível usá-lo, mas serão necessários créditos pay-as-you-go, e isso não contará nos limites de uso do plano de assinatura
Não me surpreenderia se, nos próximos anos, o conceito de melhor modelo virasse algo de nicho
Na maioria dos sistemas em operação, o vencedor pode ser o orquestrador que sabe quando usar um modelo barato, quando trocar para um modelo forte e quando combinar várias saídas
A grande tendência são os modelos embarcados no dispositivo, e também pode haver um modelo em que o modelo fique no die do chip e o chipset seja trocado a cada poucos anos. Nesse cenário, os grandes provedores de nuvem sairiam perdendo
Uma das conclusões mais interessantes é que a escolha do modelo pode ser mais importante que o tamanho do modelo
O setor tem focado em modelos maiores, mas parece que rotear solicitações de forma inteligente para a combinação certa de modelos especializados pode gerar melhorias muito maiores a um custo bem menor
Modelos fracos também não ficaram inúteis; cada um se destaca em áreas diferentes, e seu valor pode aumentar muito quando combinado com outros modelos. Ainda assim, fico curioso se isso também vale para tarefas de coding e agentes, em que a seleção adequada de modelos é muito mais difícil
Tarefas de agentes e coding são mais complexas por causa da granularidade. É preciso decidir quando e como usar cada modelo, e em qual camada de abstração — sessão, objetivo, tarefa, turno da conversa ou chamada de ferramenta — e isso está sendo pesquisado ativamente agora
De fato encontrei alguns problemas de experiência do usuário
Thinkingfica aparecendo o tempo todo, dando a impressão de que travou ou houve problema de rede, e não dá para expandir nem redimensionar o painel esquerdo onde se digita o prompt. Quando peço para gerar código, a saída continua sendo interrompida e reiniciada do zero, sem conseguir continuar a conversa anteriorEssa abordagem não funciona bem se você não souber antecipadamente a complexidade do problema e não houver garantia de que as conversas seguintes serão enviadas ao mesmo modelo
Se a mesma conversa for enviada em round robin para vários modelos, o cache se quebra, e isso pode acabar custando mais do que um sistema que leva cache em conta
Usei o Anthropic Opus 4.8 e o Fable 5 por um tempo, e também testei os modelos mais recentes da OpenAI, mas todos geram saída desnecessária em excesso
Comecei a testar outros modelos não por preço, mas por qualidade, e na minha área de trabalho o GLM 5.2 é muito superior ao Fable 5 em todos os aspectos. É quase surpreendente quando ele não consegue concluir uma tarefa com sucesso
O Kimi K2.7 exige um pouco mais de instrução, mas oferece uma experiência melhor que o Opus 4.8; ainda não consegui testar o K3. Os modelos mais recentes da OpenAI são absurdamente ruins em projeto e implementação de software
Essa avaliação se limita à minha área de trabalho, que envolve muita análise de dados, machine learning e engenharia de software
Não há benchmarks nem informação sobre os modelos usados, só um vídeo gerado por IA e uma página de cadastro
Isso me lembra a piada de arquitetura: “transformamos o monólito em microsserviços e fizemos cada falha parecer um mistério de assassinato”
No momento, ele expõe 907 linhas salvas em 7 famílias de benchmarks, e é possível ver prompts, saídas, avaliações e registros de custo; pretendem adicionar mais
Como a própria política de roteamento por requisição é o produto, ela não é divulgada, mas eles podem divulgar parte da lista de modelos open weight utilizáveis, datas de versão, proporções totais de alocação e configurações de avaliação, desde que isso não revele o segredo por requisição. Um novo vídeo também está sendo produzido
Não são bons benchmarks, mas pelo menos existem
É uma pena porque parece mais uma tentativa de dizer aos investidores “o OpenRouter virou unicórnio, então eu também posso fazer algo parecido com vibe coding” do que de resolver um problema real
Chamar isso de
nível Fabletambém parece intelectualmente preguiçoso ou desonestoFico me perguntando se isso é fazer o Dogpile.com de novo, agregando resultados do Ask Jeeves, AltaVista e Lycos. Parece que o tempo é cíclico
Nós também implementamos a mesma abordagem: https://trustedrouter.com/blog/prometheus-2-new-draco-state-...
Outros produtos recentes de gateway de IA, como OpenRouter, JusCode e Fireworks, também recomendam essa mesma composição, então é bem possível que haja utilidade nisso