1 pontos por GN⁺ 2024-01-29 | 1 comentários | Compartilhar no WhatsApp
  • A partir do navegador desktop Brave v1.62, o LLM padrão do Leo, assistente de navegador com IA focado em privacidade, mudou para o Mixtral 8x7B
  • O Mixtral 8x7B é um LLM open source divulgado pela Mistral AI em dezembro; por sua velocidade, desempenho e natureza de modelo aberto, alinhados à direção de produto da Brave, ele foi integrado ao Leo
  • A Brave afirma que o Mixtral 8x7B supera ChatGPT 3.5, Claude Instant, Llama 2 e outros no LMSYS Chatbot Arena Leaderboard, e que mostra melhorias na redução de alucinações e vieses no benchmark BBQ
  • Tanto o Leo gratuito quanto o Premium de US$ 15 por mês oferecem o Mixtral 8x7B por padrão, mas a versão gratuita tem limites de uso mais rigorosos, enquanto o Premium oferece limites mais altos
  • O Leo anonimiza as solicitações por meio de um proxy reverso, não armazena conversas nem as usa para treinar modelos, e pode ser usado pela barra de endereço ou pela barra lateral, sem app separado

Modelo padrão do Leo muda para Mixtral 8x7B

  • A Brave substituiu o modelo de linguagem grande padrão do Leo pelo Mixtral 8x7B junto com a atualização do navegador desktop para a v1.62
  • O Leo é um assistente de navegador com IA focado em privacidade oferecido pela Brave, permitindo usar recursos de IA diretamente no navegador
  • Além da mudança de modelo, esta atualização inclui onboarding mais claro, controle de contexto, formatos de entrada e resposta, e melhorias gerais de UI

Por que escolher o Mixtral 8x7B

  • O Mixtral 8x7B é um LLM open source divulgado pela Mistral AI em dezembro e ganhou adoção rapidamente na comunidade de desenvolvedores por causa de sua velocidade e desempenho
  • Pelo LMSYS Chatbot Arena Leaderboard, ele apresenta desempenho superior ao ChatGPT 3.5, Claude Instant, Llama 2 e outros
  • Pelo benchmark BBQ, também há melhorias na redução de alucinações e vieses
  • Os principais recursos são:
    • Processamento de contexto maior
    • Interações em inglês, francês, alemão, italiano e espanhol
    • Geração de código

Uso do Mixtral dentro dos produtos da Brave

  • A Brave já usa o Mixtral no Code LLM, recurso do Brave Search para consultas relacionadas a programação
  • O desempenho do Mixtral e sua natureza open source estão alinhados ao apoio da Brave a modelos abertos e à comunidade open source
  • Brian Bondy, CTO e cofundador da Brave, afirmou que o Leo foi adotado por dezenas de milhares de usuários gratuitos e assinantes pagos, e que espera uma adoção ainda maior com a inclusão do Mixtral
  • Arthur Mensch, CEO da Mistral AI, avaliou positivamente o uso do Mixtral no CodeLLM do Brave Search e no Brave Leo

Opções de modelos gratuito e Premium

  • O Leo permite escolher entre vários modelos conforme a necessidade e o orçamento
  • O Mixtral 8x7B é oferecido como LLM padrão tanto na versão gratuita quanto no Premium
  • Ambos os planos também oferecem suporte ao Claude Instant, da Anthropic, e ao Llama 2 13B, da Meta
  • As condições de uso do Leo gratuito são:
    • Mixtral 8x7B e Claude Instant têm limites de uso rigorosos
    • Llama 2 13B tem limites de uso mais altos
    • Ao atingir o limite de uso do Mixtral, é possível voltar à experiência anterior do Leo, com Llama 2, e continuar usando IA
  • O Leo Premium custa US$ 15 por mês e oferece Mixtral 8x7B, Claude Instant e Llama 2 13B com limites de uso mais altos

Como a privacidade é protegida

  • O chat do Leo foi projetado com a premissa de ser privado, anônimo e seguro
  • Os chats não são registrados nem usados para treinar modelos, e não é necessário ter conta ou fazer login para usar
  • As proteções de privacidade incluem:
    • Proxy reverso: todas as solicitações são roteadas por um servidor de anonimização, impedindo a associação entre a solicitação e o endereço do usuário
    • Descarte imediato da resposta: as respostas do Leo são descartadas logo após a geração, e as conversas não são armazenadas nos servidores da Brave
    • Não coleta de identificadores: não são coletados identificadores que possam ser vinculados ao usuário, como endereço IP
    • Sem retenção por provedores terceiros: modelos de IA ou provedores terceiros de modelos não retêm dados pessoais
    • Conta desnecessária: é possível usar o Leo sem criar uma conta Brave
    • Token de assinatura não vinculável: ao assinar o Leo Premium, a assinatura é verificada por um token que não permite vincular as informações de compra ao uso do produto

Como usar e disponibilidade

  • O Leo é integrado ao navegador e pode ser usado sem app ou extensão separados
  • Usuários do Brave desktop podem digitar uma pergunta na barra de endereço e clicar em “Ask Leo”, ou abrir o Leo pela Brave Sidebar
  • Os recursos de IA podem ser acessados por uma barra lateral em formato de chat ao lado da página web ou pela barra de endereço
  • No contexto da página, ele oferece suporte às seguintes tarefas:
    • Resumo em tempo real de páginas web ou vídeos
    • Perguntas e respostas sobre o conteúdo
    • Criação de novo conteúdo
    • Tradução de páginas
    • Análise de páginas
    • Reescrita de frases
    • Suporte à escrita de código
  • O Leo está disponível para usuários do Brave desktop desde novembro, e essa versão é a 1.60
  • O Leo para Android e iOS será disponibilizado em breve

1 comentários

 
GN⁺ 2024-01-29
Opiniões no Hacker News
  • Para rodar o Mixtral 8x7B localmente, dá para usar o llama.cpp e, junto com bibliotecas/interfaces de suporte como text-generation-webui, usar https://huggingface.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-S...
    Até a menor versão com quantização de 2 bits precisa de 20 GB de RAM, e dá para fazer offload para a VRAM de uma boa GPU 4090
    A versão com quantização de 4 bits é o maior modelo que cabe por pouco em um sistema de 32 GB e usa algo em torno de 29 a 31 GB
    6 bits exige 41 GB, e 8 bits exige 52 GB, então é necessário um sistema de 64 GB; para fazer offload de modelos com maior precisão para a VRAM, são necessárias várias GPUs com memória compartilhada
    Já usei modelos 7B e 13B, mas ainda não experimentei este modelo nem outros modelos maiores

    • Se quiser mais desempenho em código, também pode testar o fine-tuning dolphin-mixtral: https://huggingface.co/TheBloke/dolphin-2.7-mixtral-8x7b-GGU...
    • Em vez de várias GPUs, talvez uma máquina Apple Silicon poderosa dê conta
      Usei o dolphin mixtral 4 bits em um MacBook M3 com 36 GB de RAM e a inferência foi muito rápida
    • 2 bits é bem ruim, então é difícil recomendar para uso sério
    • Prefiro o koboldcpp ao llama.cpp
      É mais fácil rodar modelos maiores que a VRAM dividindo entre GPU/CPU
    • Ao falar de requisitos de memória, também é preciso considerar o comprimento da sequência
      O Mixtral suporta 32.000 tokens, então isso pode representar uma parcela bem grande da memória usada
  • A Brave merece elogios por este recurso e por outros recursos de privacidade
    Como usa tokens de assinatura não vinculáveis, ao assinar o Leo Premium é emitido um token que valida a assinatura ao usar o Leo, e a Brave não consegue vincular as informações de pagamento ao histórico de uso do produto
    O e-mail usado para criar a conta também não é associado ao uso cotidiano do Leo, então é um método bastante singular de credenciais privadas

    • Muito legal, e eu gostaria de colocar isso também no meu app
      Fico curioso se alguém sabe exatamente como isso funciona sem usar chaves estrangeiras
  • Acho que perdi o primeiro anúncio do Leo, mas parece interessante, e gostei do design preocupado com privacidade
    O fato de não armazenarem o histórico de conversas era o que eu queria

  • Fico curioso para saber quais são os bons provedores de API que oferecem Mixtral
    Só conheço a OctoAI, que parece boa, e gostaria de saber alternativas

    • A própria criadora do modelo também opera sua própria plataforma, e é possível usar este e outros modelos via API: https://console.mistral.ai/
    • Acabei de descobrir a Groq, e dizem que ela chega a 485,08 tokens/s no mixtral 8x7B-32k
      Não sei o preço, mas parece que basta enviar um e-mail para api@groq.com
    • O OpenRouter é, em geral, uma boa opção, e o melhor é que oferece uma API unificada para todos os LLMs
      O preço também é igual ao dos próprios provedores
      Porém, para os modelos da OpenAI/Anthropic, foi preciso ativar filtragem de entrada/saída por exigência dessas empresas
    • Embora sejam serviços já mencionados, tenho usado bastante bem o Anyscale Endpoints
      É muito rápido e, mesmo com as configurações padrão, processa 10 tarefas simultaneamente
      O Together.ai também pareceu bom nos testes iniciais, mas ainda não usei em grande escala
    • Usei tanto a API comercial da Mistral quanto a API comercial da AnyScale com o mixtral-8-7b, e ambas foram fáceis de usar
      Também rodo uma versão com quantização de 3 bits do mixtral-8-7b em um sistema M2 Pro com 32 GB de memória, e ela é bem rápida
      É bom haver várias opções
  • Na última semana, testei as versões disponíveis no poe e no chat.groq.com
    É muito melhor que o llama 70b

  • É interessante terem permitido fazer consultas a LLM diretamente pela barra de endereços
    Fico curioso para saber se, no futuro, eles criarão uma heurística para decidir se enviam a consulta diretamente ao LLM ou se usam o provedor de busca padrão

  • Depois de usar gpt4, usar mistral dá a sensação de sair de uma tela Retina e voltar para uma tela de baixa resolução
    Você fica pensando o tempo todo: “mas o GPT4 conseguiria fazer isso”

    • Fico curioso se você já testou o mixtral
  • Estou rodando o Mixtral localmente com ollama

  • Fico curioso se existe uma boa extensão do Chrome que resuma páginas com IA
    Testei alguns dos principais resultados da Busca Google e eles funcionam bem, mas eram inchados demais, com muitos recursos desnecessários