1 pontos por GN⁺ 4 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Nativ é um app open source com licença MIT que baixa e executa modelos abertos de IA em Macs com Apple Silicon sem conta, assinatura ou nuvem
  • Oferece modelos da Google, Cohere, Liquid AI e outras, recomenda modelos adequados ao hardware do Mac e gera todas as respostas localmente
  • No chat, oferece streaming, Markdown, destaque de código e entrada de imagem, e permite acompanhar em tempo real o estado de desempenho, como tokens por segundo e pressão de memória
  • É otimizado para o Metal e a memória unificada da linha M com MLX-VLM para lidar com tarefas de linguagem, visão, vídeo, código e áudio
  • O servidor local de modelos pode ser conectado a Pi, Codex, Claude Code, Hermes e OpenCode, e todo o código do app e do carregador de modelos também está disponível

Execução local de modelos otimizada para Mac

  • App universal para macOS com suporte a Apple Silicon M1 ou superior, que roda modelos reais no Mac sem nuvem nem camada extra de conversão
  • É possível escolher modelos abertos da Google, Cohere e Liquid AI em uma biblioteca selecionada, e também receber recomendações de modelos adequados ao hardware
  • A interface de chat oferece os seguintes recursos
    • Respostas em streaming e métricas de desempenho por mensagem
    • Markdown e destaque de sintaxe de código
    • Entrada de imagem
  • Com medição de desempenho em tempo real, é possível verificar tokens por segundo, pressão de memória, estado térmico e tempo até o primeiro token
  • Baseado em MLX-VLM, ajustado para a memória unificada e o Metal da linha M
  • Suporta chat com LLM, geração de legendas de imagem, resumo de vídeo, autocompletar de código, conversão de voz e geração de áudio
  • Não exige conta, créditos ou assinatura, e não vende dados do usuário

Integração com ferramentas de desenvolvimento e princípios open source

  • Com o endpoint local único do Nativ, é possível conectar agentes de programação existentes a modelos locais em execução no Mac
    • Pi
    • Codex
    • Claude Code
    • Hermes
    • OpenCode
  • Todo o código, incluindo o app desktop, o carregador de modelos e os gráficos de medição de desempenho, está aberto para visualização, fork e Pull Request
  • É distribuído sob a licença MIT, sem roadmap de VC, nível enterprise ou dark patterns que transformem prompts em dados de treinamento
  • A biblioteca completa de modelos pode ser consultada no Hugging Face

1 comentários

 
GN⁺ 4 시간 전
Comentários do Hacker News
  • Este app com licença MIT foi criado por Prince Canuma, que mantém a popular biblioteca MLX-VLM. O MLX-VLM já é usado há muito tempo como dependência de ferramentas como o LM Studio, pois pode oferecer inferência mais rápida que o llama.cpp em dispositivos Apple
    O ecossistema MLX é menor que o CUDA, mas dá suporte muito rápido a novos modelos, especialmente modelos multimodais como visão, reconhecimento de fala, síntese de voz e geração de vídeo. Também vale conferir o mlx-audio-swift, e não seria surpresa se modelos assim fossem integrados a esta UI
    A landing page pode até ter sinais de vibe coding, mas a maior parte do app foi escrita em Swift, então também parece fácil portar essa stack de inferência para iPad e iPhone

    • Hoje em dia, o Hugging Face já tem versões MLX de quase todos os modelos populares. Por exemplo, na página principal do Qwen 3.6 35B-A3B, basta seguir o link de quantização e escolher uma variante MLX popular e bem avaliada
    • Fiquei feliz em ver blaizzy no domínio, porque o trabalho do Prince Canuma com MLX sempre teve qualidade acima da média
    • No repositório do GitHub está escrito que suporte a modelos só de áudio e só de geração de imagem será adicionado em breve. Prince Canuma responde muito rápido no X e nas issues do GitHub, e eu uso mlx-audio e mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16 para clonagem de voz quase todos os dias
    • A primeira pergunta que me veio à cabeça foi: o que isso tem de diferente em relação ao Unsloth?
    • O mlx-vlm, ao contrário do vllm ou do sglang, tem suporte muito fraco a samplers modernos, então migrar pode acabar sendo pior. Sou um dos autores do artigo sobre min_p, e se min_p for o melhor cenário quando o llama.cpp já suporta um top-n-sigma bem superior, então não há motivo para mudar só por ser mais rápido
      Para suporte a samplers modernos, dá para começar pelos artigo 1, artigo 2 e artigo 3
  • Parece que a expressão frontier está sendo usada em excesso. Eu achava que significava modelos de topo como o Fable atual, mas modelos assim não exigem RAM enorme e GPUs caras, a ponto de serem difíceis de hospedar por conta própria?

    • Aqui parece significar a fronteira de Pareto, o conjunto das melhores soluções em um problema de otimização multiobjetivo. Se considerarmos inteligência e preço, um modelo está na fronteira quando não existe outro que ofereça a mesma ou maior inteligência por um preço menor, nem outro mais inteligente pelo mesmo preço ou menos
      O gráfico do Artificial Analysis deixa isso intuitivo. Por exemplo, não existe um modelo tão inteligente quanto o DeepSeek V4 Pro e mais barato, então ele pode ser visto como um modelo frontier. Uma solução na fronteira de Pareto é a melhor dentro da sua categoria, sem poder ser trocada por algo melhor sem abrir mão de outra coisa
    • Acho difícil concordar com esse uso porque ele causa confusão, mas em geral podem existir várias fronteiras, e considero que a fronteira dos pequenos modelos locais com pesos abertos é a mais importante e interessante
      Sempre que uso o Gemma 4 12B, fico com a sensação de que ele é pequeno, inteligente e eficiente, e mesmo assim a energia da indústria de IA está indo totalmente na direção errada. Se o financiamento de pesquisa se concentrasse em melhorar modelos que rodem em sistemas com 16 GB de memória unificada, seria possível ter avanços importantes
      O Qwen 3.6 e o modelo ajustado de 27B da BottleCap também são bons, mas o desempenho surpreendente dos modelos pequenos do Gemma 4 ainda não é amplamente conhecido. Pode parecer inadequado esse site chamar o Qwen 3.6 27B de frontier, mas em termos de desempenho também não é algo tão distante da realidade
    • Frontier é definido por uma combinação ótima em várias dimensões, como número de parâmetros, desempenho por tarefa, velocidade de geração de tokens no mesmo hardware e exigência de memória ativa. Um modelo entra na fronteira quando, entre as opções atuais, melhorar uma métrica implica piorar uma ou mais outras
    • Frontier é uma curva; significa frente de Pareto
    • A distância entre open source e a linha de frente está diminuindo com modelos como o Kimi K3, mas o Kimi K3 tem mais de 2 trilhões de parâmetros. Coisas como o Gemma 4, que realmente dá para rodar num Mac comum, não estão na mesma categoria
  • Fiquei surpreso com a homepage, como se não existissem apps já estabelecidos como o LM Studio. À primeira vista, não fica claro o que ele tem de diferente, e o Open WebUI também foi ignorado
    Estou rodando DeepSeek V4 Flash localmente há semanas no meu MacBook Pro com Open WebUI e DS4

    • O LM Studio é um software fechado feito com base em código publicado pelo desenvolvedor do Nativ
    • O LM Studio também faz a mesma coisa, mas não é open source. Então o Nativ tem, sim, um diferencial adicional
    • A frase “outros apps locais de IA que você conhece são shells proprietários construídos sobre engines open source que eles não possuem” é uma cutucada indireta no LM Studio
    • Fiquei curioso sobre as especificações do MacBook. No meu Strix Halo, o DeepSeek V4 Flash é lento demais para uso com agentes
  • Agora frontier virou uma palavra usada em excesso, como load-bearing, que usuários do Claude Code devem conhecer. Principalmente porque este app não consegue rodar de fato os modelos de ponta localmente num Mac, então seria melhor parar de usar esse termo

  • Não gosto de frases de marketing como “por que somos open source quando ninguém mais é”. Eu uso o oMLX, que é open source, e aparentemente oferece todas as funções do Nativ
    Seria bom comparar de forma adequada com os concorrentes open source existentes, em vez de tratá-los como se não existissem

    • Talvez a intenção fosse dizer por que opções como o LM Studio não são open source
  • Fico curioso sobre onde, na prática, os pequenos modelos locais estão sendo usados. Eles ficaram bem capazes, mas ainda é difícil confiar neles para assumir trabalho real além de alguns projetinhos de brincadeira feitos por diversão
    Queria saber se as pessoas realmente usam isso em agentes de código ou se é mais para outros usos

    • Já coloquei em produção código gerado pelo Qwen3.6 27B no OpenCode. Ele não tem um alcance de conhecimento tão amplo quanto o Opus, mas, se conseguir inferir completamente as mudanças só com o prompt e o código ao redor, funciona muito bem
      É difícil escrever do zero código que exija conhecimento especializado, como um motor de inferência de alto desempenho para GPUs Blackwell, mas PRs comuns que adicionam casos de uso a projetos existentes ficam em um nível parecido com o Sonnet. É preciso a configuração correta, como temperature e top-p recomendados, quantização sem exagero e pelo menos 150 mil tokens de contexto
    • Uso o Gemma 4 localmente para extração de grafo de memória de um agente pessoal. Ele divide as mensagens em tópicos, fontes, fatos, entidades etc. e coloca isso em um grafo para busca usando NLEmbeddings
      O agente principal usa DeepSeek V4 Flash, e o modelo local é lento demais para servir como agente de chat, mas funciona muito bem para extração de memória, reduzindo o uso de API a cada turno da conversa
    • Não uso como agente de código, mas é muito útil para transformação de texto, resumo e extração de informações. Se você já assina modelos pagos, talvez não haja um ganho especial além de privacidade, mas isso por si só já não é algo desprezível
    • Mesmo modelos pequenos dão conta de tarefas repetitivas como atualizar dependências, resolver conflitos de merge, --help, escrever Markdown e README. Se der errado, basta voltar com git restore ou rejeitar o PR e pedir de novo para um modelo melhor
    • O Qwen35ba3b consegue fazer limpeza de dados em grande escala até em hardware relativamente comum. Já processei cerca de 100 bilhões de tokens com duas GPUs 3090
  • Queria saber o que ele tem de melhor em relação ao LM Studio e se também roda modelos MTP. Pelo que sei, os modelos MTP usam o formato GGUF

  • Testei MLX com Rapid MLX, mas o Qwen ficava travando e repetindo a mesma coisa. Quando mudei para llama.cpp, a geração de tokens no MTP ficou mais rápida e o modelo também ficou mais estável
    Fico curioso sobre os resultados que outras pessoas tiveram ao comparar MLX e llama.cpp

    • No M1 Max, quase não vi vantagem no MLX. Pode ser que o ganho seja maior no M3 ou superior por causa das mudanças no Apple Neural Engine
      Nos modelos que testei, em alguns casos o desempenho em GGUF no llama.cpp era melhor. O MTP do Gemma 4 não teve muito valor, mas no Qwen 3.6 MoE houve uma diferença mensurável, e em hardware mais recente isso pode ser mais relevante
    • Testei o MLX duas vezes em momentos diferentes, mas nas duas vezes ele mostrou desempenho consideravelmente inferior ao do llama.cpp
  • Queria saber qual seria uma configuração intermediária de Mac adequada para esse uso. Estou em dúvida entre um M5 Pro com 64 GB e comprar um M5 Air básico mais barato e pagar o custo de tokens na nuvem
    Em vez de gastar de 2 mil a 3 mil dólares a mais para rodar localmente modelos de desempenho inferior, dá para comprar uma quantidade considerável de tokens na nuvem

    • Mesmo com um M1 Max de 64 GB já dá para rodar muitos desses modelos
  • Fico curioso sobre por que não rodar DeepSeek V4 sobre o ds4. Parece que os resultados seriam bem bons

    • Pelo visto, o Nativ não oferece suporte a streaming por SSD como o DwarfStar