- Nativ é um app open source com licença MIT que baixa e executa modelos abertos de IA em Macs com Apple Silicon sem conta, assinatura ou nuvem
- Oferece modelos da Google, Cohere, Liquid AI e outras, recomenda modelos adequados ao hardware do Mac e gera todas as respostas localmente
- No chat, oferece streaming, Markdown, destaque de código e entrada de imagem, e permite acompanhar em tempo real o estado de desempenho, como tokens por segundo e pressão de memória
- É otimizado para o Metal e a memória unificada da linha M com MLX-VLM para lidar com tarefas de linguagem, visão, vídeo, código e áudio
- O servidor local de modelos pode ser conectado a Pi, Codex, Claude Code, Hermes e OpenCode, e todo o código do app e do carregador de modelos também está disponível
Execução local de modelos otimizada para Mac
- App universal para macOS com suporte a Apple Silicon M1 ou superior, que roda modelos reais no Mac sem nuvem nem camada extra de conversão
- É possível escolher modelos abertos da Google, Cohere e Liquid AI em uma biblioteca selecionada, e também receber recomendações de modelos adequados ao hardware
- A interface de chat oferece os seguintes recursos
- Respostas em streaming e métricas de desempenho por mensagem
- Markdown e destaque de sintaxe de código
- Entrada de imagem
- Com medição de desempenho em tempo real, é possível verificar tokens por segundo, pressão de memória, estado térmico e tempo até o primeiro token
- Baseado em MLX-VLM, ajustado para a memória unificada e o Metal da linha M
- Suporta chat com LLM, geração de legendas de imagem, resumo de vídeo, autocompletar de código, conversão de voz e geração de áudio
- Não exige conta, créditos ou assinatura, e não vende dados do usuário
Integração com ferramentas de desenvolvimento e princípios open source
- Com o endpoint local único do Nativ, é possível conectar agentes de programação existentes a modelos locais em execução no Mac
- Pi
- Codex
- Claude Code
- Hermes
- OpenCode
- Todo o código, incluindo o app desktop, o carregador de modelos e os gráficos de medição de desempenho, está aberto para visualização, fork e Pull Request
- É distribuído sob a licença MIT, sem roadmap de VC, nível enterprise ou dark patterns que transformem prompts em dados de treinamento
- A biblioteca completa de modelos pode ser consultada no Hugging Face
1 comentários
Comentários do Hacker News
Este app com licença MIT foi criado por Prince Canuma, que mantém a popular biblioteca MLX-VLM. O MLX-VLM já é usado há muito tempo como dependência de ferramentas como o LM Studio, pois pode oferecer inferência mais rápida que o llama.cpp em dispositivos Apple
O ecossistema MLX é menor que o CUDA, mas dá suporte muito rápido a novos modelos, especialmente modelos multimodais como visão, reconhecimento de fala, síntese de voz e geração de vídeo. Também vale conferir o mlx-audio-swift, e não seria surpresa se modelos assim fossem integrados a esta UI
A landing page pode até ter sinais de vibe coding, mas a maior parte do app foi escrita em Swift, então também parece fácil portar essa stack de inferência para iPad e iPhone
blaizzyno domínio, porque o trabalho do Prince Canuma com MLX sempre teve qualidade acima da médiamlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16para clonagem de voz quase todos os diasPara suporte a samplers modernos, dá para começar pelos artigo 1, artigo 2 e artigo 3
Parece que a expressão frontier está sendo usada em excesso. Eu achava que significava modelos de topo como o Fable atual, mas modelos assim não exigem RAM enorme e GPUs caras, a ponto de serem difíceis de hospedar por conta própria?
O gráfico do Artificial Analysis deixa isso intuitivo. Por exemplo, não existe um modelo tão inteligente quanto o DeepSeek V4 Pro e mais barato, então ele pode ser visto como um modelo frontier. Uma solução na fronteira de Pareto é a melhor dentro da sua categoria, sem poder ser trocada por algo melhor sem abrir mão de outra coisa
Sempre que uso o Gemma 4 12B, fico com a sensação de que ele é pequeno, inteligente e eficiente, e mesmo assim a energia da indústria de IA está indo totalmente na direção errada. Se o financiamento de pesquisa se concentrasse em melhorar modelos que rodem em sistemas com 16 GB de memória unificada, seria possível ter avanços importantes
O Qwen 3.6 e o modelo ajustado de 27B da BottleCap também são bons, mas o desempenho surpreendente dos modelos pequenos do Gemma 4 ainda não é amplamente conhecido. Pode parecer inadequado esse site chamar o Qwen 3.6 27B de frontier, mas em termos de desempenho também não é algo tão distante da realidade
Fiquei surpreso com a homepage, como se não existissem apps já estabelecidos como o LM Studio. À primeira vista, não fica claro o que ele tem de diferente, e o Open WebUI também foi ignorado
Estou rodando DeepSeek V4 Flash localmente há semanas no meu MacBook Pro com Open WebUI e DS4
Agora frontier virou uma palavra usada em excesso, como
load-bearing, que usuários do Claude Code devem conhecer. Principalmente porque este app não consegue rodar de fato os modelos de ponta localmente num Mac, então seria melhor parar de usar esse termoNão gosto de frases de marketing como “por que somos open source quando ninguém mais é”. Eu uso o oMLX, que é open source, e aparentemente oferece todas as funções do Nativ
Seria bom comparar de forma adequada com os concorrentes open source existentes, em vez de tratá-los como se não existissem
Fico curioso sobre onde, na prática, os pequenos modelos locais estão sendo usados. Eles ficaram bem capazes, mas ainda é difícil confiar neles para assumir trabalho real além de alguns projetinhos de brincadeira feitos por diversão
Queria saber se as pessoas realmente usam isso em agentes de código ou se é mais para outros usos
É difícil escrever do zero código que exija conhecimento especializado, como um motor de inferência de alto desempenho para GPUs Blackwell, mas PRs comuns que adicionam casos de uso a projetos existentes ficam em um nível parecido com o Sonnet. É preciso a configuração correta, como temperature e top-p recomendados, quantização sem exagero e pelo menos 150 mil tokens de contexto
O agente principal usa DeepSeek V4 Flash, e o modelo local é lento demais para servir como agente de chat, mas funciona muito bem para extração de memória, reduzindo o uso de API a cada turno da conversa
--help, escrever Markdown e README. Se der errado, basta voltar comgit restoreou rejeitar o PR e pedir de novo para um modelo melhorQueria saber o que ele tem de melhor em relação ao LM Studio e se também roda modelos MTP. Pelo que sei, os modelos MTP usam o formato GGUF
Testei MLX com Rapid MLX, mas o Qwen ficava travando e repetindo a mesma coisa. Quando mudei para llama.cpp, a geração de tokens no MTP ficou mais rápida e o modelo também ficou mais estável
Fico curioso sobre os resultados que outras pessoas tiveram ao comparar MLX e llama.cpp
Nos modelos que testei, em alguns casos o desempenho em GGUF no llama.cpp era melhor. O MTP do Gemma 4 não teve muito valor, mas no Qwen 3.6 MoE houve uma diferença mensurável, e em hardware mais recente isso pode ser mais relevante
Queria saber qual seria uma configuração intermediária de Mac adequada para esse uso. Estou em dúvida entre um M5 Pro com 64 GB e comprar um M5 Air básico mais barato e pagar o custo de tokens na nuvem
Em vez de gastar de 2 mil a 3 mil dólares a mais para rodar localmente modelos de desempenho inferior, dá para comprar uma quantidade considerável de tokens na nuvem
Fico curioso sobre por que não rodar DeepSeek V4 sobre o ds4. Parece que os resultados seriam bem bons