1 pontos por GN⁺ 2 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Depois de usar Claude e ChatGPT por cerca de 2 anos, conectar o opencode a um endpoint de inferência próprio trouxe uma sensação de libertação maior do que o esperado
  • Como os dados trafegam apenas entre o notebook e um endpoint de sua propriedade, aumentam a sensação de controle e de posse
  • Em vez de fazer upgrade dos planos pessoais do Claude ou do ChatGPT, decidiu usar o Kimi K3, lançado pela Modal como endpoint gerenciado, em projetos paralelos
  • Em cerca de 5 minutos, configurou e colocou o opencode para usar seu próprio endpoint da Modal
  • A experiência foi enxuta, como abrir o vim em vez de um editor grande e cheio de recursos, e deu uma sensação de liberdade, como se tivesse se desprendido de conexões presas a outros provedores

O que levou à escolha de um endpoint próprio

  • Como não havia um plano do Claude ou do ChatGPT adequado para uma conta pessoal, buscou outra opção em vez de fazer upgrade do plano para projetos paralelos
  • A Modal, onde trabalha, lançou o Kimi K3 em endpoints gerenciados e, como o desempenho era considerado razoável, decidiu testá-lo diretamente
    • Como não participou diretamente do desenvolvimento desse recurso, ainda não o havia usado antes

Como conectar o opencode mudou a experiência de uso

  • Em cerca de 5 minutos, conectou o opencode ao seu próprio endpoint da Modal e o colocou em execução
  • A estrutura em que os dados trafegam entre o notebook e um endpoint de sua propriedade aumenta a sensação de controle e de posse
  • A tela inicial vazia e simples do opencode lembrou a experiência de abrir o vim depois de usar por muito tempo um editor grande
  • A liberdade de sentir que a conexão que o prendia a outros provedores havia sido desfeita foi uma mudança inesperada

1 comentários

 
GN⁺ 2 시간 전
Comentários do Hacker News
  • Claude Code é popular porque consegue gerar de uma vez milhares de linhas de código, vários tratamentos superficiais de exceção e funcionalidades só com pedidos vagos como “crie um SaaS de um milhão de dólares”
    Modelos pequenos e abertos são fracos nisso, mas o desenvolvimento real não funciona pedindo o app inteiro de uma vez e encerrando. Se você iterar em funções pequenas e específicas como no desenvolvimento tradicional, até o GLM vai tão bem quanto o Claude ou até melhor, e se fornecer contexto de forma clara, como num debugging com pato de borracha, a maioria deles entrega resultados bem limpos

    • Pessoalmente, achei o DeepSeek v4 Flash tão útil quanto o Opus. Em vez de uma demonstração técnica pontual, basta ter entendimento técnico suficiente para pedir de forma concreta as mudanças desejadas com terminologia precisa, e demorou bastante até eu atingir 1 dólar de gasto depois de colocar saldo no OpenRouter
    • Modelos de ponta como o Opus 5 também são excelentes em combinar elementos de várias áreas acadêmicas e, a partir de pedidos vagos e especulativos, às vezes produzir até resultados de pesquisa inéditos em nível publicável
      Mesmo métodos já conhecidos podem ser implementados em cerca de 1/100 do tempo do trabalho manual, permitindo explorar ideias rapidamente, e às vezes ele escreve do zero implementações com quase nenhuma dependência de terceiros além de NumPy ou SciPy, melhorando clareza e desempenho
    • Essas ferramentas reduzem muito a barreira de entrada para quem não é engenheiro de software. Como cientista de dados da área ambiental, tenho pouca experiência com frontend, mas em algumas semanas concluí com o Claude um app Android para ajudar minha parceira a gerenciar a fala de cavalos, e ele está em testes agora
      Na fase de planejamento, detalhei por dias os serviços e recursos a usar, mas recursos não explicitados no pedido às vezes ficaram de fora, como implementar X mas esquecer funções de editar e excluir. Eu já tinha feito a prova de conceito da funcionalidade principal, mas não havia uma interface fácil de usar; graças ao Claude, consegui criar rapidamente um app sob medida mesmo com pouco tempo disponível. Se estivesse sozinho, teria levado mais de um ano até chegar a algo menos refinado
    • Diante do pedido absurdo “crie um programa para substituir o Microsoft Word”, o ChatGPT explicou décadas de tratamentos de exceção acumulados, correções de bugs, recursos raros e fluxos de trabalho, e perguntou de volta se era mesmo isso que eu queria. Já o Claude me surpreendeu por começar a trabalhar de fato imediatamente para construir aquilo
    • Quando modelos abertos também conseguirem criar um app inteiro de uma vez, parece que todo mundo vai esquecer rapidinho o atual “jeito de desenvolver software
  • O desempenho do DeepSeek V4 Flash é bem melhor do que eu esperava. Uso principalmente o Claude Code com Claude 5 Opus e o Codex com GPT-5.6 Sol, mas não sinto que o DS V4 Flash fique muito atrás, e junto com o oh-my-pi ou o pi básico ele fica muito bom
    Modelos de ponta são muito melhores em chamada de ferramentas, então são mais vantajosos em fluxos de assistente, mas ao otimizar o ambiente de execução reescrevendo as ferramentas para combinar com a forma como o modelo “adivinha”, o DS V4 Flash também funciona bem o suficiente. Modelos pequenos têm latência até o primeiro token e tokens por segundo muito melhores, então são competitivos em várias tarefas, e a sensação lembra o Sonnet do fim do ano passado, o que é impressionante

    • No fim de semana, montei eu mesmo um sistema tipo OpenClaw e estou usando DeepSeek v4 Flash e Qwen como assistente baseado em Matrix, por cerca de 2 dólares por mês. Como posso controlar totalmente as ferramentas acessíveis, ele é mais útil para mim do que o ChatGPT
      Dá para fotografar registros médicos e adicioná-los à agenda, etiquetar e aplicar OCR em PDFs para arquivar, além de fazer buscas na internet e consultar dados do Google Maps. Também dá para conversar por voz com o agente integrando com o Home Assistant e com um sistema open source parecido com a Alexa
  • Na prática, isso é uma publicidade disfarçada, mas por coincidência era uma configuração que eu queria conhecer, então o conteúdo em si está ok. Ainda assim, faltam métricas de custo para eu poder avaliar quanto custo extra preciso aceitar para não enviar minhas conversas diretamente para a NSA
    Claude e OpenAI são conhecidos por receber subsídios consideráveis, então fico curioso se usar o Kimi K3 em um endpoint privado sairia mais caro ou mais barato

    • Se você quer saber quantos agentes de programação “gratuitos” dá para usar em termos de custo, há a análise da Fable: https://claude.ai/public/artifacts/2c9a5001-0b7e-4944-beb1-9...
    • No OpenRouter, cada página de modelo mostra ícones indicando o preço por provedor e se os dados são ou não retidos. Também dá para configurar regras de proteção para a conta inteira e bloquear roteamento para provedores que não sejam ZDR
  • Este texto é publicidade do próprio produto. Mesmo que o autor participe há muito tempo e tenha escrito com honestidade, um texto do tipo “usei meu produto e ele foi ótimo” não deixa de ser autopromoção

    • O post já foi denunciado, então talvez não faça tanta diferença, mas não havia nenhuma intenção de publicidade. Não foi um texto pedido por alguém nem planejado antecipadamente; só comecei a ter tempo em casa para construir algo, precisava tanto de um LLM para ajudar no desenvolvimento quanto de um LLM para usar dentro do produto, e então resolvi testar o endpoint da Modal que eu já tinha em mente
      Eu não queria aumentar meu plano do Claude, e se não tivesse achado interessante nem teria escrito o texto. O principal que me levou a escrever não foi “a Modal é legal”, mas a sensação descrita no texto. Até considerei remover o link por receio de parecer anúncio, e o fato de a empresa onde trabalho ter feito algo legal era só um benefício secundário
    • No HN sobem o tempo todo posts de blog promovendo a Anthropic, então é difícil aceitar um critério em que eles não são publicidade e este texto seria
    • Se o produto é realmente bom, não há motivo para o próprio desenvolvedor não poder divulgá-lo
    • Se a ideia é manter o post, o mais apropriado seria colocar Show HN no início do título
    • Muitos posts no HN são autopromoção, e se são interessantes ou não acaba sendo filtrado no processo de chegar à página inicial. Autopromoção interessante continua sendo interessante
  • O GLM 5.2 parece melhor que o Opus, e o K3 é tão bom quanto o Fable. Espero que destilem o K3 para algo na escala do Qwen 3.6 27b ou do Poolside S 2.1 e surja um substituto local e rápido para o Composer 2.5

  • Ao trocar um modelo grande de ponta por um modelo ágil como o Composer, às vezes a sensação lembra abrir o vim em vez de um editor chamativo e pesado
    Com modelos rápidos, o ciclo de pensamento e perguntas e respostas flui melhor, parecido com a fluidez de navegar rapidamente entre arquivos no vim

  • Gosto da interface meio vazia do OpenCode. É limpa, leve e passiva, e passa uma sensação de velocidade diferente das ferramentas modernas da internet, que são bonitas mas lentas

    • O Pi Agent parece bem mais leve, então vale testar
  • Este texto parece propaganda da Modal. Se o hardware foi alugado, também fica a dúvida se isso pode mesmo ser chamado de infraestrutura própria

  • Independentemente de ser chinês ou não, o preocupante é usar um modelo hospedado sem saber para onde seus segredos comerciais estão sendo enviados
    Também tentei modelos locais, mas em um MPB M5 16GB básico eles são lentos, e não tenho planos de trocar de notebook tão cedo