1 pontos por GN⁺ 3 시간 전 | 1 comentários | Compartilhar no WhatsApp

1 comentários

 
GN⁺ 3 시간 전
Comentários no Hacker News
  • Se for uma grande empresa gastando milhões de dólares por mês em inferência, faz sentido comprar diretamente um rack GB300 de cerca de US$ 6 milhões
    Dos 20,7 TB de memória, não é preciso nem 10% para carregar o modelo MXFP4 inteiro, e a largura de banda total de HBM é de 576 TB/s, então daria para rodar em paralelo mais de 6.000 tarefas de agentes com contexto médio de 100 mil tokens a cerca de 30 tokens/s
    Assumindo US$ 1,5 milhão por ano em depreciação e energia e utilização média de 50%, o custo fica abaixo de US$ 0,60 por 1 milhão de tokens de saída, os dados permanecem dentro da empresa e isso sai mais de 10 vezes mais barato que serviços hospedados
    Para empresas que acreditam que modelos de pesos abertos vão continuar evoluindo e que a IA vai continuar, parece ser a primeira justificativa realmente sólida para decidir comprar o rack por conta própria

    • Em um servidor de US$ 107 mil, estão rodando o Kimi 2.8 e processando em torno de mais de 50 mil tokens por segundo na maioria das tarefas
      Já economizaram mais do que gastaram com tokens de Claude e Gemini no ano passado
    • Contratar 2 ou 3 pessoas de DevOps para operar isso adiciona US$ 400 mil a US$ 700 mil, e falhas e manutenção também passam a ser responsabilidade da empresa
      Ainda assim, não confiam em LLMs hospedados para dados que precisam permanecer privados
    • Também é preciso um espaço com resfriamento líquido e infraestrutura elétrica de altíssima densidade, então um colocation comum ou uma sala de servidores interna normalmente não dá conta
    • Se a empresa pode comprar um rack e a infraestrutura de US$ 6 milhões, também precisa considerar os termos de licença comercial aplicáveis, então a conta não é tão simples
  • Junto com o modelo, também divulgaram várias infraestruturas open source
    https://github.com/MoonshotAI/MoonEP
    https://github.com/kvcache-ai/AgentEnv
    https://github.com/MoonshotAI/FlashKDA
    É difícil aceitar a ideia de que código-fonte aberto e modelos com pesos abertos sejam algo que atrase o avanço da IA

    • Na verdade, eu via isso como algo que retarda o progresso
      Porque outros laboratórios conseguem alcançar os de ponta destilando seus modelos e, com isso, retiram parte da receita que esses laboratórios poderiam reinvestir na próxima geração
      Se a meta for aceleração total, eu achava que o certo seria nacionalizar os dois grandes laboratórios e fechá-los ao estilo Manhattan Project até chegar à melhoria recursiva de si mesmo (RSI), mas depois de ler as respostas minha visão mudou bastante
  • A licença do Kimi-K3 pode ser consultada em https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
    Provedores de Model as a Service com receita agregada de afiliadas acima de US$ 20 milhões em 12 meses consecutivos precisam firmar um contrato separado com a Moonshot AI antes de qualquer uso comercial
    Nas condições anteriores, também havia uma cláusula exigindo exibir o nome Kimi se houvesse mais de 100 milhões de usuários ativos mensais ou se a receita do produto comercial ultrapassasse US$ 20 milhões

    • O Kimi 2.6 usava uma licença do mesmo tipo, e aparentemente isso remonta ao https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENS... K2
      Os modelos públicos de 2025 tinham uma licença MIT limpa, mas a partir do moonshotai/Kimi-K2-Thinking, em janeiro de 2026, passaram a usar uma licença MIT modificada
    • Desde o início, fica a dúvida sobre a que exatamente essa licença se aplica
      Nem está claro se pesos de modelo têm proteção autoral
    • Nos EUA, é possível interpretar que os pesos de modelos de aprendizado de máquina não são objeto de copyright por serem produto de processos automáticos de otimização como gradient descent estocástico, expectation-maximization e algoritmos genéticos
      Isso ainda não foi totalmente testado nos tribunais, e o custo de litigar é alto, então empregadores em geral provavelmente vão preferir cumprir a licença por segurança
      Thaler v. Perlmutter confirmou que copyright exige um autor humano, e a orientação do U.S. Copyright Office também afirma que obras geradas automaticamente por máquina sem intervenção criativa humana não podem ser registradas
      A cláusula seguinte também exclui princípios matemáticos, fórmulas, algoritmos e equações da proteção autoral, então, se o modelo for visto como algoritmo, a conclusão parece relativamente clara
      [1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
      [2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
    • É melhor do que não poder baixar, mas com essas condições é difícil chamar isso de pesos verdadeiramente abertos ou open source, o que é uma pena
    • Também fica a dúvida de como encontrariam violadores da licença para transformá-los em alvo de processo
  • É interessante a abordagem de um grafo de conhecimento hierárquico autoevolutivo que se expande continuamente enquanto agentes exploram em escala web áreas intensivas em conhecimento e programação

  • Ver a função de ativação voltando para tanh de novo dá a impressão de que as modas técnicas são cíclicas

    • Segundo a página 6 do artigo, não usam tanh puro, e sim f_gate(b,x) = b * tanh(x / b) * sigmoid(x) e f_up(b,x) = b * tanh(x / b)
      Pelo gráfico, parece uma tentativa de combinar a vantagem do GLU em expressividade quando x é maior que cerca de 5 com a vantagem do SwiGLU de elevar os valores logo antes de 0
  • A síntese de tarefas baseada em grafo de conhecimento parece uma boa abordagem para o antigo problema de como cobrir sem lacunas uma grande variedade de tarefas
    Também parece algo que pode levar a pesquisas teóricas sobre a velocidade de geração de novo conhecimento e sobre formas humanas e mecânicas de geração

  • Tenho curiosidade sobre qual é a melhor opção hoje entre LoRA+DPO e GRPO para ajustar finamente tarefas próprias de agente

    • A princípio, LoRA+SFT parece adequado, mas como o modelo é grande, o custo deve ser considerável
      Parece melhor esperar a API de fine-tuning do provedor, e não parece necessário partir desde o início para aprendizado por reforço ou algo como DPO, um شبه-RL off-policy
  • Tenho curiosidade sobre qual é o modelo professor em destilação on-policy com múltiplos professores
    Entendo áreas verificáveis como matemática e programação, mas, ao ver que isso inclui até biologia, fico em dúvida se a estrutura é de destilar a partir de um modelo maior

    • Está citando https://thinkingmachines.ai/blog/on-policy-distillation/
      Entendo isso como um método de destilação com aprendizado por reforço em que o modelo professor avalia cada token do modelo aluno que resolve o problema com a probabilidade de geração em cada etapa, e isso é aplicado como recompensa ou perda
      Múltiplos professores parece significar destilar a partir de vários modelos, possivelmente incluindo também modelos proprietários de ponta
      Porém, são necessárias log probabilities; a API da OpenAI permite isso, enquanto a Anthropic não fornece, então talvez exista alguma forma de estimar isso externamente
      Esse método pode ser aplicado a qualquer área que o professor conheça, incluindo biologia
    • Professor significa outros modelos
  • Tenho curiosidade se a razão de os preços de inferência de vários provedores serem todos iguais é por causa de contratos de licenciamento com a Moonshot

  • Tenho curiosidade sobre o que seria necessário para criar um modelo aberto dos EUA que compita com o Kimi

    • O último grande modelo aberto em larga escala de um grande laboratório dos EUA parece ter sido o GPT-OSS-120b no verão de 2025, cerca de um ano atrás
      Parece difícil que isso saia voluntariamente, então talvez seja preciso pressionar pela abertura de alguma forma
      Recentemente eu esperava que o Gemma saísse pelo menos na faixa de 100B, mas o Google parece manter internamente modelos desse porte
    • Parece alta a possibilidade de MSL ou SpaceXAI lançarem em open source um dos próximos grandes modelos
      Ambos são favoráveis a open source e devem competir pelo lugar de Kimi nos EUA
    • Se for verdade a noção comum de que a China simplesmente destila modelos e os replica em 2 semanas, então os EUA também deveriam conseguir lançar um modelo replicado em 2 semanas
    • O Inkling também está mais ou menos em uma faixa competitiva