5 pontos por GN⁺ 1 일 전 | 4 comentários | Compartilhar no WhatsApp
  • A Alibaba Qwen lançou o Qwen3.8, com 2,4 trilhões de parâmetros, e pretende divulgar os open weights em breve
  • O Qwen3.8 é apresentado como um modelo em contínua evolução, e a empresa afirma que ele é compatível com os principais modelos frontier de IA
  • A equipe do Qwen avalia o Qwen3.8 como um dos modelos mais poderosos do momento e em um nível acima do Fable 5
  • O Qwen3.8-Max-Preview já pode ser testado no Alibaba Token Plan, Qoder e QoderWork
  • O Token Plan mantém páginas de preços separadas para usuários internacionais e usuários na China
    • Para usuários internacionais, há três níveis: Lite/Standard/Pro, com preços promocionais mensais de $6/$18/$68, respectivamente
    • Cada plano oferece 2.500/10.000/40.000 Credits a cada 7 dias e 700/3.000/12.000 Credits a cada 5 horas
    • O número de agentes que podem ser executados simultaneamente é de 1~2/3~4/6~8, respectivamente, e é possível conectar via API Key e Base URL em ferramentas compatíveis com os protocolos OpenAI/Anthropic

4 comentários

 
fanotify 1 일 전

Encontrei um infográfico e trouxe aqui: https://i.postimg.cc/63yLvz16/modelsize202607.png
(atualizei levemente o do Kimi adicionando as informações desta versão do Qwen 3.8)

 
cadenzah 1 시간 전

Você não deve abrir esse link em locais públicos!

 
thkweon 1 일 전

Tem propaganda demais no site.

 
GN⁺ 1 일 전
Opiniões do Hacker News
  • Este anúncio parece vir na esteira do anúncio da Moonshot AI de que disponibilizaria no Hugging Face, até 27 de julho, o Kimi K3, um LLM de pesos abertos com 2,8 trilhões de parâmetros.
    A Alibaba também respondeu dizendo que em breve lançaria o Qwen 3.8, com 2,4 trilhões de parâmetros, como pesos abertos; fico curioso se isso já estava nos planos ou se foi uma decisão para competir com a Moonshot AI.
    De qualquer forma, o vencedor dessa competição de LLMs é o usuário.

    • É difícil afirmar qual é a motivação, mas as empresas chinesas parecem estar se empenhando em transformar inteligência em uma commodity.
      Pode ser a forma mais eficaz de reduzir o valor dos laboratórios de ponta dos EUA, e também é algo muito benéfico para a humanidade.
    • Nas redes sociais chinesas, aparece com frequência a piada de que “governos de outros países intervêm para impedir práticas anticompetitivas, mas o governo chinês intervém para conter a concorrência”.
      https://www.reuters.com/business/autos-transportation/what-i...
    • O motivo de anunciarem agora é que a World AI Conference está em andamento.
      Enquanto robôs fazem lutas de boxe e as principais empresas chinesas de IA divulgam seus modelos mais recentes, Xi Jinping também anunciou a criação da WAICO.
      https://en.wikipedia.org/wiki/World_Artificial_Intelligence_...
    • O anúncio também pode ter sido alinhado ao momento em que Xi Jinping lançou uma aliança política na World AI Conference, dizendo que “o desenvolvimento da IA deve ser uma sinfonia de cooperação internacional, não uma corrida solo de um único país”.
      Grandes conferências costumam trazer uma enxurrada de lançamentos de produtos e anúncios.
      https://www.cnbc.com/2026/07/17/x-china-ai-summit-risks-secu...
    • Em vez de modelos gigantescos, eu gostaria que lançassem o Qwen 3.7-27B·122B ou as versões 3.8 correspondentes.
      O ponto forte do Qwen e do QwQ sempre foi a inferência local de alto nível que dá para rodar em casa.
  • Como a Alibaba Cloud bloqueou meu endereço de e-mail, não consigo pagar pelo uso, então desta vez não posso fazer o teste do pelicano.
    Estou esperando a liberação dos pesos abertos ou a listagem no OpenRouter.

    • O benchmark do pelicano hoje é praticamente o único procedimento de avaliação em que confio.
      Também é absurdo uma empresa como a Alibaba dificultar o recebimento de dinheiro; seria de se esperar que quisessem que desenvolvedores conhecidos testassem seus modelos.
      O OpenRouter geralmente lista rápido, então espero poder usar em breve. Outra opção é baixar o app do Qwen e testar pela interface de chat com ferramentas MCP para desenvolvimento local.
  • Espero que também sejam lançados modelos menores do Qwen 3.8.
    Uso localmente o MoE de 35B e o modelo denso de 27B, e na maioria dos casos não preciso chamar o Claude.
    Eles são especialmente úteis para solicitações que envolvem dados sensíveis ou pessoais.

    • Seria bom ter um modelo MoE intermediário entre o 35B do 3.6 e o 122B do 3.5.
      Em um computador doméstico bastante potente, mas não absurdamente caro, ele poderia oferecer um excelente equilíbrio entre velocidade e desempenho.
    • Esta disputa parece mais próxima de uma briga pela hegemonia da IA de fronteira, então receio que modelos menores e competentes fiquem para trás.
      Grandes laboratórios não querem entregar ao usuário final a galinha dos ovos de ouro, e fabricantes de hardware como a Nvidia também podem entrar nesse mercado para lucrar com todos os lados.
    • Fico me perguntando como seria possível reduzir um modelo de 2,4 trilhões de parâmetros para 35B mantendo a precisão.
      Para conseguir isso, seria necessária uma arquitetura completamente diferente.
    • Fico curioso sobre qual hardware eles estão usando.
  • Testei o Qwen 3.6 27B no LMStudio e, embora tenha sido um pouco lento, superou minhas expectativas.
    Com mtplx aplicado, sem exagero, ele ficou realmente 2 a 3 vezes mais rápido, o que foi muito impressionante.
    Estou migrando para modelos locais sempre que possível, e isso está se tornando uma opção cada vez mais prática. Ainda assim, uso um notebook de US$ 6.000 — um MacBook M5 Max no máximo de configuração —, então ainda é um hardware caro para a maioria.
    Daqui em diante, acho que a tendência será rodar localmente modelos menores treinados de forma mais focada. O risco de entregar todos os dados a provedores de nuvem é grande demais, e espero que, quando chegar a hora de provarem lucro, eles passem a cobrar preços absurdos.

    • Depois dos aumentos recentes de preço, esse notebook provavelmente está mais perto de US$ 8.000.
  • Depois de usar o Qwen 3.7 Pro todos os dias por um mês, ele foi praticamente inutilizável
    Desperdiçava tempo demais, perdia o rumo da tarefa ou caía em repetições sem sentido, e nem depurava direito
    A diferença em relação ao DeepSeek V4 Pro era gritante, e até agora o Qwen pareceu o pior modelo para engenharia de software. Era muito mais caro que o DeepSeek e não dava nem para delegar tarefas a ele nem para usá-lo em trabalho de baixo nível em tempo real

    • Rodei localmente no llama.cpp o Qwen3.6-35B e o 27B quantizados em Q8, e também testei o modelo quantizado DS4-flash do antirez
      Todos ficaram em um nível parecido, e o DS4 foi um pouco mais eficiente, mas todos deram resultados muito bons em scripts Bash, depuração, Python e algumas tarefas em C++
      Fico curioso para saber em que aplicação ou linguagem o Qwen falhou. O template de chat do Qwen estava quebrado, então tive de depurar por conta própria, e também há trabalho em andamento para corrigir isso; com o Gemma foi parecido
    • Pelos meus critérios, o Qwen 3.7 Max é melhor que o Opus e muito mais rápido, ficando um pouco atrás do Fable
      Ele ficou muito à frente do DeepSeek 4 Pro em velocidade e compreensão geral, e eu o uso principalmente junto com o Claude Code
      O Qwen 3.7 Plus também é bem decente para subagentes e muito melhor que o Sonnet. O Qwen 3.8 Max Preview também está funcionando bem por enquanto, mas ainda é cedo para julgar; se custar 10% do preço normal, é um custo-benefício absurdo
    • O Qwen 3.7 Pro é mediano, mas o 3.7 Max é um modelo muito bom
    • Carreguei 2 dólares na API da DeepSeek e coloquei a chave no Void Editor para criar uma ferramenta de criptomoedas em HTML
      Usei um arquivo CSV de exemplo com centenas de linhas, programei de leve por uma ou duas horas e corrigi bugs, e isso custou cerca de 1,8 dólar
      Se esse custo for normal, ao usar no trabalho por um mês parece que sairia mais caro que um salário; fico me perguntando se provedores de nuvem são mesmo tão caros assim
    • A Anthropic não deveria ter atrapalhado os ataques de destilação de conhecimento
  • A versão final do DeepSeek 4 também deve ser lançada em breve
    Provavelmente ficará no nível do Opus 4.8 e, considerando o preço da DeepSeek, deve ser um acontecimento bastante grande

    • O custo-benefício da DeepSeek é avassalador
      Tenho usado bastante o V4 Flash recentemente e ele é bem bom
    • O DeepSeek V4 é 10 a 30 vezes mais barato que a maioria dos modelos e suficiente para a maior parte das tarefas
    • Amanhã é o último dia da WAIC, então há grande chance de ser lançado nessa ocasião
    • É o modelo que mais aguardo
      Nas últimas semanas, usando diretamente o DeepSeek Pro, tenho recebido cada vez mais respostas que claramente vieram de um modelo muito superior
      Como o desempenho é bom demais, o campo dos modelos fechados já está espalhando medo, incerteza e dúvida do tipo “roteamento obscuro” ou “copiaram o Fable na cara dura”
      Mesmo com o aumento de preço, ele oferece um valor enorme. Se você não tem tempo para testar todos os modelos e quer usar apenas o que parece ser o melhor no momento, talvez seja melhor nem usá-lo. Você vai acabar percebendo e se arrependendo de quanto mais teria feito se, no primeiro semestre deste ano, tivesse gasto 1.200 dólares na DeepSeek em vez da OpenAI
  • Ao verificar o Artificial Analysis, havia pelo menos 12 provedores com desempenho melhor que o Opus 4.5, que a Anthropic lançou em dezembro e que é visto como tendo desencadeado a recente aceleração
    Considerando que o custo de troca também é baixo, a competição está completamente superaquecida. Pessoalmente, acho que um nível Opus 4.5 é suficiente para a maioria das aplicações e usos

    • Por isso, é bem provável que OpenAI e Anthropic passem a exigir com mais força regulação governamental e proibições
      Caso contrário, todo o modelo de receita delas desmorona
  • Para executar no OpenCode com o Qwen Cloud Token Plan, a configuração abaixo funciona
    Como não sei os limites exatos, defini como iguais ao limite do Qwen 3.7 Max

    "provider": {  
      "alibaba-token-plan": {  
        "models": {  
          "qwen3.8-max-preview": {  
            "limit": {  
              "context": 1048576,  
              "output": 65536  
            },  
            "modalities": {  
              "input": ["text"],  
              "output": ["text"]  
            },  
            "name": "Qwen3.8 Max Preview"  
          }  
        }  
      }  
    }  
    
    • É preciso escolher corretamente o endpoint da API e o token
      Quando você chama o endpoint correto, a cota diminui quase imediatamente, então é necessário conferir isso
      Se errar, pode acabar consumindo tokens de API que não estão incluídos nos Credits da assinatura e gastar 200 dólares em 3 dias; o mesmo vale se tiver usado os 200 dólares recebidos como bônus de inscrição no Alibaba Cloud
  • A expressão “o melhor depois do Fable 5” é bem significativa
    No início havia bastante ceticismo de que o Fable tivesse avançado pouco em relação ao Opus, mas, goste-se ou não, partindo do pressuposto de que a Anthropic continuará permitindo seu uso, ela garantiu um fosso competitivo real com esse modelo
    Se um modelo aberto superar isso, será realmente interessante

    • É difícil chamar de fosso, mas certamente é um modelo melhor
      No meu trabalho, avalio na ordem Fable > K3 > Sol
      Dito isso, ele não é tão esmagadoramente superior aos outros dois a ponto de eu sofrer um golpe sério se não pudesse mais usar o Fable. Todos os três são excelentes, e o Fable é o único que recusa solicitações regularmente
    • O “fosso” deles está no fato de que o Mythos é atualmente o único modelo de escala gigantesca
      Treinar um modelo de 10 trilhões de parâmetros para obter desempenho 10% superior ao de um modelo de 1 trilhão sempre foi possível
      Se o Mythos fosse um Opus 5 do mesmo tamanho e preço que o Opus anterior, isso seria um diferencial decisivo, mas na prática não é o caso
    • Mesmo sendo um modelo melhor, ele tem restrições demais, então não é tão útil quanto o Opus
    • A qualidade dos resultados do Fable frequentemente cai
      Uso o Sol como principal, e o Fable pode ser criativo, mas é fraco em executar tarefas de forma estável sem consumir tokens sem parar
  • A corrida de IA na China está esquentando
    Estou ansioso para ver o que Anthropic e OpenAI vão lançar em seguida