O AGENTICO
Qwen3.8-2.4T-A95B
modelo · 3 menções
O que as fontes disseram sobre Qwen3.8-2.4T-A95B
A Alibaba liberou os pesos abertos do Qwen3.8-2.4T-A95B, seu maior modelo open-weight, com 2,4 trilhões de parâmetros totais e 95 bilhões ativados por token. O modelo utiliza arquitetura MoE de granulação fina com atenção híbrida, oferecendo contexto de até 1 milhão de tokens e saída de até 128K. Sem ajuste adicional, ele atinge mais de 4 mil tokens por segundo por GPU e mais de 350 tokens por segundo por usuário no NVIDIA GB300 NVL72 em precisão FP8.
Menções

Sem ajuste adicional, o modelo atinge mais de 4 mil tokens por segundo por GPU e mais de 350 tokens por segundo por usuário no NVIDIA GB300 NVL72 em precisão FP8 no dia do lançamento.
Essa performance mostra a viabilidade de implantação em data centers com hardware específico, indicando que o modelo é prático para uso corporativo.

O Qwen3.8-2.4T-A95B usa arquitetura MoE de granulação fina com atenção híbrida (full e linear), contexto de até 1 milhão de tokens e saída de até 128K.
A arquitetura MoE com atenção híbrida permite processar longos contextos, essencial para tarefas de raciocínio e agentes.

A Alibaba liberou os pesos abertos do Qwen3.8-2.4T-A95B, seu maior modelo open-weight, com 2,4 trilhões de parâmetros totais e 95 bilhões ativados por token.
Essa liberação democratiza o acesso a um modelo de escala massiva, permitindo que a comunidade use recursos próximos aos de fronteira.
Todo dia, só o que dois veículos independentes confirmaram — no seu feed.