Review do Qwen 3.8: desempenho, instalação local, GPU e política NSFW

Qwen 3.8 fica mais fácil de entender em duas linhas: Qwen3.8-2.4T-A95B / Max para inferência em grande escala, e Qwen3.8-27B para quem quer testar um…

schedule
article 6 min de leitura
Imagem de capa do review do Qwen 3.8

Qwen 3.8 fica mais fácil de entender em duas linhas: Qwen3.8-2.4T-A95B / Max para inferência em grande escala, e Qwen3.8-27B para quem quer testar um LLM forte em ambiente local ou de pequeno porte. O primeiro mira o teto de desempenho; o segundo é o ponto de partida mais prático.

Se você se importa com instalação local, requisitos de GPU, links de download, uso comercial e política NSFW, não basta olhar apenas benchmarks. As versões do Qwen 3.8 variam bastante em tamanho, licença, custo de execução e comportamento entre serviço online e pesos baixáveis.

O que é o Qwen 3.8

Qwen3.8-2.4T-A95B é a base open weight da linha Max, com 2,4T parâmetros e licença qwen3.8-max na página do modelo.

Qwen3.8-2.4T-A95B Hugging Face
Página do Qwen3.8-2.4T-A95B no Hugging Face.

Qwen3.8-27B é a opção mais prática para usuários locais. Aparece como um modelo de cerca de 28B parâmetros, BF16 e Apache-2.0, o que facilita testes e uso comercial.

Qwen3.8-27B Hugging Face
Qwen3.8-27B é a versão mais realista para testes locais.

Versões do modelo e downloads

Modelo Posicionamento Melhor uso
Qwen3.8-2.4T-A95B Max / 2.4T Empresas, pesquisa, inferência em nuvem
Qwen3.8-2.4T-A95B-FP8 FP8 Reduzir memória em inferência grande
Qwen3.8-27B 27B / Apache-2.0 LLM local, RAG, apoio a código
ModelScope ModelScope Ambientes China/ModelScope
Qwen3.8 FP8 model page
A versão FP8 é relevante para inferência distribuída.
Qwen3.8 ModelScope
ModelScope distribution page for Qwen3.8-2.4T-A95B.

Desempenho e experiência real

O Qwen 3.8 chama atenção por multilinguismo, código, contexto longo e uso de ferramentas. A comunidade discute principalmente se o 27B é rápido o bastante, se as quantizações funcionam bem, se vLLM/SGLang estão maduros e se a linha Max justifica o custo em nuvem.

Prismix LLM news page
Community and release news around modern LLMs.

Comparação com LLMs locais populares

Ponto-chave Detalhe
Qwen3.8-27B Bom ponto de partida local para multilinguismo e código.
Llama / Gemma Ecossistema maduro e modelos pequenos mais fáceis; Qwen compete bem em idiomas asiáticos e código.
DeepSeek / Kimi / GLM Também fortes em contexto longo ou raciocínio; teste com seus dados.

Instalação local

O ideal é começar pelo 27B ou por uma versão quantizada, não pela linha de 2.4T.

vLLM supported models documentation
A documentação do vLLM ajuda a verificar compatibilidade para inferência local ou auto-hospedada.

Exemplo de instalação

pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "Qwen/Qwen3.8-27B" tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True, ) PY

Requisitos de GPU e VRAM

Uso VRAM Nota
Qwen3.8-27B BF16 56GB+ 80GB é confortável; 48GB pode apertar com contexto longo.
Qwen3.8-27B 4bit 18-24GB+ Pode ser testado em RTX 4090 com contexto moderado.
Qwen3.8-2.4T Cluster Não é modelo de desktop; é para nuvem ou empresa.

Uso online quando o hardware não é suficiente

site oficial do Qwen Chat serve para testar o estilo do modelo antes de montar infraestrutura local. A versão online pode incluir ferramentas, visão ou contexto longo que não aparecem igual nos pesos locais.

Qwen Chat official website
Qwen Chat online interface.

Política NSFW e limites

O serviço online oficial do Qwen não é um chat NSFW sem limites. Conteúdo sexual explícito, usos ilegais, instruções perigosas ou dano a terceiros podem ser restringidos. Rodar pesos locais muda a interface, mas não remove licenças, regras de plataforma nem leis locais.

Qwen3.8-27B Uncensored / Abliterated

Quem procura uma variante local com menos restrições também pode encontrar o Huihui-Qwen3.8-27B-abliterated no Hugging Face. Trata-se de uma versão uncensored / abliterated criada pela comunidade com base no Qwen3.8-27B, e não de um lançamento oficial da Qwen. Na prática, modelos “abliterated” costumam reduzir o comportamento de recusa, respondendo com mais facilidade a prompts que o serviço oficial ou pesos alinhados para segurança poderiam negar.

Esse tipo de modelo pode ser útil para testes locais, pesquisa de alinhamento, escrita criativa e comparação de comportamento entre versões. Ao mesmo tempo, exige mais responsabilidade: as respostas podem ter menos filtros e ser mais fáceis de direcionar para conteúdo adulto, inseguro ou juridicamente sensível. Antes de usar, leia o model card no Hugging Face, a licença, as regras da plataforma e a legislação aplicável.

Para a maioria dos usuários, o Qwen3.8-27B oficial ou o Qwen Chat continuam sendo a escolha inicial mais segura. A versão abliterated deve ser vista como uma opção local avançada para quem já entende hospedagem de modelos, moderação e controle de riscos.

Perguntas frequentes

Qwen3.8-Max e 2.4T-A95B são iguais?

Não exatamente. Max pode ser entendido como a versão de serviço oficial baseada no 2.4T-A95B, com recursos como visão, ferramentas e contexto longo.

Roda em uma RTX 4090?

Uma versão 4-bit do 27B pode ser testada com contexto curto ou médio; BF16 e a linha 2.4T não são realistas em uma única GPU de 24GB.

Pode ser usado comercialmente?

27B aparece como Apache-2.0, mais confortável para avaliação comercial; 2.4T-A95B usa licença qwen3.8-max e exige revisar os termos.

Resumo

O valor do Qwen 3.8 está em cobrir tanto a linha Max de grande escala quanto o 27B mais prático. A maioria deve começar pelo 27B ou pelo Qwen Chat antes de investir em inferência pesada na nuvem.

Informações de referência

Entrar

OU

Criar conta

A senha deve ter entre 8 e 20 caracteres e conter letras e números

OU

Esqueceu a Senha

A senha deve ter entre 8 e 20 caracteres e conter letras e números