Posts for: #Qwen

MTP vs. prompt caching — Qwen3.8-27B-FP8 em 2× H100: qual configuração usar?

Ao rodar o Qwen3.8-27B-FP8 em duas H100, o speculative decoding MTP foi o maior ganho de decode (49 → 95 tok/s). Mas tem um detalhe: no vLLM, MTP e prefix caching são mutuamente exclusivos. Então a pergunta foi: qual configuração usar em produção?

A resposta veio de um comparativo direto entre as duas configurações: GPU0 sem MTP + prefix caching, GPU1 com MTP (3 draft tokens). As duas TP1, contexto máximo de 262K, KV cache FP8, e um proxy LiteLLM distribuindo a carga entre elas. Todos os números são TTFT p50, salvo indicação em contrário.

[Ler mais]

Qwen 3.6: Comparação 35B vs 27B - resultados de benchmark

Finalmente resumi todos os resultados dos testes dos modelos Qwen 3.6 que coletei nos últimos dias. Comparei dois modelos em detalhes: o Qwen3.6-35B-A3B (MoE, hybrid attention/delta) e o Qwen3.6-27B (dense, hybrid attention/delta). Executei ambos com compressão de cache KV turbo3 em uma RTX 4090 como servidor llama.cpp.

Se eu tivesse que resumir brevemente: o 35B-A3B é 3-4x mais rápido em tudo, mas o 27B entrega melhor qualidade. Este é o tradeoff clássico MoE vs. dense, apenas apoiado por números.

[Ler mais]