Ao rodar o Qwen3.8-27B-FP8 em duas H100, o speculative decoding MTP foi o maior ganho de decode (49 → 95 tok/s). Mas tem um detalhe: no vLLM, MTP e prefix caching são mutuamente exclusivos. Então a pergunta foi: qual configuração usar em produção?

A resposta veio de um comparativo direto entre as duas configurações: GPU0 sem MTP + prefix caching, GPU1 com MTP (3 draft tokens). As duas TP1, contexto máximo de 262K, KV cache FP8, e um proxy LiteLLM distribuindo a carga entre elas. Todos os números são TTFT p50, salvo indicação em contrário.