Als ich Qwen3.8-27B-FP8 auf zwei H100 betrieben habe, war das MTP-Speculative-Decoding der größte Decode-Gewinn (49 → 95 Tok/s). Aber es gibt einen Haken: In vLLM schließen sich MTP und Prefix-Caching gegenseitig aus. Es blieb also die Frage: Welche Konfiguration gehört in Produktion?

Die Antwort kam aus einem direkten Vergleich der beiden Konfigurationen: GPU0 ohne MTP + Prefix-Caching, GPU1 mit MTP (3 Draft-Tokens). Beide TP1, maximaler Kontext 262K, FP8-KV-Cache, und ein LiteLLM-Proxy verteilt die Last zwischen ihnen. Alle Werte sind TTFT-p50, sofern nicht anders angegeben.