A minap két H100-on is lefuttattam a Qwen3.8-27B-FP8-at, és az MTP-speculative decoding hozta a legnagyobb decode-gyorsulást (49 → 95 tok/s). De van egy bökkenő: a vLLM-ben az MTP és a prefix caching kölcsönösen kizárja egymást, szóval az volt a kérdés, hogy melyik konfigurációt érdemes élesben használni.
A választ úgy kaptam meg, hogy egymás ellen futtattam a két verziót: GPU0 no-MTP + prefix caching, GPU1 MTP (3 draft token). Mindkettő TP1-es, 262K maximum kontextus, FP8 KV cache, és egy LiteLLM proxy osztja el köztük a forgalmat. Az összes szám TTFT p50, hacsak nem írom másképp.