Posts for: #Benchmark

MTP vs prompt caching — Qwen3.8-27B-FP8 2× H100-on: welche Konfiguration lohnt sich?

Als ich Qwen3.8-27B-FP8 auf zwei H100 betrieben habe, war das MTP-Speculative-Decoding der größte Decode-Gewinn (49 → 95 Tok/s). Aber es gibt einen Haken: In vLLM schließen sich MTP und Prefix-Caching gegenseitig aus. Es blieb also die Frage: Welche Konfiguration gehört in Produktion?

Die Antwort kam aus einem direkten Vergleich der beiden Konfigurationen: GPU0 ohne MTP + Prefix-Caching, GPU1 mit MTP (3 Draft-Tokens). Beide TP1, maximaler Kontext 262K, FP8-KV-Cache, und ein LiteLLM-Proxy verteilt die Last zwischen ihnen. Alle Werte sind TTFT-p50, sofern nicht anders angegeben.

[Weiterlesen]

Qwen 3.6: 35B vs 27B Vergleich - Benchmark-Ergebnisse

Endlich habe ich alle Qwen 3.6 Modell-Testergebnisse zusammengefasst, die ich in den letzten Tagen gesammelt habe. Ich habe zwei Modelle im Detail verglichen: das Qwen3.6-35B-A3B (MoE, hybrid attention/delta) und das Qwen3.6-27B (dense, hybrid attention/delta). Beide habe ich mit turbo3 KV Cache-Kompression auf einer RTX 4090 als llama.cpp Server betrieben.

Wenn ich kurz zusammenfassen müsste: das 35B-A3B ist 3-4x schneller in allem, aber das 27B liefert bessere Qualität. Dies ist der klassische MoE vs. Dense Tradeoff, nur mit Zahlen untermauert.

[Weiterlesen]