Posts for: #Ai

MTP vs prompt caching — Qwen3.8-27B-FP8 2× H100-on: welche Konfiguration lohnt sich?

Als ich Qwen3.8-27B-FP8 auf zwei H100 betrieben habe, war das MTP-Speculative-Decoding der größte Decode-Gewinn (49 → 95 Tok/s). Aber es gibt einen Haken: In vLLM schließen sich MTP und Prefix-Caching gegenseitig aus. Es blieb also die Frage: Welche Konfiguration gehört in Produktion?

Die Antwort kam aus einem direkten Vergleich der beiden Konfigurationen: GPU0 ohne MTP + Prefix-Caching, GPU1 mit MTP (3 Draft-Tokens). Beide TP1, maximaler Kontext 262K, FP8-KV-Cache, und ein LiteLLM-Proxy verteilt die Last zwischen ihnen. Alle Werte sind TTFT-p50, sofern nicht anders angegeben.

[Weiterlesen]

Memorito — persönliche Wissensdatenbank mit automatischer Suche

Ich habe viel im Internet gesucht und festgestellt, dass mein persönliches Wissen überall verstreut war: Notizen, PDFs, Lesezeichen, Zettel, Links, Bilder, Sprachaufnahmen — alles an verschiedenen Orten, nie auffindbar, wenn ich es brauchte. Notion war gut, aber ich wollte den Inhalt meines Gehirns nicht in einen anderen SaaS-Dienst geben.

Dann dachte ich: “Warum baue ich nicht meine eigene?”

Und ich tat es.

Was ist Memorito?

Memorito ist eine selbst gehostete, multimodale Wissensdatenbank, die ich für mich selbst gebaut habe — kein fertiges Produkt, das ich nutze, sondern etwas, das ich für meine eigenen Bedürfnisse codiert und kontinuierlich weiterentwickelt habe. Es kann Texte, URLs, Bilder, Audio-Dateien und PDFs verarbeiten, indexieren und durchsuchen. Nicht nur Schlüsselwortsuche — semantische Suche, also findet es relevante Inhalte basierend auf der Bedeutung.

[Weiterlesen]

Qwen 3.6: 35B vs 27B Vergleich - Benchmark-Ergebnisse

Endlich habe ich alle Qwen 3.6 Modell-Testergebnisse zusammengefasst, die ich in den letzten Tagen gesammelt habe. Ich habe zwei Modelle im Detail verglichen: das Qwen3.6-35B-A3B (MoE, hybrid attention/delta) und das Qwen3.6-27B (dense, hybrid attention/delta). Beide habe ich mit turbo3 KV Cache-Kompression auf einer RTX 4090 als llama.cpp Server betrieben.

Wenn ich kurz zusammenfassen müsste: das 35B-A3B ist 3-4x schneller in allem, aber das 27B liefert bessere Qualität. Dies ist der klassische MoE vs. Dense Tradeoff, nur mit Zahlen untermauert.

[Weiterlesen]

Migration des Blogs von WordPress zu Hugo mit OpenCode

Mein letzter Beitrag wurde im März 2021 veröffentlicht, und seitdem ist fast nichts mit dem Blog passiert - trotz Umzügen, Serverwechseln und zahlreichen anderen Entwicklungen. WordPress war eher irritierend als hilfreich für die Rückkehr zum Schreiben von Beiträgen: Es war langsam, erforderte ständige Plugin-Updates und Sicherheitslücken häuften sich, während es für einen Blog, der nur wenige Beiträge pro Jahr veröffentlicht, übermäßig komplex war.

Seit Jahren hatte ich erwogen, zu einem statischen Site-Generator zu wechseln, aber der Gedanke an die Migration - 87 Beiträge, viele HTML-Überreste, Mediendateien - schreckte mich immer ab. Dann entdeckte ich OpenCode, und alles änderte sich.

[Weiterlesen]