<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>H100 on ZoliBen Csupra(Kabra)</title>
    <link>https://zoliben.com/pt-br/tags/h100/</link>
    <description>Recent content in H100 on ZoliBen Csupra(Kabra)</description>
    <generator>Hugo</generator>
    <language>pt-br</language>
    <lastBuildDate>Tue, 18 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://zoliben.com/pt-br/tags/h100/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>MTP vs. prompt caching — Qwen3.8-27B-FP8 em 2× H100: qual configuração usar?</title>
      <link>https://zoliben.com/pt-br/posts/2026-08-18-qwen-mtp-vs-prefix-cache-h100/</link>
      <pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://zoliben.com/pt-br/posts/2026-08-18-qwen-mtp-vs-prefix-cache-h100/</guid>
      <description>&lt;p&gt;Ao rodar o Qwen3.8-27B-FP8 em duas H100, o speculative decoding MTP foi o maior ganho de decode (49 → 95 tok/s). Mas tem um detalhe: no vLLM, &lt;strong&gt;MTP e prefix caching são mutuamente exclusivos&lt;/strong&gt;. Então a pergunta foi: qual configuração usar em produção?&lt;/p&gt;&#xA;&lt;p&gt;A resposta veio de um comparativo direto entre as duas configurações: &lt;strong&gt;GPU0 sem MTP + prefix caching&lt;/strong&gt;, &lt;strong&gt;GPU1 com MTP&lt;/strong&gt; (3 draft tokens). As duas TP1, contexto máximo de 262K, KV cache FP8, e um proxy LiteLLM distribuindo a carga entre elas. Todos os números são TTFT p50, salvo indicação em contrário.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
