Posts for: #Ai

MTP vs. prompt caching — Qwen3.8-27B-FP8 em 2× H100: qual configuração usar?

Ao rodar o Qwen3.8-27B-FP8 em duas H100, o speculative decoding MTP foi o maior ganho de decode (49 → 95 tok/s). Mas tem um detalhe: no vLLM, MTP e prefix caching são mutuamente exclusivos. Então a pergunta foi: qual configuração usar em produção?

A resposta veio de um comparativo direto entre as duas configurações: GPU0 sem MTP + prefix caching, GPU1 com MTP (3 draft tokens). As duas TP1, contexto máximo de 262K, KV cache FP8, e um proxy LiteLLM distribuindo a carga entre elas. Todos os números são TTFT p50, salvo indicação em contrário.

[Ler mais]

Memorito — base de conhecimento pessoal com busca automatizada

Passei muito tempo procurando na internet e percebi que meu conhecimento pessoal estava espalhado por todo lugar: anotações, PDFs, bookmarks, recados, links, imagens, gravações de áudio — tudo em lugares diferentes, impossível de encontrar quando precisava. O Notion era bom, mas não queria colocar o conteúdo do meu cérebro em outro serviço SaaS.

Então pensei: “Por que não construo a minha própria?”

E construí.

O que é Memorito?

Memorito é uma base de conhecimento multimodal self-hosted que eu criei para mim mesmo — não um produto pronto que uso, mas algo que codifiquei para minhas próprias necessidades e continuo desenvolvendo. Ele pode processar, indexar e buscar texto, URLs, imagens, arquivos de áudio e PDFs. Não é apenas busca por palavra-chave — é busca semântica, ou seja, encontra conteúdo relevante baseado no significado.

[Ler mais]

Qwen 3.6: Comparação 35B vs 27B - resultados de benchmark

Finalmente resumi todos os resultados dos testes dos modelos Qwen 3.6 que coletei nos últimos dias. Comparei dois modelos em detalhes: o Qwen3.6-35B-A3B (MoE, hybrid attention/delta) e o Qwen3.6-27B (dense, hybrid attention/delta). Executei ambos com compressão de cache KV turbo3 em uma RTX 4090 como servidor llama.cpp.

Se eu tivesse que resumir brevemente: o 35B-A3B é 3-4x mais rápido em tudo, mas o 27B entrega melhor qualidade. Este é o tradeoff clássico MoE vs. dense, apenas apoiado por números.

[Ler mais]

Migrando o Blog do WordPress para Hugo com OpenCode

Minha última postagem foi publicada em março de 2021, e desde então, quase nada aconteceu com o blog - apesar de mudanças, troca de servidor e vários outros desenvolvimentos. O WordPress tinha sido mais irritante do que útil para retornar à escrita de postagens: era lento, exigia atualizações constantes de plugins e vulnerabilidades de segurança continuavam aparecendo, enquanto para um blog que publica apenas algumas postagens por ano, era excessivamente complexo.

[Ler mais]