Tag: prompt caching
-

Prompt caching via API: a alavanca de custo que mora no formato do prompt
Prompt caching via API: escrever custa 25% a mais, ler custa 10%. O layout de prompt que vira economia real na Anthropic, OpenAI e Gemini. -

Latência, qualidade, custo e confiabilidade: o mapa do stack de inferência
Latência, qualidade, custo e confiabilidade: os quatro eixos que todo knob do stack de inferência move, com preços e limites verificados em 2026. -

O efeito snowball: por que a mensagem 50 pesa 6x na janela de contexto
Cada mensagem pesa mais na janela de contexto. A fórmula do custo quadrático e um HUD de statusline pra ver a bola de neve crescer.
