Tag: API de LLM
-

Prompt caching via API: a alavanca de custo que mora no formato do prompt
Prompt caching via API: escrever custa 25% a mais, ler custa 10%. O layout de prompt que vira economia real na Anthropic, OpenAI e Gemini. -

Token budget por agente: o rate limiter que protege o seu orçamento
Token budget por agente: rate limit de provedor controla taxa, não gasto. Como impor teto de custo por request, sessão, agente e tenant.
