Skip to content

Solicitações de cache

Nos modelos Claude, NordRouter armazena automaticamente em cache contextos longos. Se você enviar solicitações com início repetido (sistema de prompt, histórico de diálogos, documento grande), a parte repetida será cobrada pelo preço de uma leitura de cache, até 90% mais barata que uma entrada normal.

Como funciona

  1. A primeira solicitação com um contexto longo - o contexto é gravado no cache.
  2. Solicitações subsequentes com o mesmo início - a parte correspondente é lida do cache a um custo reduzido.
  3. Isso pode ser visto na resposta em usage.prompt_tokens_details.

Quanto custa

O cache funciona como Anthropic - a duas taxas do preço inicial do modelo:

OperaçãoMultiplicadorQuando debitado
Write (gravação em cache)×1,25primeira vez que o contexto é armazenado em cache
Leitura (leitura de cache)×0,1 (−90%)cada repetição do mesmo contexto

Cada modelo tem seu preço exato - vejacatálogo de modelos. Exemplo em Claude Fable 5 (entrada $ 1,548/1M): escreva ≈ $ 1,94/1M, leia ≈ $ 0,155/1M.

Limite de operação

Apenas contextos suficientemente longos (de vários milhares de tokens) são armazenados em cache. Solicitações curtas têm o preço normal - elas não exigem cache.

Como usar

1. Automaticamente - não há necessidade de fazer nada

A maioria das pessoas não tem nada para configurar. Se a sua ferramenta enviar o mesmo prefixo (prompt do sistema, histórico, documento grande) - NordRouter armazena-o em cache. Isso já funciona em Claude Code, OpenCode, Cline e quaisquer chatbots com histórico: a cada passo o agente envia todo o contexto - o primeiro passo escreve o cache, cada próximo lê com 90% de desconto.

2. Verifique se o cache funcionou

Observe o bloco usage na resposta - se parte da entrada for para o cache, haverá cached_tokens:

json
"usage": {
  "prompt_tokens": 21364,
  "prompt_tokens_details": {
    "cached_tokens": 21361     // ← прочитано из кэша по ×0.1
  },
  "completion_tokens": 40
}

cached_tokens > 0 - significa que esta parte do lançamento foi baixada pelo preço de leitura, e não pelo preço total.

3. Gerencie manualmente via cache_control

Se você quiser decidir por si mesmo o que exatamente armazenar em cache (endpoint /v1/messages), coloque o marcador cache_control no final do bloco que você está reutilizando - por exemplo, em um diretório grande em system:

bash
curl https://nordrouter.com/v1/messages \
  -H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "anthropic/claude-fable-5",
    "max_tokens": 512,
    "system": [
      {
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
        "cache_control": { "type": "ephemeral" }
      }
    ],
    "messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
  }'
python
from anthropic import Anthropic

client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")

resp = client.messages.create(
    model="anthropic/claude-fable-5",
    max_tokens=512,
    system=[{
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...>",
        "cache_control": {"type": "ephemeral"},   # кэшируем справочник
    }],
    messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage)  # cache_creation_input_tokens на 1-м запросе, cache_read на след.

A primeira solicitação gravará o diretório no cache, todas as subsequentes com o mesmo system lerão por ×0,1. Seu cache_control é sempre uma prioridade - o cache automático não interfere nessas solicitações.

Copo na sua conta pessoal

LCConfigurações → “Avisos de cache (Claude)”:

  • Ativado (padrão) - cache automático para todas as solicitações do Claude sem seus próprios tokens. Ideal para agentes e diálogos.
  • Desativar só vale a pena se cada uma de suas solicitações for completamente única - para não pagar pela gravação de um cache que não é reutilizado.
  • Se você mesmo transmitir cache_control, a posição da chave seletora não é importante, seus marcadores ainda são uma prioridade.

Exemplo de poupança

Um guia de 40 páginas (~30.000 tokens) com 10 perguntas para Claude Fable 5:

Sem cacheCom cache
O que está escrito10 × 30k entradas1 gravação + 9 leituras
Custo de entrada~$0,46 (≈41₽)~$0,10 (≈9₽)

Economia ≈78% – e quanto mais perguntas você tiver no mesmo contexto, mais forte será o efeito. É por isso que a codificação baseada em agente (onde o contexto é reutilizado dezenas de vezes) é muito mais barata.