Solicitações de cache
Nos modelos Claude, NordRouter armazena automaticamente em cache contextos longos. Se você enviar solicitações com início repetido (sistema de prompt, histórico de diálogos, documento grande), a parte repetida será cobrada pelo preço de uma leitura de cache, até 90% mais barata que uma entrada normal.
Como funciona
- A primeira solicitação com um contexto longo - o contexto é gravado no cache.
- Solicitações subsequentes com o mesmo início - a parte correspondente é lida do cache a um custo reduzido.
- Isso pode ser visto na resposta em
usage.prompt_tokens_details.
Quanto custa
O cache funciona como Anthropic - a duas taxas do preço inicial do modelo:
| Operação | Multiplicador | Quando debitado |
|---|---|---|
| Write (gravação em cache) | ×1,25 | primeira vez que o contexto é armazenado em cache |
| Leitura (leitura de cache) | ×0,1 (−90%) | cada repetição do mesmo contexto |
Cada modelo tem seu preço exato - vejacatálogo de modelos. Exemplo em Claude Fable 5 (entrada $ 1,548/1M): escreva ≈ $ 1,94/1M, leia ≈ $ 0,155/1M.
Limite de operação
Apenas contextos suficientemente longos (de vários milhares de tokens) são armazenados em cache. Solicitações curtas têm o preço normal - elas não exigem cache.
Como usar
1. Automaticamente - não há necessidade de fazer nada
A maioria das pessoas não tem nada para configurar. Se a sua ferramenta enviar o mesmo prefixo (prompt do sistema, histórico, documento grande) - NordRouter armazena-o em cache. Isso já funciona em Claude Code, OpenCode, Cline e quaisquer chatbots com histórico: a cada passo o agente envia todo o contexto - o primeiro passo escreve o cache, cada próximo lê com 90% de desconto.
2. Verifique se o cache funcionou
Observe o bloco usage na resposta - se parte da entrada for para o cache, haverá cached_tokens:
"usage": {
"prompt_tokens": 21364,
"prompt_tokens_details": {
"cached_tokens": 21361 // ← прочитано из кэша по ×0.1
},
"completion_tokens": 40
}cached_tokens > 0 - significa que esta parte do lançamento foi baixada pelo preço de leitura, e não pelo preço total.
3. Gerencie manualmente via cache_control
Se você quiser decidir por si mesmo o que exatamente armazenar em cache (endpoint /v1/messages), coloque o marcador cache_control no final do bloco que você está reutilizando - por exemplo, em um diretório grande em system:
curl https://nordrouter.com/v1/messages \
-H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "anthropic/claude-fable-5",
"max_tokens": 512,
"system": [
{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
}'from anthropic import Anthropic
client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")
resp = client.messages.create(
model="anthropic/claude-fable-5",
max_tokens=512,
system=[{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...>",
"cache_control": {"type": "ephemeral"}, # кэшируем справочник
}],
messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage) # cache_creation_input_tokens на 1-м запросе, cache_read на след.A primeira solicitação gravará o diretório no cache, todas as subsequentes com o mesmo system lerão por ×0,1. Seu cache_control é sempre uma prioridade - o cache automático não interfere nessas solicitações.
Copo na sua conta pessoal
LC→ Configurações → “Avisos de cache (Claude)”:
- Ativado (padrão) - cache automático para todas as solicitações do Claude sem seus próprios tokens. Ideal para agentes e diálogos.
- Desativar só vale a pena se cada uma de suas solicitações for completamente única - para não pagar pela gravação de um cache que não é reutilizado.
- Se você mesmo transmitir
cache_control, a posição da chave seletora não é importante, seus marcadores ainda são uma prioridade.
Exemplo de poupança
Um guia de 40 páginas (~30.000 tokens) com 10 perguntas para Claude Fable 5:
| Sem cache | Com cache | |
|---|---|---|
| O que está escrito | 10 × 30k entradas | 1 gravação + 9 leituras |
| Custo de entrada | ~$0,46 (≈41₽) | ~$0,10 (≈9₽) |
Economia ≈78% – e quanto mais perguntas você tiver no mesmo contexto, mais forte será o efeito. É por isso que a codificação baseada em agente (onde o contexto é reutilizado dezenas de vezes) é muito mais barata.