Skip to content

Fábula 5 - Contexto Condensado

anthropic/claude-fable-5-compressed-context - modo experimental de Claude Fable 5. Este é o mesmo modelo com os mesmos preços por token, mas o contexto longo é processado de forma mais compacta: em diálogos grandes, visivelmente menos tokens de entrada são cobrados.

Experimental - todos os riscos são por sua conta

O modo está em fase experimental. Na maioria dos problemas, as respostas não diferem do habitual Fable 5, mas em problemas com reprodução literal ultraprecisa de documentos enormes, são possíveis discrepâncias. Use por sua conta e risco; para cenários críticos, use o anthropic/claude-fable-5 usual.

Quanto isso economiza?

Os preços por token são exatamente os mesmos do Fable 5 normal ($ 1,548 de entrada / $ 7,74 de saída por 1 milhão). A economia ocorre porque o contexto longo conta como menos tokens. Medição ao vivo via NordRouter - o mesmo prompt do sistema ~24 KB:

prompt_tokensCusto de entrada
claude-fable-55 053~$0.0078
claude-fable-5-compressed-context1 287~$0.0020

−75% dos tokens de entrada neste exemplo. Quanto mais longo o contexto, mais tangível será o benefício: na codificação do agente e em chats longos, onde a história é enviada a cada passo, o orçamento é economizado em até 70% ou mais. Para consultas curtas quase não há diferença.

Apenas Anthropic-format

O modo funciona somente por meio de endpoint compatível com Anthropic /v1/messages:

  • ✅ Claude Code
  • ✅ Anthropic SDK (Python / TypeScript)
  • ✅ Qualquer cliente com ANTHROPIC_BASE_URL
  • ❌ OpenAI-format /v1/chat/completions - não suportado para este modo

Como tentar

Claude Code

Em ~/.claude/settings.json coloque o modelo (configuração completa aqui):

json
"ANTHROPIC_MODEL": "anthropic/claude-fable-5-compressed-context"

Anthropic SDK / curl

bash
curl https://nordrouter.com/v1/messages \
  -H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "anthropic/claude-fable-5-compressed-context",
    "max_tokens": 1024,
    "messages": [{ "role": "user", "content": "Привет!" }]
  }'
python
from anthropic import Anthropic

client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")

resp = client.messages.create(
    model="anthropic/claude-fable-5-compressed-context",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.content[0].text)

Cache

Cache de promptfunciona neste modo (mesmas taxas: escrever ×1,25, ler ×0,1). Uma nuance: a correspondência com o cache pode ser parcial - parte do contexto repetido às vezes chega ao preço normal de entrada. Levando em consideração que a entrada em si é considerada várias vezes menor, o custo final ainda é inferior ao de um Fable 5 normal com cache ideal.

Quando escolher o que

CenárioModelo
Codificação baseada em agente, chats longos, documentos grandes em contextoclaude-fable-5-compressed-context - economia máxima
Citação/auditoria literal de textos enormes, pipelines de produção críticosclaude-fable-5 - modo normal
Solicitações curtas sem contexto longoNão há diferença - pegue o