Fábula 5 - Contexto Condensado
anthropic/claude-fable-5-compressed-context - modo experimental de Claude Fable 5. Este é o mesmo modelo com os mesmos preços por token, mas o contexto longo é processado de forma mais compacta: em diálogos grandes, visivelmente menos tokens de entrada são cobrados.
Experimental - todos os riscos são por sua conta
O modo está em fase experimental. Na maioria dos problemas, as respostas não diferem do habitual Fable 5, mas em problemas com reprodução literal ultraprecisa de documentos enormes, são possíveis discrepâncias. Use por sua conta e risco; para cenários críticos, use o anthropic/claude-fable-5 usual.
Quanto isso economiza?
Os preços por token são exatamente os mesmos do Fable 5 normal ($ 1,548 de entrada / $ 7,74 de saída por 1 milhão). A economia ocorre porque o contexto longo conta como menos tokens. Medição ao vivo via NordRouter - o mesmo prompt do sistema ~24 KB:
| prompt_tokens | Custo de entrada | |
|---|---|---|
claude-fable-5 | 5 053 | ~$0.0078 |
claude-fable-5-compressed-context | 1 287 | ~$0.0020 |
−75% dos tokens de entrada neste exemplo. Quanto mais longo o contexto, mais tangível será o benefício: na codificação do agente e em chats longos, onde a história é enviada a cada passo, o orçamento é economizado em até 70% ou mais. Para consultas curtas quase não há diferença.
Apenas Anthropic-format
O modo funciona somente por meio de endpoint compatível com Anthropic /v1/messages:
- ✅ Claude Code
- ✅ Anthropic SDK (Python / TypeScript)
- ✅ Qualquer cliente com
ANTHROPIC_BASE_URL - ❌ OpenAI-format
/v1/chat/completions- não suportado para este modo
Como tentar
Claude Code
Em ~/.claude/settings.json coloque o modelo (configuração completa aqui):
"ANTHROPIC_MODEL": "anthropic/claude-fable-5-compressed-context"Anthropic SDK / curl
curl https://nordrouter.com/v1/messages \
-H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "anthropic/claude-fable-5-compressed-context",
"max_tokens": 1024,
"messages": [{ "role": "user", "content": "Привет!" }]
}'from anthropic import Anthropic
client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")
resp = client.messages.create(
model="anthropic/claude-fable-5-compressed-context",
max_tokens=1024,
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.content[0].text)Cache
Cache de promptfunciona neste modo (mesmas taxas: escrever ×1,25, ler ×0,1). Uma nuance: a correspondência com o cache pode ser parcial - parte do contexto repetido às vezes chega ao preço normal de entrada. Levando em consideração que a entrada em si é considerada várias vezes menor, o custo final ainda é inferior ao de um Fable 5 normal com cache ideal.
Quando escolher o que
| Cenário | Modelo |
|---|---|
| Codificação baseada em agente, chats longos, documentos grandes em contexto | claude-fable-5-compressed-context - economia máxima |
| Citação/auditoria literal de textos enormes, pipelines de produção críticos | claude-fable-5 - modo normal |
| Solicitações curtas sem contexto longo | Não há diferença - pegue o |