Skip to content

Fable 5 — сжатый контекст

anthropic/claude-fable-5-compressed-context — экспериментальный режим Claude Fable 5. Это та же модель с теми же ценами за токен, но длинный контекст обрабатывается компактнее: в объёмных диалогах тарифицируется заметно меньше входных токенов.

Экспериментально — все риски на вас

Режим в стадии эксперимента. На большинстве задач ответы не отличаются от обычного Fable 5, но на задачах со сверхточным дословным воспроизведением огромных документов возможны расхождения. Используете на свой риск; для критичных сценариев берите обычный anthropic/claude-fable-5.

Сколько экономит

Цены за токен — ровно как у обычного Fable 5 ($1.548 вход / $7.74 выход за 1M). Экономия возникает из-за того, что длинный контекст считается меньшим числом токенов. Живой замер через NordRouter — одинаковый системный промпт ~24 KB:

prompt_tokensСтоимость входа
claude-fable-55 053~$0.0078
claude-fable-5-compressed-context1 287~$0.0020

−75% входных токенов на этом примере. Чем длиннее контекст, тем ощутимее выгода: в агентном кодинге и долгих чатах, где история пересылается на каждом шаге, бюджет экономится до 70% и больше. На коротких запросах разницы почти нет.

Только Anthropic-формат

Режим работает только через Anthropic-совместимый эндпоинт /v1/messages:

  • ✅ Claude Code
  • ✅ Anthropic SDK (Python / TypeScript)
  • ✅ Любой клиент с ANTHROPIC_BASE_URL
  • ❌ OpenAI-формат /v1/chat/completions — не поддерживается для этого режима

Как попробовать

Claude Code

В ~/.claude/settings.json поставьте модель (полный конфиг здесь):

json
"ANTHROPIC_MODEL": "anthropic/claude-fable-5-compressed-context"

Anthropic SDK / curl

bash
curl https://nordrouter.com/v1/messages \
  -H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "anthropic/claude-fable-5-compressed-context",
    "max_tokens": 1024,
    "messages": [{ "role": "user", "content": "Привет!" }]
  }'
python
from anthropic import Anthropic

client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")

resp = client.messages.create(
    model="anthropic/claude-fable-5-compressed-context",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.content[0].text)

Кэширование

Кэш промптов работает и в этом режиме (те же ставки: запись ×1.25, чтение ×0.1). Нюанс: совпадение с кэшем может быть частичным — часть повторного контекста иногда идёт по обычной цене входа. С учётом того, что сам вход считается в разы меньшим, итоговая стоимость всё равно ниже, чем у обычного Fable 5 с идеальным кэшем.

Когда что выбирать

СценарийМодель
Агентный кодинг, длинные чаты, большие документы в контекстеclaude-fable-5-compressed-context — максимум экономии
Дословное цитирование/аудит огромных текстов, критичные продакшен-пайплайныclaude-fable-5 — обычный режим
Короткие запросы без длинного контекстаРазницы нет — берите обычный