Кэширування промптів
На моделях Клод NordRouter автоматично кесірує довгі контексти.Якщо ви забираєте запити з повторюваним початком (система-промпт, історія діалогу, великий документ) повторна частина тарифірується за ціною кесійна читання, до 90% дешевше звичайного входу.
Як це працює?
- Перший запит з довгим контекстом контекст запишується в кэш.
- Наступні запити з тією ж початком відповідна частина читається з кашею за знижену ціну.
- У відповідь це можна побачити по
usage.prompt_tokens_details.
Скільки це коштує?
Кэш працює як у Anthropic по двох ставках від ціни входу моделі:
| Операція | Помноження | Коли виписано |
|---|---|---|
| Запис (каше-запис) | ×1.25 | вперше, коли контекст трапиться в каше |
| Чтання (каше-читання) | ×0.1 (−90%) | кожен повторений повстання одного і того ж контексту |
Точний ценовий показник кожного моделі має свій власний подивітьсяКаталог моделейНаприклад, Клод Фабль 5 (вхід $1.548/1М): запис ≈ $1.94/1М, читання ≈ $0.155/1М.
Поточний рівень завантаження
Кесерюються лише досить довгі контексти (від декількох тисяч токенів).Краткі запити заходять за звичайною ціною для них не потрібен кэш.
Як використовувати
1.Автоматне нічого не робити
У більшості випадків немає чого налаштувати. Якщо ваш інструмент відправляє один і той же префікс (системний промпт, історія, великий документ) NordRouter кесірує його самостійно. Так вже працює в Claude Code, OpenCode, Cline і будь-яких чатах з історією: на кожному кроку агент відправляє весь контекст перший крок записується в кесію, кожен наступний читає його з знижкою 90%.
2. Перевірте, що кашовий фонд працював.
Подивіться на блок usage у відповіді якщо частина входу потрапила в кэш, то там буде cached_tokens:
"usage": {
"prompt_tokens": 21364,
"prompt_tokens_details": {
"cached_tokens": 21361 // ← прочитано из кэша по ×0.1
},
"completion_tokens": 40
}cached_tokens > 0 означає, що ця частина входу була відписана за ціною читання, а не повністю.
3. Ручно керувати через cache_control
Якщо ви хочете самостійно вирішити, що саме кешувати (індек /v1/messages), поставіть маркер cache_control на кінці блоку, який ви перепробуєте, наприклад, в великому справочнику в system:
curl https://nordrouter.com/v1/messages \
-H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "anthropic/claude-fable-5",
"max_tokens": 512,
"system": [
{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
}'from anthropic import Anthropic
client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")
resp = client.messages.create(
model="anthropic/claude-fable-5",
max_tokens=512,
system=[{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...>",
"cache_control": {"type": "ephemeral"}, # кэшируем справочник
}],
messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage) # cache_creation_input_tokens на 1-м запросе, cache_read на след.Перший запит записує справочник в каші, всі наступні з одним і тим же system **читають його по ×0.1. Ваш cache_control завжди є пріоритетом авто-кашів не заважає таким запитам.
Тумблер у особистому кабінеті
ЛК→ Настройки → Кэшиювання промптів (Клод)::
- Включений (за замовчуванням) авто-поштовка для всіх запитів Клод без своїх маркерів.
- ** Виключити ** варто тільки в тому випадку, якщо кожен ваш запит є повністю унікальним, щоб не платити за запис, який не використовується повторно.
- Якщо ви передаєте
cache_controlсамостійно, то не важливо, що місце знаходиться тумблера, але ваші маркері все одно мають пріоритет.
Приклад економії
Справочник на 40 сторінках (~30 000 токенів), до якого додано 10 питань Клод Фейб 5:
| Без кашову кошти | С кашом | |
|---|---|---|
| Що виписано | 10 × 30k вхід | 1 запис + 9 читання |
| Вартість входу | ~$0.46 (≈41) | ~$0.10 (≈9) |
Збереження ≈78% і чим більше запитів до того ж контексту, тим сильніший ефект. Саме тому агентський кодування (де контекст використовується десятки разів) виходить в десятки разів дешевше.