Skip to content

Кэширування промптів

На моделях Клод NordRouter автоматично кесірує довгі контексти.Якщо ви забираєте запити з повторюваним початком (система-промпт, історія діалогу, великий документ) повторна частина тарифірується за ціною кесійна читання, до 90% дешевше звичайного входу.

Як це працює?

  1. Перший запит з довгим контекстом контекст запишується в кэш.
  2. Наступні запити з тією ж початком відповідна частина читається з кашею за знижену ціну.
  3. У відповідь це можна побачити по usage.prompt_tokens_details.

Скільки це коштує?

Кэш працює як у Anthropic по двох ставках від ціни входу моделі:

ОпераціяПомноженняКоли виписано
Запис (каше-запис)×1.25вперше, коли контекст трапиться в каше
Чтання (каше-читання)×0.1 (−90%)кожен повторений повстання одного і того ж контексту

Точний ценовий показник кожного моделі має свій власний подивітьсяКаталог моделейНаприклад, Клод Фабль 5 (вхід $1.548/1М): запис ≈ $1.94/1М, читання ≈ $0.155/1М.

Поточний рівень завантаження

Кесерюються лише досить довгі контексти (від декількох тисяч токенів).Краткі запити заходять за звичайною ціною для них не потрібен кэш.

Як використовувати

1.Автоматне нічого не робити

У більшості випадків немає чого налаштувати. Якщо ваш інструмент відправляє один і той же префікс (системний промпт, історія, великий документ) NordRouter кесірує його самостійно. Так вже працює в Claude Code, OpenCode, Cline і будь-яких чатах з історією: на кожному кроку агент відправляє весь контекст перший крок записується в кесію, кожен наступний читає його з знижкою 90%.

2. Перевірте, що кашовий фонд працював.

Подивіться на блок usage у відповіді якщо частина входу потрапила в кэш, то там буде cached_tokens:

json
"usage": {
  "prompt_tokens": 21364,
  "prompt_tokens_details": {
    "cached_tokens": 21361     // ← прочитано из кэша по ×0.1
  },
  "completion_tokens": 40
}

cached_tokens > 0 означає, що ця частина входу була відписана за ціною читання, а не повністю.

3. Ручно керувати через cache_control

Якщо ви хочете самостійно вирішити, що саме кешувати (індек /v1/messages), поставіть маркер cache_control на кінці блоку, який ви перепробуєте, наприклад, в великому справочнику в system:

bash
curl https://nordrouter.com/v1/messages \
  -H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "anthropic/claude-fable-5",
    "max_tokens": 512,
    "system": [
      {
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
        "cache_control": { "type": "ephemeral" }
      }
    ],
    "messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
  }'
python
from anthropic import Anthropic

client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")

resp = client.messages.create(
    model="anthropic/claude-fable-5",
    max_tokens=512,
    system=[{
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...>",
        "cache_control": {"type": "ephemeral"},   # кэшируем справочник
    }],
    messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage)  # cache_creation_input_tokens на 1-м запросе, cache_read на след.

Перший запит записує справочник в каші, всі наступні з одним і тим же system **читають його по ×0.1. Ваш cache_control завжди є пріоритетом авто-кашів не заважає таким запитам.

Тумблер у особистому кабінеті

ЛКНастройки → Кэшиювання промптів (Клод)::

  • Включений (за замовчуванням) авто-поштовка для всіх запитів Клод без своїх маркерів.
  • ** Виключити ** варто тільки в тому випадку, якщо кожен ваш запит є повністю унікальним, щоб не платити за запис, який не використовується повторно.
  • Якщо ви передаєте cache_control самостійно, то не важливо, що місце знаходиться тумблера, але ваші маркері все одно мають пріоритет.

Приклад економії

Справочник на 40 сторінках (~30 000 токенів), до якого додано 10 питань Клод Фейб 5:

Без кашову коштиС кашом
Що виписано10 × 30k вхід1 запис + 9 читання
Вартість входу~$0.46 (≈41)~$0.10 (≈9)

Збереження ≈78% і чим більше запитів до того ж контексту, тим сильніший ефект. Саме тому агентський кодування (де контекст використовується десятки разів) виходить в десятки разів дешевше.