Skip to content

Monity dotyczące buforowania

W modelach Claude NordRouter automatycznie buforuje długie konteksty. Jeśli wysyłasz żądania z powtarzającym się początkiem (system podpowiedzi, historia dialogów, duży dokument), za powtarzaną część naliczana jest opłata w cenie odczytu pamięci podręcznej, nawet 90% taniej niż zwykłe wejście.

Jak to działa

  1. Pierwsze żądanie z długim kontekstem - kontekst jest zapisywany w pamięci podręcznej.
  2. Kolejne żądania o tym samym początku — dopasowana część jest odczytywana z pamięci podręcznej po obniżonych kosztach.
  3. Można to zobaczyć w odpowiedzi na usage.prompt_tokens_details.

Ile to kosztuje

Pamięć podręczna działa jak Anthropic - w dwóch stawkach od ceny wyjściowej modelu:

OperacjaMnożnikPrzy obciążeniu
Zapis (zapis w pamięci podręcznej)×1.25Pierwsze zapisanie kontekstu w pamięci podręcznej
Read (cache-read)×0.1 (−90%)każde powtórzenie tego samego kontekstu

Każdy model ma swoją dokładną cenę - patrzkatalog modeli. Przykład dla Claude Fable 5 (wejście 1,548 USD/1 mln): zapis ≈ 1,94 USD/1 mln, odczyt ≈ 0,155 USD/1 mln.

Próg działania

Buforowane są tylko odpowiednio długie konteksty (z kilku tysięcy tokenów). Krótkie żądania są dostępne w regularnej cenie - nie wymagają pamięci podręcznej.

Jak używać

1. Automatycznie – nie trzeba nic robić

Większość ludzi nie ma nic do skonfigurowania. Jeśli Twoje narzędzie wysyła ten sam prefiks (podpowiedź systemowa, historia, duży dokument) - NordRouter buforuje go samodzielnie. To już działa w Claude Code, OpenCode, Cline i wszelkich chatbotach z historią: na każdym kroku agent wysyła cały kontekst - pierwszy krok zapisuje pamięć podręczną, każdy kolejny czyta ją z 90% rabatem.

2. Sprawdź, czy pamięć podręczna zadziałała

Spójrz na blok usage w odpowiedzi - jeśli część danych wejściowych trafiła do pamięci podręcznej, pojawi się cached_tokens:

json
"usage": {
  "prompt_tokens": 21364,
  "prompt_tokens_details": {
    "cached_tokens": 21361     // ← прочитано из кэша по ×0.1
  },
  "completion_tokens": 40
}

cached_tokens > 0 - oznacza to, że ta część wpisu została spisana po cenie czytelniczej, a nie pełnej.

3. Zarządzaj ręcznie za pomocą cache_control

Jeśli chcesz sam zdecydować, co dokładnie buforować (punkt końcowy /v1/messages), umieść znacznik cache_control na końcu bloku, którego ponownie używasz - na przykład w dużym katalogu pod adresem system:

bash
curl https://nordrouter.com/v1/messages \
  -H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "anthropic/claude-fable-5",
    "max_tokens": 512,
    "system": [
      {
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
        "cache_control": { "type": "ephemeral" }
      }
    ],
    "messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
  }'
python
from anthropic import Anthropic

client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")

resp = client.messages.create(
    model="anthropic/claude-fable-5",
    max_tokens=512,
    system=[{
        "type": "text",
        "text": "Ты ассистент по нашей документации. Вот справочник: <...>",
        "cache_control": {"type": "ephemeral"},   # кэшируем справочник
    }],
    messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage)  # cache_creation_input_tokens на 1-м запросе, cache_read на след.

Pierwsze żądanie zapisze katalog do pamięci podręcznej, wszystkie kolejne z tym samym system odczytają go o ×0,1. Twój cache_control jest zawsze priorytetem - automatyczna pamięć podręczna nie zakłóca takich żądań.

Kubek na Twoim koncie osobistym

LCUstawienia → „Monity o buforowaniu (Claude)”:

  • Włączone (domyślnie) - automatyczne buforowanie dla wszystkich żądań Claude bez własnych tokenów. Optymalny dla agentów i dialogów.
  • Wyłączenie ma sens tylko wtedy, gdy każde z Twoich żądań jest całkowicie unikalne - aby nie płacić za zapisywanie pamięci podręcznej, która nie jest ponownie używana.
  • Jeśli samodzielnie przesyłasz cache_control, pozycja przełącznika nie jest istotna, Twoje znaczniki nadal są priorytetem.

Przykład oszczędności

40-stronicowy przewodnik (~30 000 tokenów) z 10 pytaniami do Claude Fable 5:

Bez pamięci podręcznejZ pamięcią podręczną
Co jest spisywane10 × 30k wejść1 zapis + 9 odczytów
Koszt wejścia~0,46 $ (≈41₽)~0,10 $ (≈9₽)

Oszczędność ≈78% – a im więcej pytań w tym samym kontekście, tym silniejszy efekt. Dlatego kodowanie agentowe (w którym kontekst jest wykorzystywany dziesiątki razy) jest znacznie tańsze.