Monity dotyczące buforowania
W modelach Claude NordRouter automatycznie buforuje długie konteksty. Jeśli wysyłasz żądania z powtarzającym się początkiem (system podpowiedzi, historia dialogów, duży dokument), za powtarzaną część naliczana jest opłata w cenie odczytu pamięci podręcznej, nawet 90% taniej niż zwykłe wejście.
Jak to działa
- Pierwsze żądanie z długim kontekstem - kontekst jest zapisywany w pamięci podręcznej.
- Kolejne żądania o tym samym początku — dopasowana część jest odczytywana z pamięci podręcznej po obniżonych kosztach.
- Można to zobaczyć w odpowiedzi na
usage.prompt_tokens_details.
Ile to kosztuje
Pamięć podręczna działa jak Anthropic - w dwóch stawkach od ceny wyjściowej modelu:
| Operacja | Mnożnik | Przy obciążeniu |
|---|---|---|
| Zapis (zapis w pamięci podręcznej) | ×1.25 | Pierwsze zapisanie kontekstu w pamięci podręcznej |
| Read (cache-read) | ×0.1 (−90%) | każde powtórzenie tego samego kontekstu |
Każdy model ma swoją dokładną cenę - patrzkatalog modeli. Przykład dla Claude Fable 5 (wejście 1,548 USD/1 mln): zapis ≈ 1,94 USD/1 mln, odczyt ≈ 0,155 USD/1 mln.
Próg działania
Buforowane są tylko odpowiednio długie konteksty (z kilku tysięcy tokenów). Krótkie żądania są dostępne w regularnej cenie - nie wymagają pamięci podręcznej.
Jak używać
1. Automatycznie – nie trzeba nic robić
Większość ludzi nie ma nic do skonfigurowania. Jeśli Twoje narzędzie wysyła ten sam prefiks (podpowiedź systemowa, historia, duży dokument) - NordRouter buforuje go samodzielnie. To już działa w Claude Code, OpenCode, Cline i wszelkich chatbotach z historią: na każdym kroku agent wysyła cały kontekst - pierwszy krok zapisuje pamięć podręczną, każdy kolejny czyta ją z 90% rabatem.
2. Sprawdź, czy pamięć podręczna zadziałała
Spójrz na blok usage w odpowiedzi - jeśli część danych wejściowych trafiła do pamięci podręcznej, pojawi się cached_tokens:
"usage": {
"prompt_tokens": 21364,
"prompt_tokens_details": {
"cached_tokens": 21361 // ← прочитано из кэша по ×0.1
},
"completion_tokens": 40
}cached_tokens > 0 - oznacza to, że ta część wpisu została spisana po cenie czytelniczej, a nie pełnej.
3. Zarządzaj ręcznie za pomocą cache_control
Jeśli chcesz sam zdecydować, co dokładnie buforować (punkt końcowy /v1/messages), umieść znacznik cache_control na końcu bloku, którego ponownie używasz - na przykład w dużym katalogu pod adresem system:
curl https://nordrouter.com/v1/messages \
-H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "anthropic/claude-fable-5",
"max_tokens": 512,
"system": [
{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
}'from anthropic import Anthropic
client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")
resp = client.messages.create(
model="anthropic/claude-fable-5",
max_tokens=512,
system=[{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...>",
"cache_control": {"type": "ephemeral"}, # кэшируем справочник
}],
messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage) # cache_creation_input_tokens на 1-м запросе, cache_read на след.Pierwsze żądanie zapisze katalog do pamięci podręcznej, wszystkie kolejne z tym samym system odczytają go o ×0,1. Twój cache_control jest zawsze priorytetem - automatyczna pamięć podręczna nie zakłóca takich żądań.
Kubek na Twoim koncie osobistym
LC→ Ustawienia → „Monity o buforowaniu (Claude)”:
- Włączone (domyślnie) - automatyczne buforowanie dla wszystkich żądań Claude bez własnych tokenów. Optymalny dla agentów i dialogów.
- Wyłączenie ma sens tylko wtedy, gdy każde z Twoich żądań jest całkowicie unikalne - aby nie płacić za zapisywanie pamięci podręcznej, która nie jest ponownie używana.
- Jeśli samodzielnie przesyłasz
cache_control, pozycja przełącznika nie jest istotna, Twoje znaczniki nadal są priorytetem.
Przykład oszczędności
40-stronicowy przewodnik (~30 000 tokenów) z 10 pytaniami do Claude Fable 5:
| Bez pamięci podręcznej | Z pamięcią podręczną | |
|---|---|---|
| Co jest spisywane | 10 × 30k wejść | 1 zapis + 9 odczytów |
| Koszt wejścia | ~0,46 $ (≈41₽) | ~0,10 $ (≈9₽) |
Oszczędność ≈78% – a im więcej pytań w tym samym kontekście, tym silniejszy efekt. Dlatego kodowanie agentowe (w którym kontekst jest wykorzystywany dziesiątki razy) jest znacznie tańsze.