Bajka 5 – skondensowany kontekst
anthropic/claude-fable-5-compressed-context - tryb eksperymentalny Claude Fable 5. Jest to ten sam model z tymi samymi cenami za token, ale długi kontekst jest przetwarzany w bardziej zwięzły sposób: w dużych oknach dialogowych pobierana jest zauważalnie mniej tokenów wejściowych.
Eksperymentalnie – całe ryzyko spoczywa na Tobie
Tryb jest w fazie eksperymentalnej. W przypadku większości problemów odpowiedzi nie różnią się od zwykłych Fable 5, ale w przypadku problemów z ultraprecyzyjnym dosłownym odwzorowaniem dużych dokumentów możliwe są rozbieżności. Używaj na własne ryzyko; w przypadku krytycznych scenariuszy użyj zwykłego anthropic/claude-fable-5.
Ile to oszczędza?
Ceny za token są dokładnie takie same jak w przypadku zwykłego Fable 5 (1,548 USD za wejście / 7,74 USD za wyjście za 1 milion). Oszczędności występują, ponieważ długi kontekst liczy się jako mniej tokenów. Pomiar na żywo przez NordRouter - ten sam monit systemowy ~24 KB:
| Prompt_tokens | Koszt wejścia | |
|---|---|---|
claude-fable-5 | 5 053 | ~$0.0078 |
claude-fable-5-compressed-context | 1 287 | ~$0.0020 |
−75% tokenów wejściowych w tym przykładzie. Im dłuższy kontekst, tym bardziej wymierna korzyść: w kodowaniu agentów i długich czatach, gdzie historia jest przesyłana na każdym kroku, budżet zostaje zaoszczędzony do 70% lub więcej. W przypadku krótkich zapytań nie ma prawie żadnej różnicy.
Tylko Anthropic-format
Tryb działa tylko przez punkt końcowy zgodny z Anthropic /v1/messages:
- ✅ Claude Code
- ✅ Anthropic SDK (Python / TypeScript)
- ✅ Każdy klient z
ANTHROPIC_BASE_URL - ❌ OpenAI-format
/v1/chat/completions- nie jest obsługiwany w tym trybie
Jak spróbować
Claude Code
W ~/.claude/settings.json umieść model (pełna konfiguracja tutaj):
"ANTHROPIC_MODEL": "anthropic/claude-fable-5-compressed-context"Anthropic SDK / curl
curl https://nordrouter.com/v1/messages \
-H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "anthropic/claude-fable-5-compressed-context",
"max_tokens": 1024,
"messages": [{ "role": "user", "content": "Привет!" }]
}'from anthropic import Anthropic
client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")
resp = client.messages.create(
model="anthropic/claude-fable-5-compressed-context",
max_tokens=1024,
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.content[0].text)Buforowanie
Monituj o pamięć podręcznądziała w tym trybie (te same stawki: zapis ×1,25, odczyt ×0,1). Niuans: dopasowanie do pamięci podręcznej może być częściowe – część powtarzającego się kontekstu czasami ma zwykłą cenę wyjściową. Biorąc pod uwagę fakt, że sam wkład jest uważany za kilkakrotnie mniejszy, ostateczny koszt jest nadal niższy niż w przypadku zwykłego Fable 5 z idealną pamięcią podręczną.
Kiedy co wybrać
| Scenariusz | Model |
|---|---|
| Kodowanie agentowe, długie czaty, duże dokumenty w kontekście | claude-fable-5-compressed-context - maksymalne oszczędności |
| Dosłowne cytowanie/audyt dużych tekstów, krytycznych rurociągów produkcyjnych | claude-fable-5 - tryb normalny |
| Krótkie żądania bez długiego kontekstu | Nie ma różnicy – weź zwykłe |