Perintah cache
Pada model Claude, NordRouter secara otomatis menyimpan konteks yang panjang dalam cache. Jika Anda mengirim permintaan dengan permulaan yang berulang (sistem prompt, riwayat dialog, dokumen besar), bagian yang berulang akan dikenakan harga pembacaan cache, lebih murah hingga 90% dibandingkan masukan biasa.
Bagaimana cara kerjanya
- Permintaan pertama dengan konteks panjang - konteksnya ditulis ke cache.
- Permintaan berikutnya dengan awal yang sama - bagian yang cocok dibaca dari cache dengan biaya lebih rendah.
- Hal ini dapat dilihat pada jawaban di
usage.prompt_tokens_details.
Berapa biayanya
Cache berfungsi seperti Anthropic - dengan dua tarif dari harga masuk model:
| Pengoperasian | Pengganda | Saat didebit |
|---|---|---|
| Write (cache-write) | ×1.25 | pertama kali konteksnya di-cache |
| Read (cache-read) | ×0.1 (−90%) | setiap pengulangan konteks yang sama |
Setiap model memiliki harga pastinya sendiri - lihatkatalog model. Contoh pada Claude Fable 5 (input $1.548/1M): tulis ≈ $1.94/1M, baca ≈ $0.155/1M.
Ambang batas operasi
Hanya konteks yang cukup panjang (dari beberapa ribu token) yang di-cache. Permintaan singkat datang dengan harga reguler - tidak memerlukan cache.
Cara menggunakan
1. Secara otomatis - tidak perlu melakukan apa pun
Kebanyakan orang tidak punya apa-apa untuk dikonfigurasi. Jika alat Anda mengirimkan awalan yang sama (prompt sistem, riwayat, dokumen besar) - NordRouter menyimpannya dalam cache. Ini sudah berfungsi di Claude Code, OpenCode, Cline dan chatbot apa pun yang memiliki riwayat: di setiap langkah agen mengirimkan seluruh konteks - langkah pertama menulis cache, setiap langkah berikutnya membacanya dengan diskon 90%.
2. Periksa apakah cache berfungsi
Lihat blok usage di respons - jika sebagian input masuk ke cache, akan ada cached_tokens:
"usage": {
"prompt_tokens": 21364,
"prompt_tokens_details": {
"cached_tokens": 21361 // ← прочитано из кэша по ×0.1
},
"completion_tokens": 40
}cached_tokens > 0 - ini berarti bagian entri ini dihapuskan pada harga baca, dan bukan harga penuh.
3. Kelola secara manual melalui cache_control
Jika Anda ingin memutuskan sendiri apa yang akan di-cache (titik akhir /v1/messages), letakkan penanda cache_control di akhir blok yang Anda gunakan kembali - misalnya, pada direktori besar di system:
curl https://nordrouter.com/v1/messages \
-H "x-api-key: sk-nr-ВАШ-КЛЮЧ" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "anthropic/claude-fable-5",
"max_tokens": 512,
"system": [
{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...много текста...>",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{ "role": "user", "content": "Первый вопрос по справочнику?" }]
}'from anthropic import Anthropic
client = Anthropic(base_url="https://nordrouter.com", api_key="sk-nr-ВАШ-КЛЮЧ")
resp = client.messages.create(
model="anthropic/claude-fable-5",
max_tokens=512,
system=[{
"type": "text",
"text": "Ты ассистент по нашей документации. Вот справочник: <...>",
"cache_control": {"type": "ephemeral"}, # кэшируем справочник
}],
messages=[{"role": "user", "content": "Первый вопрос по справочнику?"}],
)
print(resp.usage) # cache_creation_input_tokens на 1-м запросе, cache_read на след.Permintaan pertama akan menulis direktori ke dalam cache, semua permintaan berikutnya dengan system yang sama membacanya sebanyak ×0,1. cache_control Anda selalu menjadi prioritas - cache otomatis tidak mengganggu permintaan tersebut.
Tumbler di akun pribadi Anda
LC→ Pengaturan → “Permintaan cache (Claude)”:
- Diaktifkan (default) - cache otomatis untuk semua permintaan Claude tanpa tokennya sendiri. Optimal untuk agen dan dialog.
- Nonaktifkan hanya bermanfaat jika setiap permintaan Anda benar-benar unik - agar tidak membayar untuk menulis cache yang tidak digunakan kembali.
- Jika Anda mengirimkan sendiri
cache_control, posisi sakelar sakelar tidak penting, penanda Anda tetap menjadi prioritas.
Contoh tabungan
Panduan 40 halaman (~30.000 token) dengan 10 pertanyaan untuk Claude Fable 5:
| Tanpa cache | Dengan cache | |
|---|---|---|
| Apa yang dihapuskan | 10×30k input | 1 tulis + 9 baca |
| Biaya masuk | ~$0.46 (≈41₽) | ~$0.10 (≈9₽) |
Penghematan ≈78% - dan semakin banyak pertanyaan yang Anda miliki dalam konteks yang sama, semakin kuat efeknya. Inilah sebabnya mengapa pengkodean berbasis agen (yang konteksnya digunakan kembali puluhan kali) jauh lebih murah.