Kurzantwort
Ob eine Anfrage einen Cache-Rabatt erhält, hängt vom Upstream-Modell, API-Protokoll und Anfrageformat ab. BetterToken erfasst und zeigt die Nutzung anhand der vom Upstream-Modell zurückgegebenen Nutzungsdaten an. Wenn das Upstream-Modell Prompt-Caching unterstützt und Cache-Felder in der Antwort zurückgibt, kannst du zwischengespeicherte Token in den Nutzungsdaten der Antwort oder in den Aufrufprotokollen prüfen. Das Cache-Verhalten unterscheidet sich je nach Modell. Gehe nicht davon aus, dass jedes Modell automatisch einen Cache-Rabatt erhält.Was Cache-Abrechnung bedeutet
Prompt-Caching ermöglicht einem Upstream-Modell, ein stabiles, wiederholtes Präfix über mehrere Anfragen hinweg wiederzuverwenden. Wenn der Cache greift, kann ein Teil des Eingabekontexts zu einem niedrigeren Tarif für zwischengespeicherte Token abgerechnet werden. Dies ist nützlich für:- Lange Systemprompts
- Feste Projektanweisungen
- Umfangreichen, stabilen Dokumentationskontext
- Wiederholte Repository-Anweisungen in mehrstufigen Coding-Aufgaben
- Stapelaufgaben mit denselben Regeln und demselben Ausgabeformat
Protokollunterschiede
Dasselbe Claude-Modell kann sich bei Aufrufen über unterschiedliche Protokolle anders verhalten. Wenn du Claude Code oder die Anthropic-kompatible API häufig verwendest, prüfe zuerst das Anthropic-native Cache-Verfahren.
Prüfen, ob der Cache verwendet wurde
Prüfe das Feldusage in der Antwort oder im Aufrufdatensatz des Dashboard. Die Feldnamen unterscheiden sich je nach API-Format:
Wenn der Wert größer als 0 ist, hat ein Teil der Anfrage normalerweise den Cache verwendet. Fehlt das Feld, unterstützt das Modell die Funktion möglicherweise nicht, das Protokoll gibt sie nicht zurück, die Anfrage hat den Cache nicht getroffen oder das Tool blendet die Rohdaten zur Nutzung aus.
Cache-Trefferrate verbessern
- Platziere stabile Inhalte nahe am Anfang des Prompt.
- Platziere benutzerspezifische und häufig wechselnde Eingaben später.
- Füge keine Zeitstempel, zufälligen IDs oder wechselnden Anweisungen in das stabile Präfix ein.
- Verwende nach Möglichkeit dasselbe Modell und Protokoll für denselben Aufgabentyp.
- Füge in Claude-nativen Formaten gemäß der Modelldokumentation
cache_controlzu den Inhaltsblöcken hinzu, die zwischengespeichert werden sollen. - Führe für Stapelaufgaben zuerst eine kleine Stichprobe aus und prüfe die Nutzungsfelder, bevor du die Gesamtkosten schätzt.
Häufige Fehler
- Davon ausgehen, dass jedes Modell automatisch Cache-Rabatte unterstützt.
- Davon ausgehen, dass die gesamte Anfrage nach einem Cache-Treffer kostenlos ist.
- Modelle häufig wechseln und dadurch die Wiederverwendung des Cache verhindern.
- Claude über ein OpenAI-kompatibles Format aufrufen und Claude-native Cache-Felder erwarten.
- Nur die Gesamtzahl der Token prüfen und zwischengespeicherte Token sowie Felder für Cache-Lesen oder Cache-Erstellung ignorieren.

