Кэш простыми словами
Представьте длинную инструкцию и документ, которые отправляются в каждом сообщении. В первом запросе повторяемая часть может быть записана в кэш. В следующем запросе тот же фрагмент читается из кэша, а новым входом остаётся только добавленное сообщение.
- Первый запрос: длинный общий контекст + вопрос.
- Повторный запрос: тот же контекст + новый вопрос.
- В usage появляются cache_write_tokens или cache_read_tokens.
- Каждая часть умножается на свою цену за 1 миллион токенов из карточки модели.
В учебном примере повторяемые 80k токенов сохраняются для следующих запросов.
cache_write_tokens: 80000Цены условные. Попадание в кэш определяет провайдер; оно не гарантировано. Актуальные тарифы — в каталоге модели.
Как повысить повторное использование
- Ставьте неизменные инструкции и большой документ в начало контекста.
- Не меняйте пробелы, порядок блоков и служебный текст в уже отправленном префиксе.
- Добавляйте новые сообщения после стабильной части.
- Проверяйте cache_read_tokens в usage и Analytics на повторных запросах.
Формула списания
Сначала определяется обычный, отдельно не тарифицируемый вход. В OpenAI-формате cache-токены часто уже находятся внутри prompt_tokens, поэтому повторно прибавлять полный prompt_tokens нельзя. Elysium AI выполняет эту нормализацию автоматически.
1uncached_input = prompt_tokens - cache_read_tokens - cache_write_tokens2 3cost =4 uncached_input / 1 000 000 × input_price5+ cache_read_tokens / 1 000 000 × cache_read_price6+ cache_write_tokens / 1 000 000 × cache_write_price7+ output_tokens / 1 000 000 × output_priceПоля usage
| Поле | Расчёт |
|---|---|
| prompt_tokens | полный OpenAI-вход; перед ручным расчётом вычтите отдельно показанные cache-токены |
| input_tokens | для Anthropic обычно уже означает обычный вход без cache |
| completion_tokens | выход × output price |
| cache_read_tokens | чтение × cache read price |
| cache_write_tokens | запись × cache write price |
Термины на этой странице
| Термин | Что означает |
|---|---|
| Base URL | Базовый адрес API, к которому клиент добавляет нужный маршрут. |
| API-ключ | Секрет для авторизации и списания запросов с вашего баланса. |
| Model ID | Точное системное имя модели из каталога Elysium AI. |
| Токен | Небольшая часть текста, по количеству которой рассчитывается usage. |
| Cache read | Повторно использованные входные токены, прочитанные из кэша. |
| Cache write | Токены, сохранённые провайдером для возможного повторного использования. |
| Цена за 1M | Стоимость одного миллиона токенов соответствующего типа. |