ДокументацияПоддержка
Основы

Кэш контекста

Как повторное использование длинного контекста отражается в usage и стоимости запроса.

Все руководства (.md)

Кэш простыми словами

Представьте длинную инструкцию и документ, которые отправляются в каждом сообщении. В первом запросе повторяемая часть может быть записана в кэш. В следующем запросе тот же фрагмент читается из кэша, а новым входом остаётся только добавленное сообщение.

  • Первый запрос: длинный общий контекст + вопрос.
  • Повторный запрос: тот же контекст + новый вопрос.
  • В usage появляются cache_write_tokens или cache_read_tokens.
  • Каждая часть умножается на свою цену за 1 миллион токенов из карточки модели.

В учебном примере повторяемые 80k токенов сохраняются для следующих запросов.

cache_write_tokens: 80000

Цены условные. Попадание в кэш определяет провайдер; оно не гарантировано. Актуальные тарифы — в каталоге модели.

Как повысить повторное использование

  • Ставьте неизменные инструкции и большой документ в начало контекста.
  • Не меняйте пробелы, порядок блоков и служебный текст в уже отправленном префиксе.
  • Добавляйте новые сообщения после стабильной части.
  • Проверяйте cache_read_tokens в usage и Analytics на повторных запросах.

Формула списания

Сначала определяется обычный, отдельно не тарифицируемый вход. В OpenAI-формате cache-токены часто уже находятся внутри prompt_tokens, поэтому повторно прибавлять полный prompt_tokens нельзя. Elysium AI выполняет эту нормализацию автоматически.

1uncached_input = prompt_tokens - cache_read_tokens - cache_write_tokens2 3cost =4  uncached_input      / 1 000 000 × input_price5+ cache_read_tokens  / 1 000 000 × cache_read_price6+ cache_write_tokens / 1 000 000 × cache_write_price7+ output_tokens      / 1 000 000 × output_price
Все четыре цены задаются в долларах за 1 миллион токенов. Это абсолютные тарифы, а не множители x.

Поля usage

ПолеРасчёт
prompt_tokensполный OpenAI-вход; перед ручным расчётом вычтите отдельно показанные cache-токены
input_tokensдля Anthropic обычно уже означает обычный вход без cache
completion_tokensвыход × output price
cache_read_tokensчтение × cache read price
cache_write_tokensзапись × cache write price
Термины на этой странице
ТерминЧто означает
Base URLБазовый адрес API, к которому клиент добавляет нужный маршрут.
API-ключСекрет для авторизации и списания запросов с вашего баланса.
Model IDТочное системное имя модели из каталога Elysium AI.
ТокенНебольшая часть текста, по количеству которой рассчитывается usage.
Cache readПовторно использованные входные токены, прочитанные из кэша.
Cache writeТокены, сохранённые провайдером для возможного повторного использования.
Цена за 1MСтоимость одного миллиона токенов соответствующего типа.