Компания DeepSeek увеличила размер кэша в 11 раз из‑за резкого роста спроса на длинные контексты. По мнению компании, для покрытия расходов на хранение и перенос данных в больших моделях необходимо ввести «налог на хранение».
С 17 августа 2026 года DeepSeek V4 Pro API повысил цены на ввод и вывод. Стоимость самого дешёвого варианта с попаданием в кэш выросла в 5 раз в свободное время и в 11 раз в пиковые периоды — с 0,025 юаня за миллион токенов до 0,3 юаня за миллион токенов.
Попадание в кэш позволяет ИИ не перечитывать всю информацию заново при каждом ответе. Ранее вычисленные фрагменты текста сохраняются в хранилище в виде KV‑единиц и могут быть извлечены при последующих вызовах. Высокая доля попаданий в кэш была ключевым преимуществом DeepSeek. Компания добивалась этого за счёт технологии сжатия KV и многоуровневой схемы переноса памяти (холодной/горячей).
DeepSeek использует холодную и горячую многоуровневую систему хранения сжатой памяти: «горячая память» (часто вызываемая) хранится в GPU‑памяти, «холодная память» (долго не вызываемая) — на NVMe‑накопителях. Это позволяет снизить затраты, хотя возникают расходы на хранение, перенос и планирование данных.
Технология DeepSeek V4 CSA+HCA (технология сжатого разрежённого внимания и сильно сжатого внимания) позволяет объединять 4 или 128 токенов в один блок памяти и сокращать объём памяти для длинных текстов более чем на 95 %. С её помощью можно сжать 1 000 000 токенов KV‑памяти до примерно 10 ГБ. При использовании NVMe‑накопителя объёмом 15,36 ТБ (средняя цена — 6000 ₽) стоимость аппаратного обеспечения на одну порцию кэша в 1 млн токенов составляет несколько копеек, а стоимость переноса данных с диска в GPU — также в пределах нескольких копеек.
Рассмотрим пример: при использовании DeepSeek V4 Pro для создания агента по работе с кодом (объём основного кода — 500 тыс. токенов, 50 запросов в день) суммарный объём ввода за день составит 25 млн токенов, а стоимость превысит 75 юаней. Однако при доле попаданий в кэш 90 % только первый запрос требует полной оплаты предварительных вычислений, а в последующих 49 запросах 90 % контекста можно повторно использовать — стоимость ввода снижается более чем на 90 %.
Тем не менее возникли серьёзные проблемы. Из‑за изначально низких цен разработчики загружали в контекст большие объёмы данных (кодовые базы, логи Agent, документы), что привело к «кэшевому дрожанию» на бэкенде DeepSeek в часы пик: GPU‑память (HBM) быстро заполнялась. Система планирования вынуждена удалять из памяти редко используемые блоки кэша и перемещать их на NVMe‑диски. В условиях экстремального параллелизма запросы конкурируют за место в памяти — вытесняют общие префиксы кэша, что приводит к недействительности кэша и необходимости пересчёта с нуля. Частый перенос данных между памятью и диском расходует ресурсы ввода‑вывода и вычислительные мощности планирования, снижая эффективность GPU‑кластеров.
Физические ограничения (количество GPU‑чипов, объём HBM, пропускная способность шины) не позволяют бесконечно справляться с экспоненциальным ростом требований к длинному контексту. Несмотря на значительное сжатие (объём кэша на 1 млн токенов в V4 сокращён на 90 % по сравнению с DeepSeek‑V3 и составляет около 2 % от объёма при использовании традиционной архитектуры GQA), компания вынуждена повышать цены.
Другие компании также сталкиваются с подобными проблемами. Anthropic использует механизм явного кэширования с точками останова: разработчики вручную помечают места кэширования, при этом за первую запись в кэш взимается надбавка в 1,25 или 2 раза. OpenAI имеет более высокую базовую цену ввода по сравнению с DeepSeek, может использовать больше HBM‑видеопамяти для увеличения пространства кэша.
DeepSeek остаётся одним из лучших вариантов по соотношению цены и качества — его стоимость в несколько раз ниже, чем у Claude, а возможно, и ещё ниже. Многие компании уже сформировали в слое KV Cache DeepSeek стабильный кэш с высоким коэффициентом попадания. Однако ошибки разработчиков (например, размещение текущего времени, ID пользователя, случайных параметров в начале Prompt, добавление пробела или изменение символа новой строки в интерфейсных компонентах, вставка результатов инструментов от агентов в середину контекста) могут привести к аннулированию кэша объёмом в сотни тысяч токенов. Ключевая логика кэширования DeepSeek: требуется полное совпадение префикса — даже отклонение на один символ приводит к отсутствию попадания в кэш.
Повышение цен DeepSeek вынуждает разработчиков изменить роль — теперь им нужно выступать в качестве «администраторов данных»: определять, какие данные являются общими для всей компании и должны быть в начале Prompt для стабильного попадания в кэш, какие данные — низкочастотные и могут добавляться по мере необходимости, как управлять жизненным циклом кэша, чтобы избежать вытеснения данных из видеопамяти в пиковые периоды.