В 2026 году ожидается выпуск GPT-6 (внутренний код — Astra), сообщает The Information. Компания OpenAI внедряет инновационную архитектуру под названием «циркулярная глубина» («»). Этот подход кардинально меняет принцип рассуждений модели: она многократно размышляет внутри циклического блока и выдаёт оптимальное решение.
Преимущества новой архитектуры значительны: она высвобождает потенциал рассуждений модели, позволяет экономить видеопамять и снижает затраты на пропускную способность. Причина в том, что отсутствуют промежуточные текстовые цепочки рассуждений. Суть технологии заключается в том, что вычислительные слои становятся циклическим «диском»: одни и те же данные многократно проходят через одну группу параметрических слоёв, итерируя и оттачивая результат до достаточной проработки вывода. В итоге вычислительные мощности акцентируются не на генерации процесса мышления, а на самом мышлении — это существенно повышает эффективность.
Традиционная логика вычислений Transformer напоминает однонаправленную конвейерную линию фиксированной длины: при генерации каждого нового слова вычислительные мощности проходят все физические слои от начала до конца. Это приводит либо к растрате ресурсов при решении простых задач, либо к недостатку слоёв для сложных задач. Метод цепочки рассуждений (CoT) позволял модели записывать промежуточные шаги и затем считывать их для продолжения вычислений. Однако он не менял количество слоёв модели и не направлял вычислительные мощности на «основное размышление».
Технология «циркулярная глубина» интегрируется с архитектурой смешанных экспертов (MoE), формируя направление Recurrent MoE. При добавлении циклической глубины один и тот же вектор в каждой итерации может перенаправляться к разным экспертам, а эксперты могут многократно вызываться для уточнения деталей.
Есть и проблемы: на уровне архитектуры OpenAI «затеняет» цепочку рассуждений — раньше её можно было отследить в данных, даже если в продукте она была скрыта. Главный научный сотрудник OpenAI Якуб Пачоцкий опасается, что публикация The Information может спровоцировать неконтролируемую гонку вооружений в отрасли.
Большие модели постепенно отказываются от человеческого языка: вычисления переходят в «измерение мыслей», а не в преобразование мыслей в линейный человеческий язык с последующим декодированием. Логические рассуждения, поиск путей и проверка решений выполняются в непрерывном скрытом пространстве в математической форме.
В 2025 году в статье «Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach» было показано, что модель с 35 млрд параметров, выполняя внутренний цикл 32 раза и используя вычислительные ресурсы, эквивалентные модели с 500 млрд параметров, может соответствовать или превосходить традиционные плотные большие модели в задачах математической логики и кодирования.
Примеры применения подхода включают OpenAI Astra, внутренние исследования Meta* («непрерывная цепочка рассуждений») и проект «COCONUT» крупных компаний.
Параллельно российский стартап Mostik предлагает новый подход к коммуникации между моделями. Вместо перевода результатов в человеческий язык и последующего декодирования (с использованием токенов) используется лёгкий мост-матрица. Она проецирует высокоразмерное скрытое состояние большой модели в входное скрытое пространство малой модели — без генерации токенов и без тонкой настройки весов моделей.
Основатель Mostik Саша Малышева совместно с докторами математических наук и лауреатом премии Филдса 2010 года Станиславом Смирновым обнаружила, что скрытые пространства разных моделей имеют общую семантическую структуру. В эксперименте использовались модели GLM-5.2 (753B) и Qwen-3. Смешанная система (5(4B)) передаёт результаты от крупной облачной модели к малой локальной модели. Стоимость рассуждений системы составляет 1/20 от GLM-5.2, а точность — около 80% от топовых моделей. В рейтинге ARC-AGI решение заняло первое место, значительно опередив традиционные передовые большие модели. Карл Турс (экс-DeepMind) отмечает рост эффективности за счёт взаимодействия моделей.
Концепция «большая модель думает + малая модель выполняет» позволяет с низкими затратами приблизиться к возможностям мономодели. Происходит переход AI-вычислений в скрытое пространство: «циклическая глубина» углубляет процесс в рамках одной модели, а «соединение скрытого пространства» объединяет несколько моделей. Прогнозируется сценарий: большая модель выполняет десятки циклов рассуждений, передаёт итоговое скрытое пространство малым моделям для параллельного выполнения; малые модели независимо циклируют и синхронно передают промежуточные состояния через соединение.
Token-экономика лежит в основе бизнес-модели AI: API тарифицируется по Token, доход модели = объём потребления Token × цена. Крупные IT-компании в этом году планируют капитальные затраты на AI-инфраструктуру в размере 7500 млрд долларов США — ориентир привязан к кривой роста потребления Token. Однако «циклическая глубина» и «соединение скрытого пространства» меняют уравнение «вычисление = Token». В фазе размышлений глубина цикла позволяет модели выполнить множество циклов и вывести мало текста — оплата идёт по выведенным Token, а затраты — по реальной вычислительной мощности. Возникает расхождение между доходом и затратами. В фазе взаимодействия текст, передаваемый большой моделью малой, ранее был чисто затратным, но после интеграции Mostik стоимость передачи текста между моделями снижается до нуля.
API с оплатой по Token, вероятно, потребует новой единицы измерения — например, реальной вычислительной мощности, количества циклов или оплаты по результату. При отказе AI от языка как посредника логика в многомерном векторном пространстве выйдет за пределы человеческого понимания. Есть риск: можно получать правильные ответы на все вопросы, но потерять возможность объяснять «почему».
Ссылки
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.