DeepDigest
Berkeley AI (BAIR) · · ~6 мин

ABBEL: управление убеждениями в длинных взаимодействиях с LLM

Фреймворк ABBEL позволяет управлять убеждениями в длительных взаимодействиях с языковыми моделями, повышая их производительность. Оценка убеждений и сжатие контекста помогают сократить затраты ресурсов, хотя и сопряжены с определёнными сложностями. Эксперименты с CombinationLock и CollabBench показывают эффективность подхода.

LLM
ABBEL: управление убеждениями в длинных взаимодействиях с LLM

Для эффективного выполнения сложных задач (например, разработки ПО) языковым моделям нужно взаимодействовать на протяжении сотен или тысяч шагов. Хранить историю всего взаимодействия в контексте нецелесообразно, поэтому используется подход генерации краткого содержания (context compaction).

Существует множество методов управления длинными контекстами: методы сжатия контекста (Kontonis et al., 2026, Eyuboglu et al., 2025, Gupta et al., 2025, Chevalier et al., 2023, Deng et al., 2025, Bulatov et al., 2022) создают плотные представления, но теряют понятность для человека; подсказки для суммирования, разработанные вручную (Wang et al., 2025, Örwall et al., 2025, Starace et al., 2025), и стратегии обрезки (Jiang et al., 2024) требуют экспертных знаний; методы, помещающие длинные контексты во внешнее хранилище памяти (Packer et al., 2023, Xu et al., 2025) для запросов агентов или субагентов (Zhang et al., 2025), могут выиграть от обучения суммированию.

Фреймворк ABBEL изолирует и контролирует информационное содержание сводок в виде состояний убеждений на естественном языке. В ABBEL убеждения заменяют полную историю взаимодействия в качестве рабочего контекста агента, а оценка убеждений повышает производительность за счёт контроля содержимого каждого состояния убеждения.

Самосуммирование даёт сжатые и интерпретируемые контексты, но сопряжено со значительной потерей производительности — особенно в сферах помощи человеку, где мало данных высокого качества (например, в совместной генерации кода). Для повышения эффективности обучения задача генерации краткого содержания выделяется отдельно. Вдохновившись рекурсивной байесовской оценкой, авторы формулируют краткие содержания как состояния убеждений (belief states) — модель периодически обновляется на основе новой информации.

Модель composer 2.5 от Cursor использует сжатие контекста во время обучения для повышения производительности (Cassano et al., 2026). Система Grandcode (DeepReinforce et al., 2026), использующая модель Qwen 3.5-397B, тоже применяет суммирование контекста — при этом она первой стабильно побеждает людей в онлайн‑соревнованиях по программированию.

Серверы моделей (например, Cursor) рекомендуют пользователям избегать сжатия контекста при работе с ассистентами по кодированию в середине задачи (Heule et al., 2026). Тест на игре Combination Lock (до 16 попыток угадать слово) показал: модель с суммированием контекста не сокращает разрыв в производительности с моделями, использующими полный контекст, несмотря на улучшение в ходе обучения.

Рис. 1: среднее количество попыток угадать целевое слово в Combination Lock в ходе тонкой настройки RL (чем меньше — тем лучше). Политики с суммированием контекста улучшаются в ходе обучения, но не сокращают разрыв с политиками полного контекста.

Самосуммирование моделей в ходе выполнения задачи усложняет задачу обучения. Проблема ухудшения производительности в интерактивных условиях, вероятно, связана с трудностями создания и использования симуляторов человека для генерации качественных обучающих сред (Lin et al., 2025, Tomlin et al., 2025).

Оценка убеждений (belief grading) — это вспомогательная задача RL: в качестве награды используются эвристики, определяющие качество убеждения. Например, в программировании действует эвристика «короче — лучше», но при этом убеждение должно позволять ближе к идеалу реконструировать git diff.

Рис. 2: оценка убеждений по принципу автоэнкодера. Модель кодирует предшествующее убеждение, действие и наблюдение (bt, at, ot) в последующее убеждение bt+1 и получает награду за то, насколько хорошо отобранная информация из истории может быть реконструирована из этого убеждения.

Рис. 3: развёртывание ABBEL. Обновления убеждений на основе последнего наблюдения чередуются с выбором действия, обусловленного только текущим последующим убеждением.

Оценка убеждений используется в ассистивном кодировании с помощью среды CollabBench от Sweet-RL (Zhou et al., 2025). С функцией оценки убеждений на основе реконструкции удаётся сократить разрыв в производительности с моделями полного контекста примерно на 50% и обучить модель за на 50% меньше шагов по сравнению с обучением без оценки убеждений (no BG).

Результаты в CollabBench:
- Full Context: Test Pass Rate — 0.52±0.02, Success Rate — 0.39±0.02, Peak Tokens × 10² — 14.08±0.55, Training Steps — 100;
- ABBEL (no BG): Test Pass Rate — 0.46±0.02, Success Rate — 0.31±0.02, Peak Tokens × 10² — 4.20±0.37, Training Steps — 100;
- ABBEL-rec-BG: Test Pass Rate — 0.48±0.01, Success Rate — 0.36±0.01, Peak Tokens × 10² — 6.01±0.33, Training Steps — 50.

В задаче CombinationLock ABBEL с оценщиком убеждений, использующим знания предметной области (вычисление полезных статистик по истории и проверка их восстановления из состояния убеждений), демонстрирует более высокую эффективность обучения, чем модели полного контекста (FULL CTX).

В среде мультицелевого ответа на вопросы (из MEM1, Zhang et al., 2025) изоляция состояний убеждений от рассуждений позволяет значительно сократить использование памяти при минимальном ухудшении производительности за счёт штрафа за длину пикового убеждения (Peak Belief length Penalty, PBP). Результаты в мультицелевом QA: ABBEL с PBP сохраняет сопоставимую производительность, используя меньше памяти, чем MEM1 и ABBEL без PBP.

Использование явных состояний убеждений в качестве узких мест информации для многоэтапного взаимодействия открывает новые возможности: можно поощрять действия на основе их влияния на состояние убеждения, передавать состояния убеждения для улучшения коммуникации между агентами, повышать управляемость пользователем через прямое изменение воспоминаний, лежащих в основе решений агентов.

Система должна уметь фиксировать информацию, которая плохо передаётся текстом (например, внешность человека). Чтобы система научилась общаться на новом языке или играть в новую игру лучше любого человека, накопленные навыки должны храниться в сильно сжатой форме — фактически выполняя роль весов модели.

Более мощные системы, вероятно, будут использовать комбинацию нескольких форм памяти: содержимое контекста может соответствовать рабочей памяти, а для краткосрочной и долгосрочной памяти будут применяться другие подходы. Задача — реализовать эти формы памяти, например, через обучение во время тестирования, адаптивные воспоминания, непрерывные контекстные воспоминания или их комбинацию.

В новых моделях количество токенов до достижения 50% затрат вычислительных ресурсов на внимание значительно превышает 25К. Чередование линейных альтернатив внимания с полным вниманием (как в gpt-oss и DeepSeekv4) позволяет существенно сократить количество операций с плавающей точкой (FLOPs) при вычислении внимания. Например, в DeepSeekv4-Pro (1.6T A49B) требуется около 450 тысяч токенов для достижения точки компромисса в 50%. Модель Grandcode использует Qwen-3.5-397B-A17B, у которой 50% FLOPs для внимания достигаются примерно при 150 тысячах токенов.

Bertsimas et al., 2022 показали, что точное решение для игры Wordle с исходным словарём из JavaScript-версии игры можно найти с помощью динамического программирования, однако общая формулировка Wordle как игры на угадывание K букв с L попытками и некоторым словарём допустимых и правильных слов D является NP-сложной задачей для определения минимального количества ходов.

На практике для суммирования существуют накладные расходы O(N/K), где N — общее количество действий, а K — количество действий до срабатывания суммирования. В иллюстративных целях в гифке используется K = 1; в экспериментах также используется K = 1, чтобы акцентировать внимание на слабых сторонах суммирования. На практике накладные расходы невелики, поскольку K можно выбрать близким к эффективному пределу оборудования.

Код JavaScript для управления слайд-шоу: извлекает параметры (количество кадров count, префикс URL prefix, интервал intervalMs) из атрибутов элемента с ID 'abbel-frames'; формирует массив URL изображений urls на основе prefix и count; создаёт кнопки для навигации (предыдущая, следующая, воспроизведение/пауза) и точки-индикаторы для слайдов; реализует функции show(idx) — отображение кадра с индексом idx, stop — остановка слайд-шоу, start — запуск слайд-шоу, advance — переход к следующему кадру, back — переход к предыдущему кадру; обрабатывает клики и клавиатурные события (Enter, пробел, стрелки влево/вправо) для управления слайд-шоу; использует IntersectionObserver с порогом 0.35 для запуска слайд-шоу при попадании элемента в область видимости; изначально отображает первый кадр (show(0)).

@misc{lidayan2026abbellearningnaturallanguagebelief,
 title={ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction}, 
 author={Aly Lidayan and Jakob Bjorner and Satvik Golechha and Kartik Goyal and Alane Suhr},
 year={2026},
 eprint={2512.20111},
 archivePrefix={arXiv},
 primaryClass={cs.CL},
 url={ 
}
// оригинал
Berkeley AI (BAIR) ↗ Читать оригинал
3 просмотров
// поделиться Telegram VK