Профессор Ван Яцин из BIMSA на конференции IJCAI 2026 в рамках Early Career Spotlight рассказала о новом этапе развития искусственного интеллекта. Суть интеллектуальности — способность на основе ограниченных данных обеспечивать надёжное обобщение и перенос. Сейчас качество данных и вычислительные ресурсы становятся узкими местами для развития больших моделей. Многие задачи — например, разработка лекарств, холодные рекомендации, научные исследования — изначально не имеют больших объёмов данных.
Ван Яцин и её коллеги предложили фреймворк Data-Efficient Agentic Learning (DEAL). Он решает проблему нехватки данных для агентов по трём направлениям:
* усиление опыта (Experience Augmentation) — повышение плотности и разнообразия информации в ограниченных траекториях взаимодействия;
* проектирование архитектуры (Agent Structural Design) — создание структурированных модулей, механизмов самостоятельного выполнения процессов и повторного использования знаний;
* эффективная парадигма обучения (Learning Paradigm) — выбор подходящих методов (ICL-оптимизация, дообучение на малых выборках, бюджетно-эффективное обучение с подкреплением (Budget-Efficient RL)).
Ключевая идея DEAL — использование структурированных априорных данных для надёжного обобщения при ограниченном опыте. Предварительные знания могут быть представлены в виде данных из соответствующей области, параметров предварительно обученной модели, физических законов и математических аксиом. Эти приоритеты вместе с небольшим набором данных для поддержки новой задачи передаются в механизм адаптации, что позволяет модели быстро выполнять точный вывод в последующих задачах.
Scaling Law почти стал отраслевым стандартом: чем больше данных, параметров и вычислительных мощностей, тем выше обобщающая способность модели. Но у этого пути есть пределы. Например, для обучения GPT-4:
* объём данных в виде бумажных книг составил бы 650 км;
* вычислительные затраты эквивалентны работе одноядерного ноутбука в течение 7 млн лет;
* эквивалентное количество параметров заняло бы 30 тыс. стандартных футбольных полей.
При масштабировании моделей возникают проблемы: исчерпание высококачественных языковых данных, высокая стоимость вычислений, необъяснимость параметров. Необходимо решить, как действовать при нехватке больших объёмов данных для задачи и как работать с данными, ключевые ценности которых сосредоточены в длинном хвосте распределения.
Рассмотрим несколько примеров. В разработке лекарств (Drug Discovery) потенциальное количество кандидатов-молекул — 10³³~10⁶⁰, их невозможно перебрать через базу данных. Разработка нового лекарства занимает десятки лет, требует миллиарды долларов, и лишь одна молекула из тысяч проходит одобрение. В этом процессе сильно не хватает размеченных данных. В рекомендациях и поиске ежедневно появляются новые пользователи и объекты. Сложно получить качественные разметки на этапе холодного старта и в период с малым числом взаимодействий. Система должна быстро выявлять признаки с помощью инкрементального обучения (Incremental Learning) при малом количестве начальных наблюдений.
Эволюция технологий идёт от метаобучения (Meta*-Learning) к обучению в контексте (In-Context Learning, ICL) и обучению эффективных агентов на основе данных (Data-Efficient Agentic Learning). Метаобучение — основа малосэмплового обучения; его принцип: условия обучения должны совпадать с условиями тестирования. Чтобы модель могла выполнять новую задачу на основе небольшого количества образцов на этапе тестирования, на этапе обучения нужно многократно использовать задачи с малым количеством образцов.
Есть три основных технологических подхода в метаобучении:
* на основе оптимизации (Optimization-based) — обучение поиску оптимальных начальных параметров и стратегии обновления, быстрое дообучение с минимальным числом шагов спуска по градиенту;
* на основе метрик (Metric-based) — обучение общему пространству семантических вложений, прямое сравнение расстояний между образцами в новой задаче;
* на основе амортизации/чёрного ящика (Amortization-based) — использование кодировщика чёрного ящика для прямого преобразования набора поддержки в веса прогнозирования для конкретной задачи.
В 2020 году публикация статьи о GPT-3 «Language Models are Few-Shot Learners» сделала ICL центром внимания: модель может выполнять адаптацию к задаче и генерировать ответ в прямом проходе без изменения параметров сети — достаточно указать инструкции в Prompt и добавить 1–2 примера (Few-shot Prompting).
Команда исследователей провела теоретический анализ и экспериментальную проверку взаимосвязи метаобучения и ICL в рамках исследования на ICLR 2025. В линейной регрессии и задачах классификации Transformer ICL при подходящих параметрах может эквивалентно представлять метаобучение на основе градиента, метрики и распределения. В случае однотипных задач ICL точно воспроизводит соответствующие алгоритмы метаобучения. При работе со смешанными задачами ICL учится динамически выбирать подходящие правила адаптации в зависимости от характеристик входных данных. ICL — это метаобучение, зависящее от данных (Data-dependent Meta*-Learning).
AI эволюционировал от инструмента для однократного предсказания до агента, способного к многошаговому взаимодействию и долгосрочному планированию. При взаимодействии с реальным миром проблема нехватки данных обостряется. Концепция DEAL учитывает данные из двух источников: внешние (Dext — человеческие аннотации и демонстрации экспертов) и данные, генерируемые агентом в замкнутой среде (Dloop — обратная связь среды, действия, сигналы вознаграждения и опыт неудач).
Предварительные знания имеют три уровня:
* генетический код (результат миллионов лет биологической эволюции);
* социально-культурный контекст (культурные особенности народов);
* индивидуальный опыт (уникальный жизненный путь человека).
Цель — использовать предварительные знания для сокращения разрыва между возможностями машин и человека. Приоритет знаний снижает ошибку модели с трёх уровней:
* на уровне данных — с помощью правил генерируют или расширяют образцы, заполняя разреженное пространство данных;
* на уровне модели — вводят индуктивный уклон (Inductive Bias) для ограничения сложности пространства гипотез H (например, при обработке изображений используют свёрточный оператор, используя локальную инвариантность к сдвигу для сокращения степени свободы параметров);
* на уровне алгоритма — используют приоритет для изменения стратегии поиска в пространстве параметров, чтобы найти лучшее начальное значение и направить спуск по градиенту.
Ван Яцин участвовала в создании рабочей группы TF-DEAL (IEEE CIS NNTC Task Force on Data-Efficient Agentic Learning) для объединения исследователей и инженеров в этой области. Председатель рабочей группы — Яо Цюаньмин (Университет Цинхуа). Заместители председателя: Ван Яцин (BIMSA), Сун Цзысин (Бристольский университет, Великобритания), Лю Фэн (Мельбурнский университет, Австралия). Workflow Chair: Чжао Пэйяо (BIMSA и Университет Цинхуа). В консультативный комитет входят: Сугиями Масаси (Институт физико-химических исследований Японии и Токийский университет), Линь Чучэнь (Пекинский университет), Го Тяньюй (Джеймс Т. Квок, Гонконгский университет науки и технологии), Цзинь Гоцин (Ирвин Кинг, Гонконгский китайский университет), Амир Хуссейн (Оксфордский университет, Великобритания).
Рабочая группа TF-DEAL будет проводить тематические обсуждения, обучающие доклады, научные соревнования и разрабатывать эталонные модели для развития международного сотрудничества в области эффективного обучения интеллектуальных агентов с малым объёмом данных. Приглашаются исследователи, инженеры и студенты к участию в TF-DEAL.
Среди публикаций по теме можно отметить:
[1]. Yaqing Wang, Quanming Yao, James T. Kwok, Lionel M. Ni. Generalizing from a Few Examples: A Survey on Few-Shot Learning. ACM Computing Surveys (CSUR). 2020.
[2]. Yaqing Wang, Abulikemu Abuduweili, Quanming Yao, Dejing Dou. Property-Aware Relation Networks for Few-Shot Molecular Property Prediction. Annual Conference on Neural Information Processing Systems (NeurIPS). 2021.
[3]. Yaqing Wang, Hongming Piao, Daxiang Dong, Quanming Yao, Jingbo Zhou. Warming Up Cold-Start CTR Prediction by Learning Item-Specific Feature Interactions. ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD). 2024.
[4]. Shiguang Wu, Yaqing Wang, Quanming Yao. Learning to Learn with Contrastive Meta*-Objective.
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.