Новый метод оптимизации ИИ-агентов: точность поиска выросла с 51,4% до 60,4%
Платформа Contrastive Reflection оптимизирует работу ИИ‑агентов: выявляет ошибки и улучшает результаты поиска. На HotpotQA точность выросла с 51,4% до 60,4%.
71 статьи по теме
Платформа Contrastive Reflection оптимизирует работу ИИ‑агентов: выявляет ошибки и улучшает результаты поиска. На HotpotQA точность выросла с 51,4% до 60,4%.
Разработан автоматизированный конвейер для оптимизации описаний навыков ИИ-агентов: время настройки сократилось в 32 раза, качество осталось на уровне ручной настройки (F1 79,2–79,4 %).
Kunlun Wanwei выпустила агентскую модель SkyClaw-v1.0 с низкой стоимостью использования. Модель хорошо справляется с задачами создания приложений с нуля и обработки информации, но медленнее работает при координации нескольких файлов и не демонстрирует сильных результатов в тестах по внесению изменений в существующий код (например, SWE-bench). Важно чётко понимать границы применимости модели, чтобы эффективно её использовать.
В эссе рассматривается концепция AX (опыт агента) в сфере ИИ‑агентов. Она включает два аспекта: упрощение работы для агентов и для людей. Важны прозрачность действий ИИ, контроль со стороны человека и продуманный дизайн взаимодействия. По прогнозам, к концу 2026 года 40 % корпоративных приложений будут содержать ИИ‑агентов.
Статья даёт подробное руководство по внедрению ИИ-агентов: разбирает их отличия от других технологий, приводит примеры использования в разных сферах бизнеса, описывает пять шагов внедрения и даёт советы по оценке экономической эффективности и предотвращению ошибок. Читатели узнают о типах ИИ-агентов, критериях выбора поставщика инструментов, ключевых показателях эффективности и мерах безопасности.
Тиора разработал систему Nebula, которая синхронизирует мыслительный процесс ИИ с анимацией в Unity в реальном времени — благодаря этому NPC из простых текстовых ботов превращаются в эмоциональных партнёров игрока. В ходе разработки система прошла несколько этапов эволюции: от перехода на Unity и замены LangChain на LangGraph до интеграции MCP и RAG. Для решения проблемы задержек внедрена потоковая передача данных через SSE и собственный протокол передачи сигналов.
Статья посвящена использованию команды Codex Exec для повышения эффективности программирования. Автор, Эйвинд Кьосбаккен, описывает, как применять Codex Exec для проверки кода, планирования внедрений и получения дополнительной информации. По его мнению, сочетание Codex и других моделей (например, Claude Code) улучшает качество разработки ПО.
Anthropic выпустила модель Claude Sonnet 5 — бесплатное решение для повседневных задач. Модель умеет выполнять сложные задачи, самостоятельно проверять результаты и использовать различные инструменты. Стоимость использования Sonnet 5 ниже, чем у модели Opus, а в ходе тестирования она показала хорошие результаты.
Together AI представит на ICML 2026 восемь статей о разработках в сфере ИИ — от агентов и систем логического вывода до оптимизации алгоритмов и работы с ядрами графических процессоров. Среди разработок — структуры для обучения и оценки, методы оптимизации рассуждений и декодирования, системы контекстного параллелизма. Исследователи продемонстрируют решения на стенде B714 в Сеуле (6–11 июля).
OpenAI меняет стратегию — от ориентации на обычных пользователей к работе с бизнесом. Компания интегрирует в ChatGPT Codex и шесть плагинов для разных сценариев, добавляет функции аннотаций и сайтов. Параллельно она стремится создать платформу наподобие App Store, в то время как Anthropic фокусируется на способности агентов выполнять конкретные задачи.
Создан набор данных и система виртуальных пациентов для обучения медиков с использованием LLM; есть интерактивный прототип для практики и обратной связи.
Разработан агент RSEA, который самостоятельно улучшает свою работу и безопасно адаптируется к задачам. В тестах показал высокие результаты.
Алгоритм ATOD объединяет OPD и RL для обучения автономных агентов; показал лучшие результаты в тестах на ALFWorld, WebShop и Search-QA.
На прошлой неделе OpenAI выпустила пакет моделей GPT-5.6, Anthropic представила функцию Claude Tag, а General Intuition продвигает использование видеоигр для обучения ИИ. Кубок LayerLens Stratix стал испытанием моделей в игровой среде. Кроме того, ряд компаний и исследовательских групп представили новые разработки и привлекли финансирование.
Разработан трёхэтапный метод обучения агентов LLM для более точного прогнозирования последствий действий — он эффективнее базовых подходов в задачах поиска и математического анализа.
В Deep Agents внедрены динамические субагенты, которые помогают агентам решать масштабные задачи за счёт программной оркестровки: вместо прямых вызовов инструментов агент пишет скрипт для организации работы субагентов. Механизм обеспечивает детерминированный охват и надёжную оркестровку сложных процессов. В материале описаны практические сценарии использования и шаблоны оркестровки.
Учёные выяснили, что личностные черты LLM по‑разному влияют на работу мультиагентных команд в зависимости от типа задачи — от незначительного эффекта в кодировании до сильного снижения производительности в переговорах и сотрудничестве.
Платформа OverFlowLight в реальном времени обнаруживает заторы и корректирует работу светофоров, снижая количество инцидентов с переполнением на 60,4% и увеличивая пропускную способность сети на 18,2%.
Система на базе LLM автоматически отправляет письма через WhatsApp в вузе, анализируя их содержание и определяя получателей без размеченных данных.
LangChain представила обновления LangSmith, включая новые шаблоны агентов и интерфейсы для работы с аудио и трассировкой. Запущен курс по развёртыванию LangSmith и учебное пособие по добавлению голоса в LangGraph Agents. Анонсированы мероприятия в разных городах в июне–августе 2026 года.