За последний год AI Agent (компьютерные операционные агенты) перешли от демонстрационных версий к реальному внедрению в бизнес-процессы. Они помогают обновлять системные записи, переносить данные между порталами, обрабатывать заявки и работать с ПО без чистого API.
Согласно данным OSWorld-Verified, точность выполнения задач топовыми AI-моделями за год выросла с 42% до 85% — это даже выше среднего показателя у людей (около 72%). Однако, как отмечает a16z, даже при 85% точности 15 из 100 задач завершаются неудачно — для бизнеса это серьёзный барьер.
Некоторые компании уже ощутили эффект от автоматизации. Например, одна платформа в сфере потребительских товаров ежемесячно выполняет 15–20 млн операций через портал. Здесь AI Agent выступают в роли резервного механизма: если из‑за изменений на сайте розничного продавца ломается код веб-краулера, агент самостоятельно диагностирует и исправляет проблему — ещё до того, как ошибку заметят инженеры. Благодаря этому компания сократила команду, отвечающую за поддержку краулеров, вдвое и перенаправила ресурсы на другие задачи.
Другой пример — глобальный системный интегратор, который внедрил 27 рабочих процессов с использованием AI Agent. Ежедневно система обрабатывает 1,5–2,1 тыс. IT-заявок. Цель — перераспределить 20–25% персонала, задействованного в низкомаржинальных услугах, для оптимизации операций.
a16z выделяет оптимальные сценарии для внедрения таких агентов: высокочастотные, повторяющиеся, стабильные по бизнес-правилам процессы, где раньше требовались ручные действия или не было API. Среди них — обновление CRM-данных, тестирование ПО, работа с государственными и страховыми порталами, обработка розничных заказов, заявок в ServiceNow.
Стартап Prentis, основанный Ritankar Das, Reid Hoffman и Mark Pincus, развивает модели для автоматизации офисных процессов. Цель — научить агентов самостоятельно выполнять сквозные рабочие процессы: например, обрабатывать страховые выплаты или налоговые возвраты. Уже заключены контракты на сумму около 50 млн долларов с медицинскими, производственными и ритейлерскими компаниями.
Prentis утверждает, что их модель Hive-32B превосходит GPT-5.4 от OpenAI и Claude Opus 4.6 от Anthropic в тестах WindowsAgentArena и ScreenSpot-v2. При этом стоимость выполнения одной задачи у Prentis в десять раз ниже, чем при использовании передовых моделей через API.
Тем не менее при реальном внедрении возникают проблемы. Во-первых, это «скрытые ошибки»: например, если агент неправильно интерпретирует условие оплаты в контракте (например, «net 60» как «net 30»), это может пройти все автоматические проверки и всплыть только при отправке некорректного счёта клиенту. Во-вторых, «асинхронные разрывы» — ситуации, когда результат действия нельзя проверить сразу. Например, агент отправляет заявку на страховую выплату, получает сообщение «принято» и считает задачу завершённой, хотя страховой агент может позвонить через два дня для уточнения данных.
a16z подчёркивает: когда итоговый результат процесса становится известен только через несколько дней или недель, одних улучшений модели недостаточно. Нужно заранее прорабатывать систему проверок, эскалации и обработки исключений.
Бизнес-подход к выбору решений тоже меняется. Компании всё меньше внимания уделяют тому, какая именно модель лежит в основе решения. Для них важнее стабильность в масштабе, безопасность и доказанный ROI. Фокус смещается на инфраструктуру вокруг модели: управление контекстом, правами доступа, верификацию результатов, механизмы ручной эскалации и обработку ошибок.
