DeepDigest
Leiphone · · ~2 мин

Бaidu Вэньсинь: агент возглавил рейтинг PinchBench v2, обойдя Claude и GPT

Агент «Бaidu Вэньсинь» занял первое место в рейтинге PinchBench v2, обойдя модели Claude и GPT. Тест оценивает способность AI‑агентов выполнять комплексные задачи и предоставлять проверяемый результат. Успех объясняется развитой системой многоагентной архитектуры и многолетним опытом Baidu в понимании намерений пользователя.

Бaidu Вэньсинь: агент возглавил рейтинг PinchBench v2, обойдя Claude и GPT

17 июля 2026 года агент «Бaidu Вэньсинь» занял первое место в рейтинге PinchBench v2 — глобальном тесте AI-агентов. Он набрал максимальный балл 94,6 % и средний балл 94,4 %. Среди 59 участвующих моделей агент опередил Anthropic Claude Opus 4.8-fast (93,5 %), Али Тунъи Цяньвэнь Qwen3.7-max (92,5 %), Anthropic Claude Opus 4.8 (90,5 %), OpenAI GPT-5.6-luna (88,7 %).

PinchBench, разработанный Kilo AI и поддерживаемый сообществом OpenClaw, оценивает не просто знания модели, а способность агента выполнить задачу и предоставить проверяемый результат. В текущей версии теста 23 реальных рабочих сценария и 147 заданий, охватывающих анализ данных, написание исследований, разработку кода, автоматизацию офиса, обработку документов, веб‑операции и работу с мультимедиа. Всего проведено 617 тестовых запусков. Оценка идёт по схеме «автоматизированная проверка + оценка с помощью LLM», без участия человека.

Например, в одном из заданий агенту нужно было выяснить, насколько фактическая рентабельность GitLab за третий квартал 2025 года отличается от прогнозируемой. Агент самостоятельно нашёл нужные данные, рассчитал показатели и оформил результат в нужном формате — все пять критериев оценки получили максимальную оценку 1,0.

В другом тесте требовалось проанализировать уязвимости в Node.js‑приложении, расставить их по приоритетам и составить план исправления. Агент идентифицировал критические уязвимости (express RCE и JWT bypass) как P0, уязвимость SQL‑инъекции в PostgreSQL — как P1, менее значимые — как P2/P3, и составил план из пяти этапов исправления с указанием сроков.

Ещё одно задание — анализ договора на оказание ПО‑услуг: агент выявил 12 рисков со стороны клиента, 10 — со стороны поставщика, 5 общих рисков, проанализировал структуру платежей и условия передачи интеллектуальной собственности. Все четыре критерия оценки получили максимальную оценку.

Агент способен выполнять и повседневные задачи: например, обработать таблицу с данными, построить сводные таблицы и графики, составить план поездки или собрать подборку научных статей. Пользователи могут настраивать и автоматические задачи — например, еженедельно получать подборку статей по ИИ в формате HTML.

Успех агента объясняется многолетним опытом Baidu в понимании намерений пользователя и развитой системой многоагентной архитектуры на основе поискового движка. Команда Baidu опубликовала на GitHub полный процесс оценки (github.com/Baidu-AI-Search/PinchBench-Evaluation) — все 147 заданий, скриншоты выполнения, результаты оценки LLM и обоснования баллов можно воспроизвести.

Сейчас ключевые технологии агента интегрированы в приложение Baidu и «Вэньсинь», их можно протестировать на chat.baidu.com.

// оригинал
Leiphone ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK