В 2026 году разгорелся спор вокруг инструмента Harness и проекта J-Space Cognition Suite. Проект заявлял, что с помощью DeepSeek V4 Flash и внешнего Harness сможет в Agent‑задачах сравняться с GLM‑5.3, а с DeepSeek V4 Pro — превзойти Claude Fable 5. Обещались увеличение скорости в 2,53 раза и эффективности по Token в 2,21 раза. Однако пользователь GitHub GoForceX провёл независимое тестирование с помощью Terminal Bench — и результаты оказались противоположными ожиданиям: после добавления J‑Space баллы в бенчмарках снизились, расход Token вырос, скорость вывода стала ниже, чем у исходной модели.
Автор проекта признал, что данные были преувеличены, но не предоставил воспроизводимые логи работы и удалял вопросы с претензиями.
Значимую роль в дискуссии сыграл Jason Wei — один из разработчиков CoT в OpenAI. В своей статье в X он раскритиковал идею сочетания малых моделей и универсальных инструментов. В метафоре с обучением игре в бадминтон он показал разницу между «малой моделью + инструмент» и «внутренними возможностями большой модели», подчеркнув важность способности модели выполнять задачи без внешних инструментов. Jason Wei указал на три недостатка подхода «малая модель + инструмент»:
- Скорость. Путь «малая модель + инструмент» включает несколько шагов (определение необходимости вызова инструмента, построение запроса, ожидание ответа, фильтрация информации, интеграция ответа), что увеличивает задержку. В случае многоэтапных задач время выполнения растёт экспоненциально. Утверждение J-Space о повышении скорости в 2,53 раза противоречит логике: Harness добавляет слой управляющей логики, что увеличивает потребление токенов и замедляет вывод.
- Глубина мышления. Большая модель способна анализировать большой объём данных и формировать обобщённое представление (например, по отзывам о музыкальном фестивале), тогда как малая модель может ограничиться несколькими первыми комментариями. Инструменты типа J-Space не придают малой модели способности к высокоуровневому обобщению.
- Надёжность при выполнении сложных длительных задач. В сложных задачах небольшие ошибки накапливаются и могут привести к сбою. Большие модели обладают глобальным семантическим пониманием и способностью к самокоррекции, в то время как малые модели с опорой на внешние инструменты более склонны к ошибкам. В тестах J-Space наблюдалось незначительное снижение производительности.
При этом есть примеры, когда малые модели с инструментами показывали хорошие результаты. Например, GPT‑3.5 в сочетании с итеративным рабочим процессом Agent в ряде бенчмарков превосходил тогдашний GPT‑4. Малые модели (Microsoft Phi‑4, Mistral) с высококачественными данными в вертикальных задачах (код, математика) с параметрами 3B–14B превосходили модели предыдущего поколения с сотнями миллиардов параметров.
В июле этого года Университет Карнеги-Меллона опубликовал статью «Better Harnesses, Smaller Models»: показано, что оптимизированный Harness-фреймворк позволяет малым моделям достигать более 90% производительности больших моделей в определённых задачах при минимальных затратах.
Omar Khattab — автор фреймворка DSPy, ассистент профессора MIT — с академической и системной точек зрения подтвердил тезис «внутреннее лучше внешнего», указав на вычислительные различия между подходами. Он отметил, что большие модели используют механизм внимания: они сохраняют весь контекст в памяти и каждый раз заново анализируют всю информацию «с позиции всезнания». Omar указывает, что математически рекурсивное сжатие не может идеально смоделировать механизм внимания. В своей работе «Machine Studying» команда Omar переопределяет понятие «профессиональной способности» ИИ: важно не количество баллов в тестах, а соотношение объёма рассуждений и точности.
Jason Wei изначально сомневался в «теории масштаба больших моделей», но сейчас считает большие модели незаменимыми. Его эволюция взглядов отражает развитие отрасли за последние пять лет. В 2021 году в Google Brain Jason Wei с командой обнаружил, что если в подсказке дать большой модели пример логического вывода и научить её «пошагово записывать процесс мышления», то её способность к рассуждению значительно возрастёт — так появился метод Chain-of-Thought. Позже он сделал два ключевых вывода:
- Наличие эмерджентных способностей (emergent abilities) — способностей, которые отсутствуют у малых моделей, но присутствуют у больших (определение из его статьи Emergent Abilities of Large Language Models). Например, такие задачи, как сложение трёхзначных чисел и многошаговые рассуждения, у малых моделей имеют почти нулевую точность, но начинают проявляться у моделей с масштабом около 100B параметров.
- Метод Chain-of-Thought эффективен только для больших моделей: у малых он не улучшает, а ухудшает результаты из‑за ошибочных промежуточных шагов рассуждения (об этом сказано в статье Chain-of-Thought Prompting Elicits Reasoning in Large Language Models).
В OpenAI Jason Wei участвовал в разработке передовых проектов по рассуждению, включая серию o1, и пришёл к выводу, что для того чтобы большие модели превзошли человека, нужно использовать обучение с подкреплением для раскрытия их внутренних продвинутых мыслительных способностей.
Rich Sutton в «Горьком уроке» утверждает, что инженерные решения в ИИ будут вытеснены мощностью вычислений и объёмом данных. В истории ИИ неоднократно повторялась ситуация: попытки создать интеллектуальные системы через инженерные решения (экспертные системы в 70-х, детальный инжиниринг признаков и статистические модели в 90-х — 2010-х, знаниевые графы в конце 2010-х) уступали место методам, основанным на больших объёмах данных и вычислениях (глубокое обучение, предобученные большие модели).
Matthew Auburn считает, что в бизнесе 90 % задач требуют 60 % интеллекта и 100 % исполнения. Предложено направление развития: разделение основных когнитивных способностей на множество экспертных моделей (на уровне миллиардов), работающих совместно (расширение архитектуры MoE) — такие модули будут более гибкими, заменяемыми и проверяемыми. Omar Khattab, важный участник оптимизации Harness, признаёт инженерную ценность Harness, но не считает, что он может заменить возможности модели. Его работа над фреймворком DSPy и исследованием Meta*-Harness направлена на повышение уровня автоматизации инструментальных цепочек.
Ссылки:
<<<CODE_BLOCK_N>>>
<<<IMG_N>>>
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.