DeepDigest
Leiphone · · ~10 мин

DeepSeek V4 Pro и Harness: тестирование и особенности открытого фреймворка

Статья анализирует модели DeepSeek V4 Pro и Harness, их тестирование и особенности открытого фреймворка. Рассматриваются результаты тестов, технические характеристики, ценовые параметры и особенности интеграции с другими системами. Особое внимание уделяется различиям между режимами работы и подходами к управлению контекстом и инструментами.

DeepSeek V4 Pro и Harness: тестирование и особенности открытого фреймворка

Статья Ли На от 1 сентября 2026 года анализирует модели DeepSeek V4 Pro и Harness — от посттренировки до «агентного саморазвития», с акцентом на изменениях в открытом фреймворке. В сфере больших моделей существует несколько ключевых противоречий: между ростом способностей модели и возможностью получить из них надёжные результаты; между ограниченностью вычислительных ресурсов и высоким спросом на способности; между снижением цены на модель и ростом реальных затрат; между созданием универсального ИИ и поставкой готового к использованию продукта.

Проведены тесты DeepSeek v4-Pro и Harness. Использовался прямой доступ к API, семь заданий по кодированию (четыре из них — с изменением одной переменной для сравнения). Тестирование проводилось при объёме контекста в 92 млн токенов, проверялось 19,8 тыс. строк исходного кода и 21,7 тыс. строк тестов. Цели тестирования — оценить v4-Pro, сравнить его с версиями Flash и Preview, выяснить причины снижения качества при подключении к некоторым Harness, определить стоимость использования и понять, какие проблемы решает Harness.

DeepSeek V4 Pro, вероятно, прошёл продвинутый этап дообучения. При сравнении Pro и Flash выявлено, что Pro превосходит Flash по глубине, ширине, вниманию, пулу экспертов и ширине внутри экспертов. Ключевые параметры определены на этапе предварительного обучения, а не в ходе дообучения. В обеих моделях при обработке каждого токена активируется 6 экспертов.

В предыдущей версии v4-Pro-Preview (апрель) модель заняла первые места в трёх конкурсных задачах по кодированию, но результат в Terminal Bench 2.0 составил только 67,9. 31 июля Flash вышел в официальную версию: Terminal Bench 2.1 — 82,7, Pro-Preview — 72,1. Предполагается, что DeepSeek в версии Flash применила улучшенный метод пост-обучения, из‑за чего v4-Pro была переработана.

В v4-pro-0813 наблюдаются улучшения: Terminal Bench 2.1 — с 72,1 до 87,9, DeepSWE — с 12,8 до 62,7, внутренняя полносистемная тестовая выборка — с 41,8 до 71,1. В ходе личного тестирования шесть запусков дали максимальный балл, в том числе была найдена ранее неуловимая проблема.

Kimi K3 в большинстве агентных задач опережает версию 0813: Terminal Bench 2.1 — 88,3 против 87,9, DeepSWE — 67,5 против 62,7, Toolathlon — 76,5 против 74,1, Agents' Last Exam — 27,6 против 25,7. Версия 0813 лидирует только в трёх задачах.

Flash-0731 и Pro-0813 используют один и тот же внутренний тестовый набор и Harness. Параметры Pro в 5,6 раза превышают параметры Flash, активные параметры — в 3,8 раза, но преимущество в результатах незначительное. В Agents' Last Exam показатели 25,2 против 25,7 — практически равны.

Flash считается основным вариантом с оптимальным соотношением цены и качества, а Pro — вариантом с максимальным потенциалом. Официально не сообщалось о переобучении версии 0813 — заявлено лишь, что она основана на структуре Preview и дополнена модулем спекулятивного декодирования.

GLM-5.3 использует тот же 744B-основанный каркас, без изменения архитектуры и предварительного обучения, улучшения достигнуты за счёт продления пост-обучения. Возможно, в этой генерации основной акцент в развитии моделей сместился с предварительного обучения на пост-обучение.

Длина контекста в 1 млн токенов получена путём экстраполяции: 65536 × 16 = 1 048 576 (1 млн), с использованием метода YaRN. Среди трёх моделей, заявляющих о 1 млн токенов контекста, только DeepSeek явно использует экстраполяцию масштабирования. Kimi K3 изменил механизм внимания, GLM-5.2 не использует экстраполяцию, но установил rope_theta на 8 млн.

GLM-5.2 имеет архитектуру GlmMoeDsaForCausalLM, индексное поле и indexheaddim (128) совпадают с DeepSeek V4. GLM-5 интегрирует DeepSeek Sparse Attention (DSA), что снижает затраты на развёртывание при сохранении способности работы с длинным контекстом.

Эксперимент с размещением проверяемых данных в разных частях длинного текста (3 857 465 символов = 923 858 входных токенов) показал 100 % точность извлечения данных из 10 тестовых случаев. 95 % случаев относятся к позиции около 902 тыс. токенов. Вывод: экстраполяция не приводит к ухудшению качества в конце окна контекста. Тем не менее около 8 % случаев не были охвачены экспериментом.

Стоимость ввода для 02V4 Pro — $1,32 за миллион токенов (медианное значение для аналогов — $0,33), при этом стоимость одной задачи — $0,25 (вторая по дешевизне среди 106 открытых больших моделей). Стоимость одной задачи для Kimi K3 — $0,84 (в 3,4 раза дороже, чем у 02V4 Pro), для GLM-5.2 — $0,32, для Claude Opus 5 — $2,34 (в 9,4 раза дороже).

При работе с контекстом в 920 тыс. токенов первая задача стоит примерно ¥9,00, последующие (со 2‑й по 5‑ю) — примерно ¥0,28 в сумме. В пяти запросах 923 776 токенов совпадают, новые токены — от 143 до 151. Процент попадания в кэш при четырёх задачах по кодированию — от 93 % до 98 %.

Установлены инженерные ограничения:
* результаты инструментов более 8192 символов обрезаются (оставляются первые 4096 и последние 1024 символов);
* данные более 50 000 байт сохраняются на диск, а не в контекст;
* ограничение вывода для заголовка сессии — 64 токена.

17 августа в 00:00 (UTC 16 августа 16:00) официально вступило в силу повышение цен:
* при попадании в кэш — в 6–12 раз;
* при непопадании в кэш — в 1,5–3,0 раза;
* для вывода — в 2,25–4,5 раза.

Высокие периоды (UTC): 01:00–04:00 и 06:00–10:00 (по пекинскому времени — 09:00–12:00 и 14:00–18:00).

Частота попаданий в кэш для четырёх задач кодирования — 93–98 % (максимум: 1 431 040 из 30 672).

На архитектурном уровне MoE позволяет получить общий объём параметров 1,6T, вычислительные мощности — 49B.

При подключении V4 Pro к Claude Code качество работы заметно снижается, при использовании OpenCode — в норме. Проблема связана с официальным маршрутом: DeepSeek реализовал перевод имён моделей для интеграции с экосистемой Claude.

Сопоставление моделей:
* claude-opus → Pro;
* claude-sonnet и claude-haiku → Flash.

Трудность возникает с Sonnet: в Anthropic это основная рабочая модель, близкая по возможностям к Opus, но в данной системе сопоставления она объединена с Haiku в Flash (284B). Если использовать имена, не начинающиеся с claude- (например, foobar-9000, gpt-5-turbo), возвращается ошибка 400 с указанием, что поддерживаются только два имени моделей DeepSeek.

Имена, начинающиеся с claude-, автоматически сопоставляются с моделью DeepSeek. Риск ошибки: в конфигурации любое имя Claude, не относящееся к текущей версии, может быть сопоставлено с Flash (например, claude-3-opus-20240229 → Flash, claude-opus-4-6 → Pro).

Разработчикам необходимо явно переопределить четыре переменные окружения: ANTHROPICMODEL, ANTHROPICDEFAULTOPUSMODEL, ANTHROPICDEFAULTSONNETMODEL, CLAUDECODESUBAGENTMODEL.

13 августа в 19:19 было анонсировано официальное издание V4‑Pro, через 76 минут DeepSeek открыл исходный код своего Harness. DeepSeek указывает, что опубликованные баллы отражают результат работы модели с конкретным Harness, а не только самой модели.

Результат Code Agent от 0813 получен с использованием DeepSeek Harness в минималистичном режиме и max мышления. В минималистичном режиме модель имеет доступ только к двум инструментам: постоянному bash и редактору замены строк, сжатие контекста отключено, системное приглашение — одна фраза, тайм‑аут простоя — 172 800 000 мс (48 часов).

Claude Code противоположен по подходу: акцент на системном приглашении, множество инструментов, автоматическое сжатие.

При тестировании на одинаковых задачах: для задачи по реструктуризации нескольких файлов стандартный режим выполнил 42 шага, минималистичный — 65 шагов (на 55 % больше); для задачи по устранению неполадок терминала — 20 и 27 шагов соответственно (на 35 % больше). Минималистичный режим решил обе задачи, но стоимость решения задачи с интенсивными изменениями оказалась на 58 % выше, а совокупный показатель попадания в кэш в минималистичном режиме в 2,4 раза выше, чем в стандартном.

Plugin — это как отношение ОС и приложения. В dsh плагины включают модельные адаптеры, таблицу инструментов, журналы сеансов, стратегии песочницы, основной цикл.

dsh предоставляет модели пять инструментов, позволяющих в процессе работы создавать, монтировать, выполнять и останавливать плагины (согласно packages/extensions/tool-cordis/README.md).

Cordis-набор инструментов: пять инструментов, ориентированных на модель, в рамках текущего процесса DSH. cordisdefine позволяет модели создать пакет (указать название, назначение, код для хост‑стороны, опционально — для браузера), после проверки синтаксиса пакет регистрируется, в диалоге появляется карточка с кнопкой запуска; cordisrun выполняет пакет в VM‑песочнице.

Песочница изолирует глобальные объекты, но не является границей безопасности — есть риск утечки. Набор инструментов следует рассматривать как bash‑права.

dsh может использовать конкурентов в качестве под‑агентов (например, Claude, Codex). В ходе тестирования (задача E7) Claude‑подпроцесс был запущен, зафиксирован процесс клонирования официального рынка плагинов Claude Code. При этом две попытки делегирования завершились ошибкой Error: subagent run failed. Модель снизила уровень до обычного под‑агента и сообщила о смене инструмента и причинах этого.

V4 Pro и Harness — разные продукты; использование V4‑Pro и dsh отличается. Для использования API достаточно получить API key и подключить Claude Code, Codex, OpenCode. v4-Pro — готовый продукт, а dsh — инструмент для разработки, требующий настройки.

Для работы с dsh нужно: уметь изменять конфигурацию в YAML (самостоятельно выбирать модель, инструменты, настройки контекста, параметры песочницы и режим работы — «прямой вызов» или «вызов через программу»); быть готовым к непредсказуемым изменениям и отсутствию поддержки; самостоятельно оценивать риски (продукт помечен как developer preview, возможны ломающие изменения, Issues закрыты, нельзя задавать вопросы — нужно разбираться в коде).

В архитектуре dsh (docs/architecture.md, строка 7) рекомендуется использовать agent для изучения кода.

Пример проблемы: запрос в 920 000 токенов был прерван по таймауту на клиенте, данные не сохранились локально, но на сервере запрос обработан и списан платёж в размере ¥9,00.

Наблюдение: после двух последовательных сбоев инструмент не имитировал успех, а сменил схему выполнения задачи, сообщив об этом и объяснив причины.

Данные репозитория DeepSeek на 2026-08-14: Issues отключены, внешних PR — 0, доступна только дискуссия; 330 watch против 85 268 star. В репозитории присутствуют элементы управления Issues (policy, lifecycle, шаблоны, тесты), но они не активированы (.github/workflows/).

При тестировании двух задач с матрицей «три конфигурации × две задачи» получены противоположные результаты: для задачи по рефакторингу нескольких файлов — затраты на написание программы выше на 22 %, скорость ниже на 34 %; для задачи по устранению неполадок в терминале — экономия 23 %, скорость выше на 38 %.

Количество вызовов инструментов снизилось с 67 до 44, при этом количество выходных токенов выросло на 42 %, а токенов размышления — на 53 %.

В документации (packages/core/tools/README.md) указано, что Code Mode «не обещает общего сокращения токенов».

Код-репозиторий Harness организован с ориентацией на Agent, а не на человека — это подтверждается 9 доказательствами из открытого исходного кода. Предполагается, что цель такой организации — позволить модели самостоятельно итерироваться.

Система рассчитана на длительное самостоятельное выполнение и модификацию: все компоненты заменяемы, сохраняются все решения (686 документов, включая 11 отклонённых), тестов больше, чем исходного кода, покрытие каждого файла — 100 %, компоненты разбиты на мелкие части, затраты на единицу работы минимизированы.

DeepSeek не устанавливает рекомендуемых настроек и режимов, не указывает, какие параметры включать — не берёт на себя суждения о поведении пользователя.

dsh представляет собой платформу (как AOSP), а не готовый продукт: это ОС с ядром, но без предустановленной системы; аналогично тому, как производители телефонов используют AOSP для создания собственных версий (HyperOS, OriginOS).

DeepSeek предполагает, что пользователь (человек или модель) — самостоятельный субъект и полностью передаёт ему право принятия решений, включая выбор режима работы, модели по умолчанию и других параметров.

Противоречие заключается в степени передачи права принятия решений и способности/стоимости его принятия со стороны пользователя.

Claude Code использует компромисс: даёт половину свободы и набор значений по умолчанию.

Есть три возможных объяснения подхода DeepSeek:
1. У команды нет ресурсов и желания создавать продукт, команда состоит из исследователей, все ресурсы направлены на модель.
2. Предельные выгоды от коммерциализации продукта низки: для C‑пользователей продукт непривлекателен, для B‑пользователей достаточно API.
3. Команда сознательно не берёт на себя принятие решений за пользователя — либо из‑за невозможности их принять, либо из убеждения, что человеческие идеи слишком разнообразны, чтобы ограничивать их значениями по умолчанию.

С развитием моделей (увеличение мощности, длины контекста, возможностей Agent) возникают новые вопросы: как использовать возможности, куда направлять затраты, какие решения оставить за продуктом, какие — за человеком или моделью.

DeepSeek отвечает на эти вопросы, открывая больше возможностей, но одновременно передавая пользователю больше выбора и ответственности.

AI ,Minimax H3 vs Seedance 2.0 Fast
2026-08-15
Qwen 3.8-MaxAI:GPT5.6
2026-08-07

// оригинал
Leiphone ↗ Читать оригинал
10 просмотров
// поделиться Telegram VK