DeepDigest
TechOrange · · ~2 мин

Ornith-1.0 от DeepReinforce: саморазвивающийся код-генератор

DeepReinforce выпустила модель Ornith-1.0 для написания кода с помощью AI-агентов. Модель самостоятельно оптимизирует рабочий процесс и прошла успешные тесты, опередив ряд аналогов. Она особенно полезна для разработчиков, уже использующих AI-агентов в работе.

LLM
Ornith-1.0 от DeepReinforce: саморазвивающийся код-генератор

Лаборатория DeepReinforce выпустила открытый код модели Ornith-1.0 — она предназначена для написания кода с помощью AI-агентов и способна самостоятельно оптимизировать свою работу. Модель представлена в четырёх версиях: с 9B, 31B, 35B и 397B параметрами. Модель уже доступна на Hugging Face под лицензией MIT, без ограничений по регионам.

Особенность Ornith-1.0 в том, что она не использует готовые рамки работы, а сама разрабатывает и совершенствует рабочий процесс. Модель применяет технику обучения с подкреплением: сначала анализирует, как выполнить задачу, затем формирует более детализированный рабочий план и на его основе создаёт решение. Процесс повторяется тысячи и миллионы раз — и в итоге вырабатывается оптимальный способ выполнения задачи без участия человека.

Чтобы предотвратить возможные попытки «обмана» системы (например, когда AI имитирует выполнение задачи), DeepReinforce внедрила три уровня защиты:
* среда и тестовые наборы не могут быть изменены и находятся вне контроля модели;
* встроенный детектор отмечает попытки доступа к ограниченным путям или изменения тестовых скриптов;
* модель проверки в режиме чтения выступает в роли финального фильтра.

Результаты тестирования Ornith-1.0 впечатляют. Версия с 397B параметрами набрала 82,4 балла в тесте SWE-bench Verified (превзошла Claude Opus 4.7 с 80,8 балла и DeepSeek-V4-Pro с 80,6 балла). В тесте Terminal Bench 2.1, посвящённом отладке кода и устранению уязвимостей, модель получила 77,5 балла против 70,3 у Claude Opus 4.7. Даже базовая версия с 9B параметрами показала хороший результат в SWE-bench Verified — 69,4 балла, опередив Google Gemma 4-31B (52 балла) и сопоставившись с Qwen 3.5-35B (70 баллов).

При этом DeepReinforce подчёркивает: Ornith-1.0 не является универсальной AI-моделью. Она лучше всего подойдёт разработчикам, которые уже используют AI-агентов для написания кода и хотят автоматизировать многоэтапные процессы без вмешательства человека. Модель может работать на периферийном оборудовании, что делает её полезной для тех, кто развивает инфраструктуру AI-разработки.

// оригинал
TechOrange ↗ Читать оригинал
6 просмотров
// поделиться Telegram VK