Новый взгляд на обучение нейросетей: как модели выбирают простые решения
Исследователи объяснили, почему глубокие нейросети с мономиальными активациями склонны упрощаться в процессе обучения — за счёт появления неактивных нейронов.
724 статьи по теме
Исследователи объяснили, почему глубокие нейросети с мономиальными активациями склонны упрощаться в процессе обучения — за счёт появления неактивных нейронов.
Фреймворк RADIANT-PET использует LLM и обучение с подкреплением для точной сегментации поражений при ПЭТ/КТ — лучше отсеивает ложные срабатывания и согласовывает прогнозы с клинической интерпретацией.
Google выпустил модели Nano Banana 2 Lite для генерации изображений и Gemini Omni Flash для создания и редактирования видео. Первая отличается высокой скоростью и экономичностью, вторая позволяет комбинировать разные типы данных для работы с видео. Разработчики могут объединять модели в единый рабочий процесс.
Сравнение подписок ChatGPT Plus, Claude Pro и Gemini Pro за 20 долларов в месяц. Каждая модель имеет свои сильные стороны: Claude хорош для написания текстов, ChatGPT — для изображений и безопасности, Gemini — для интеграции с сервисами Google и создания видео. Выбор зависит от конкретных задач пользователя.
VirtueMap — структура для оценки LLM через призму аристотелевской этики: оценка ответов на этические дилеммы и формирование профилей моделей по добродетелям. Есть интерактивный сайт.
Авторы предложили усреднённые по ходу движения SAE — метод, который упрощает анализ длинных текстов в языковых моделях, фиксируя характеристики фрагментов, а не отдельных токенов.
Создана система DynaSteer, которая улучшает рассуждения LLM: она динамически корректирует траектории рассуждений, используя кластеризацию и Fisher-LDA.
ModernBERT адаптировали для юридической сферы — обучили на судебных решениях США. Модель лучше обрабатывает юридические тексты, работает с последовательностями до 8192 токенов. Модель выложена в открытый доступ.
Предложены новые метрики для оценки XAI-методов в CNN в реальных условиях с использованием особых возмущений данных; протестировано в медицинских и визуальных приложениях.
OpenAI меняет стратегию — от ориентации на обычных пользователей к работе с бизнесом. Компания интегрирует в ChatGPT Codex и шесть плагинов для разных сценариев, добавляет функции аннотаций и сайтов. Параллельно она стремится создать платформу наподобие App Store, в то время как Anthropic фокусируется на способности агентов выполнять конкретные задачи.
Статья посвящена роли ИИ в науке, в частности в математике и естественных науках. Обсуждаются новые стартапы в сфере ИИ — Neo Labs — и их вклад в развитие технологий. Также рассматривается нерешённая математическая задача, поставленная Паулем Эрдешем, и роль ИИ в её возможном решении.
Борис Чёрный из Anthropic выделил пять новых ролей в эпоху ИИ — от инженера‑прототипа до сопровождающего. По его мнению, искусственный интеллект стирает границы между профессиями, создавая возможности для специалистов широкого профиля. Годовой доход Claude Code превысил 2,5 млрд долларов, а инструмент обеспечил 4% публичных коммитов на GitHub.
IMCBench — тест для оценки ИИ-моделей в медицинских диалогах с изображениями; тестировались Claude, GPT, Nova, Llama; лучший результат у Claude Opus 4.6 (3,61 балла).
Создан набор данных и система виртуальных пациентов для обучения медиков с использованием LLM; есть интерактивный прототип для практики и обратной связи.
Учёные изучили, как LLM (Olmo2, Pythia) понимают убеждения и ситуации: эффективность зависит от размера модели и тренировок, есть противоречия в ответах.
Создан новый фильтр Калмана (CA-NKCF) для распределённой оценки данных: он эффективнее аналогов и не требует точных данных о шуме, хорошо работает в сложных условиях.
В Шэньчжэне прошёл салон разработчиков AXera Edge-Day, организованный Aixin Yuanzhi. На мероприятии обсудили создание базы вычислительных мощностей для физического ИИ и коммерциализацию edge AI. Партнёры компании продемонстрировали реальные кейсы применения edge computing в разных сферах — от голосового взаимодействия до умной розничной торговли.
Разработан метод автоматического извлечения лексической информации из словаря Al‑Mawrid с помощью n‑граммового анализа, KWIC и правил; показана высокая точность извлечения разных типов данных.
Учёные разработали модель генерации текста, которая допускает ошибки, но сохраняет высокую точность; подход приближает ИИ к реальным условиям работы с языком.
Су Вэйцзе, известный статистик и лауреат премии COPSS, присоединился к OpenAI, чтобы решать актуальные проблемы индустрии ИИ. Он считает, что в будущем теоретические навыки будут играть ключевую роль в разработке моделей искусственного интеллекта. В интервью учёный обсудил проблемы закона масштабирования, использования синтетических данных и другие вызовы отрасли.