DeepDigest
← все статьи
Safety

Safety

136 статьи по теме

TechNews / AI

Anthropic возвращает Claude Fable 5 и усиливает меры безопасности

Anthropic возвращает модель Claude Fable 5 в сеть — доступ для пользователей по всему миру планируют восстановить с 1 июля. Компания усилила меры безопасности после обнаружения уязвимостей модели и совместно с правительством разработала усовершенствованные механизмы защиты. Также Anthropic работает над созданием отраслевой системы оценки джейлбрейка с использованием ИИ.

читать →
~3 мин 459 просмотра
Computerwoche

Лучшие инструменты IAM: управление идентификацией и доступом

Управление идентификацией и доступом (IAM) — ключевая часть стратегии кибербезопасности в эпоху нулевого доверия. Инструменты IAM становятся всё разнообразнее и функциональнее, помогая компаниям решать множество задач. Эксперты советуют компаниям чётко определить свои потребности, чтобы выбрать подходящие решения.

читать →
~2 мин 293 просмотра
Zenn / AI

MCP и RAG: как агенты ИИ незаметно отправляют данные в облако

Агенты ИИ могут незаметно отправлять данные в облако через механизмы MCP и RAG. Это создаёт риски при работе с конфиденциальной информацией, особенно в контексте соглашений о неразглашении. Чтобы снизить угрозы, индустрия тестирует новые подходы к защите данных — от шлюзов и мониторинга до изоляции вычислений.

читать →
~2 мин 312 просмотра
IT BOLTWISE

Firewise в Орегоне: совместное создание защищённого пространства

В Орегоне сообщество Upper Olalla Firewise демонстрирует, как коллективные меры помогают снизить риск лесных пожаров. Подход включает создание защитного пространства между зданиями и растительностью, регулярную профилактику и сотрудничество между домохозяйствами. Программа поддерживается грантами и переходит от сезонной работы к постоянной профилактике, что может быть выгоднее в долгосрочной перспективе, чем тушение пожаров.

читать →
~3 мин 313 просмотра
ITmedia AI+

AX в ИИ-агентах: опыт для агентов и для людей

В эссе рассматривается концепция AX (опыт агента) в сфере ИИ‑агентов. Она включает два аспекта: упрощение работы для агентов и для людей. Важны прозрачность действий ИИ, контроль со стороны человека и продуманный дизайн взаимодействия. По прогнозам, к концу 2026 года 40 % корпоративных приложений будут содержать ИИ‑агентов.

читать →
~2 мин 474 просмотра
Golem.de / KI

Австрия предлагает Anthropic переехать в ЕС из-за влияния США

Александр Прелл, госсекретарь Австрии по цифровым технологиям, предложил Anthropic переехать в ЕС, чтобы снизить зависимость от решений США в сфере ИИ. При этом он сам сомневается в реалистичности инициативы — переезд лишь отсрочит проблемы, поскольку компания зависит от американских поставщиков оборудования. ЕС рассматривает поддержку Mistral как альтернативу.

читать →
~1 мин 454 просмотра
Leiphone

AISHPerf 3.0: новый тест для агентов обслуживания ИИ от Китайской академии

Китайская академия информационных и коммуникационных технологий представила версию 3.0 системы тестирования AISHPerf. В неё вошли два теста для оценки агентов по эксплуатации и техобслуживанию ИИ, опирающиеся на реальные данные. Тест охватывает отечественные чипы и позволяет объективно оценивать их работу в производственных сценариях.

читать →
~2 мин 425 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

Два подхода к ИИ: какой победит в конкурентной борьбе?

Учёные с помощью теории игр изучили конкуренцию между двумя типами ИИ-агентов (минимизирующим вред и ориентированным на одобрение) и определили условия, при которых первый может победить.

читать →
~1 мин 462 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

VirtueMap: как оценить этические принципы больших языковых моделей

VirtueMap — структура для оценки LLM через призму аристотелевской этики: оценка ответов на этические дилеммы и формирование профилей моделей по добродетелям. Есть интерактивный сайт.

читать →
~1 мин 448 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Yuvion LLM: новая модель ИИ с усиленной защитой от угроз

Yuvion LLM — модель ИИ с усиленной защитой от угроз, учитывающая «состязательный» характер атак; в тестах превзошла GPT-5.4 и Qwen3-MAX по показателям безопасности.

читать →
~1 мин 450 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

НормАкт: как ИИ справляется со скрытыми социальными нормами

Создан тест NormAct для оценки способности MLLM учитывать скрытые социальные нормы; предложен NormPerceptor, повышающий успешность задач с 24,2% до 46,7%.

читать →
~1 мин 456 просмотра
cs.LG
arXiv
Cornell University Library
arXiv cs.LG

Новый подход к прогнозированию выбросов CO2: как точнее считать давление в хранилищах углерода

Учёные нашли лучший метод прогнозирования давления и выбросов CO2 в геологических хранилищах — постепенный модификатор с коррекцией проницаемости снижает погрешность до менее 3,7%.

читать →
~1 мин 515 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

ToE: новая система борьбы с фейковыми новостями

Система ToE автоматически проверяет факты, выстраивая дерево аргументов и собирая доказательства из разных источников. Улучшает точность на 4–24 п. п. по сравнению с аналогами.

читать →
~1 мин 470 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

DysLexLens: платформа на базе LLM поможет анализировать опыт учащихся с дислексией в онлайн-форумах

DysLexLens — платформа на базе LLM для анализа опыта учащихся с дислексией в онлайн-форумах. Фильтрует данные, объединяет семантический анализ и анализ на основе KG, оценивает ответы и даёт рекомендации по проверке их качества.

читать →
~1 мин 435 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

ИИ автоматически превращает инструкции в проверенные политики — прорыв в безопасности агентов

Система на базе LLM автоматически превращает текстовые инструкции в формальные проверенные политики для агентов (на языке Cedar). В тестах MedAgentBench превзошла ручное кодирование.

читать →
~1 мин 495 просмотра
TechCrunch AI

360 и Sakana AI: азиатские стартапы запускают ИИ-модели на фоне запрета США

Китайская компания 360 и токийский стартап Sakana AI запустили новые ИИ-модели на фоне затягивания запрета США на экспорт определённых технологий. Модели ориентированы на локальные рынки и призваны снизить риски экспортного контроля. Представители компаний подчёркивают важность коллективного подхода к развитию ИИ.

читать →
~2 мин 346 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

NeuraDock Agent: новый агент для анализа ЭЭГ с контролем качества данных

NeuraDock Agent — система для анализа ЭЭГ с контролем качества данных; разделяет движок и языковой уровень, обеспечивает стабильность и безопасность данных.

читать →
~1 мин 1216 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

Как понять мысли ИИ: новый подход к интерпретируемости

Авторы предложили метод интерпретации ИИ как агентов, разработав критерии и тесты для понимания «убеждений» и «желаний» моделей с учётом их взаимосвязи.

читать →
~1 мин 1740 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

Новый инструментарий поможет управлять медицинским ИИ

Предложен инструментарий для управляемых медицинских экосистем ИИ — он позволяет отслеживать и контролировать ИИ‑решения в медицине, пример применения — уход за пациентами с остеопорозом.

читать →
~1 мин 1102 просмотра