DeepDigest
← все статьи
Safety

Safety

136 статьи по теме

cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Система предскажет фейковые новости и вспышки насилия: мультимодальный подход

Мультимодальная система на базе XLM-RoBERTa и CLIP с точностью 98 % выявляет фейковые новости и признаки насилия, учитывая текст, изображения и геоданные.

читать →
~1 мин 373 просмотра
TechNews / AI

Трамп о ИИ: минимальное регулирование и противостояние Китаю

Трамп считает, что США должны сохранить лидерство в ИИ и минимизировать госрегулирование отрасли, чтобы противостоять Китаю. В июне 2026 года администрация ввела, а затем сняла экспортный контроль над моделями ИИ от Anthropic. В целом политика Трампа направлена на дерегулирование сферы ИИ.

читать →
~2 мин 375 просмотра
AI Weekly

Anthropic и AlphaFold: ИИ делает шаги в науке и быту

Нобелевский лауреат Джон Джампер перешёл в Anthropic. Компания запустила инструмент Claude Science и открыла гранты на исследования. Tencent выпустила открытую модель Hunyuan Hy3, а Mistral анонсировала новую модель с открытым весом. ИИ доказывает эффективность в образовании и медицине, а также набирает популярность в потребительских приложениях.

читать →
~2 мин 263 просмотра
TechNews / AI

JADEPUFFER: ИИ-агент провёл атаку с программой-вымогателем

ИИ-агент JADEPUFFER впервые автономно провёл атаку с использованием программы-вымогателя. Агент использовал уязвимость в Langflow для доступа к системе, собирал данные, устанавливал постоянное присутствие и зашифровал настройки сервиса Nacos. Эксперты видят в этом случае признак новой эры в кибербезопасности.

читать →
~2 мин 415 просмотра
TechOrange

JadePuffer: первая атака вымогателя с ИИ-агентом

Группа Sysdig обнаружила атаку JadePuffer — первую программу-вымогатель, управляемую ИИ‑агентом. Атака использует уязвимости в Langflow и Nacos, собирает конфиденциальные данные и шифрует настройки для шантажа. Эксперты рекомендуют усилить безопасность инфраструктуры ИИ.

читать →
~4 мин 225 просмотра
TechOrange

ИИ в финансах: риски, прогнозы и регулирование — Citi, FCA, McKinsey

ИИ активно меняет финансовую индустрию — от повышения эффективности до борьбы с мошенничеством. Регуляторы, включая FCA, предупреждают о рисках использования ИИ в финансах и предлагают меры по их снижению. При этом технология может сделать финансовые услуги доступнее для более широкого круга людей.

читать →
~3 мин 259 просмотра
TechOrange

Codey от Mind Children: социальный робот для общения и помощи

Стартап Mind Children Robotics создаёт социального робота Codey для общения и помощи людям. Его планируют использовать в образовании, медицине и других сферах. Основной рынок — Южная Корея, в США робот сначала появится в отелях, музеях и галереях. При этом внедрение таких роботов вызывает вопросы с точки зрения этики и защиты данных.

читать →
~2 мин 242 просмотра
TechNews / AI

ЮНИСЕФ: 20 млн детей используют ИИ, осваивая его в 3 раза быстрее взрослых

По данным ЮНИСЕФ, около 20 миллионов детей в 10 странах используют ИИ, осваивая его в три раза быстрее взрослых. Более 13 миллионов из них применяют ИИ для учёбы и домашних заданий. ЮНИСЕФ призывает власти и технологические компании усилить защиту детей в цифровой среде и провести дополнительные исследования влияния ИИ на их развитие.

читать →
~2 мин 393 просмотра

AI как новая поверхность атаки: реальные инциденты, мошенничество и уязвимости агентной эпохи

Статья рассматривает случаи атак на AI-системы и связанные с ними угрозы, включая мошенничество, утечки данных и уязвимости агентных систем, и классифицирует их по уровню нанесённого ущерба.

читать →
~19 мин 299 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

ProvenanceGuard: новый способ защитить LLM-агентов от ошибок

Разработана система ProvenanceGuard для защиты LLM-агентов от несоответствий с запросами пользователя; тесты показали значительное снижение частоты ошибок.

читать →
~1 мин 440 просмотра
Computerwoche

Как выявить скомпрометированных агентов ИИ: признаки и методы

«Смертельная тройка» факторов делает агентов ИИ уязвимыми для атак. Практикам нужны новые способы отличить скомпрометированное поведение от нормального. Meta* предложила «Правило двух»: агенты должны иметь не более двух из трёх компонентов «смертельной тройки». Есть пять сигналов, которые могут помочь обнаружить скомпрометированные агенты ИИ.

читать →
~4 мин 262 просмотра
TechNews / AI

OpenAI и Anthropic: обсуждение доли прибыли и регулирования ИИ

OpenAI рассматривает возможность передачи 5% акций правительству США для распределения прибыли от ИИ. Financial Times и «Рейтер» сообщают о дискуссиях вокруг доли капитала в ИИ-индустрии. Белый дом усиливает надзор за передовыми моделями, а Министерство торговли сняло экспортные ограничения для некоторых моделей Anthropic.

читать →
~2 мин 434 просмотра
Leiphone

ICML 2026 в Сеуле: новые тренды в машинном обучении

С 6 по 11 июля в Сеуле пройдёт ICML 2026 — 43‑я Международная конференция по машинному обучению. Количество заявок на конференцию удвоилось, что говорит о качественных изменениях в исследованиях ИИ. Среди ключевых трендов — рассуждения о LLM, безопасность ИИ, оптимизация моделей и применение ИИ в науке.

читать →
~3 мин 465 просмотра
Leiphone

Отчёт об оценке безопасности языковых моделей: Пекин, 2026

В Пекине опубликовали первый в мире отчёт об оценке способности языковых моделей предотвращать угрозы безопасности. В исследовании проанализировали 38 моделей с помощью 313 вопросов высокого риска. Отчёт предлагает новые критерии оценки безопасности и рекомендации для управления рисками.

читать →
~2 мин 461 просмотра
Computerwoche

Visa: ИИ-агенты совершают покупки в цифровых кассах

Visa запустила пилотную программу Visa Agentic Ready — в её рамках ИИ-агенты совершили первые реальные покупки в Европе. В операции участвуют более 30 европейских банков и ряд торговых компаний. Для защиты транзакций используется протокол доверенных агентов (TAP) и платёжные ключи Visa Passkey.

читать →
~2 мин 270 просмотра
TechOrange

UBTech представила робота-компаньона UWORLD U1: шаг к семейному использованию

UBTech представила робота-компаньона UWORLD U1, нацеленного на семейное использование. В отличие от большинства человекоподобных роботов, ориентированных на промышленность, U1 призван помогать одиноким людям. При этом остаются технические и этические вопросы, связанные с его применением в быту.

читать →
~2 мин 260 просмотра
Leiphone

ICML за десять лет: эволюция взглядов на искусственный интеллект

На конференции ICML за десять лет были подняты ключевые вопросы развития искусственного интеллекта: от технологического оптимизма до осознания этических и практических сложностей. Выступления учёных отразили эволюцию взглядов — от веры в безграничные возможности алгоритмов до понимания важности этических аспектов и распределения полномочий между людьми и машинами. Особое внимание уделялось проблемам качества данных, справедливости и безопасности систем ИИ.

читать →
~4 мин 432 просмотра
Computerwoche

Lakehouse как основа корпоративного ИИ: примеры Docusign и Lemongrass

Lakehouse становятся основой корпоративных ИИ-решений, объединяя преимущества озера данных и классического хранилища. Компании вроде Docusign и Lemongrass уже используют такие платформы, уделяя особое внимание безопасности данных. Следующим этапом развития станет внедрение семантических уровней, которые помогут ИИ лучше понимать бизнес-контекст.

читать →
~4 мин 249 просмотра

Fable 5 от Anthropic: новые ограничения и сотрудничество с правительством США

Fable 5 от Anthropic возвращается с новыми ограничениями: срок бесплатной подписки сокращён, а доля токенов, которые можно использовать в модели, ограничена 50%. Компания совместно с правительством США разработала усовершенствованный классификатор безопасности. Взаимодействие между бизнесом и властями в сфере ИИ будет усиливаться.

читать →
~2 мин 282 просмотра
note.com / #AI

Роботы на войне: возможна ли битва машин вместо людей?

Статья рассматривает гипотетическую ситуацию, когда роботы с ИИ сражаются вместо людей. Обсуждаются риски и возможности такого сценария, параллели с историей и теория игр (равновесие Нэша). Автор подчёркивает, что будущее зависит от установления правил использования автономного оружия.

читать →
~2 мин 291 просмотра