DeepDigest
TechNews / AI · · ~2 мин

Grok 4.5 и обход защиты ИИ через смену языков

Злоумышленники научились обходить защиту ИИ, используя редкие языки и смешивая несколько языков в запросах. Проблема связана с тем, что LLM слишком зависят от англоязычных данных. Разработчики работают над универсальной многоязычной системой защиты, однако пока такие атаки могут быть эффективны.

Grok 4.5 и обход защиты ИИ через смену языков

Генеративный ИИ продолжает сталкиваться с новыми угрозами в сфере безопасности. Злоумышленники нашли способ обходить защитные механизмы — они используют не только английские подсказки (prompts), но и редкие языки, а также смешивают несколько языков в одном запросе. Такой метод называют «языковой сменой» или «переключением кодов» (code-switching): он запутывает модели и мешает им распознать злонамеренные намерения.

Проблема кроется в том, что большинство больших языковых моделей (LLM) при обучении и этапе «синхронизации с безопасными данными» слишком сильно зависят от англоязычных данных. Из‑за этого системы слабее защищают от запросов на языках с малым количеством доступных данных (low-resource languages).

Попытки решить эту проблему не дают простого ответа. Например, если система автоматически переводит неанглийские подсказки на английский и затем применяет правила безопасности, могут возникнуть ошибки: из‑за неточностей перевода или потери смысла часть угроз ускользнёт, а безобидные запросы могут быть ошибочно заблокированы. Ограничение ввода только английским языком тоже не выход — это резко сократит аудиторию и помешает глобальному развёртыванию ИИ-продуктов.

Разработчики ИИ ускоряют работу над многоязычной защитой. Недавние исследования показывают, что механизмы безопасности по разным языкам работают с разной эффективностью — это подтверждает чрезмерную ориентацию на английский. В будущем потребуется универсальная многоязычная система защиты.

Эта тенденция перекликается с недавним случаем обхода защиты в Grok 4.5. Международная организация по безопасности OWASP определяет подобные атаки как «инъекцию подсказок» (prompt injection): злоумышленник специально подбирает ввод, чтобы модель игнорировала правила безопасности. Даже если модель прошла предварительные тесты (например, red teaming), после запуска её всё равно могут взломать с помощью новых видов атак.

Эксперты по кибербезопасности подчёркивают: для создания надёжной защиты ИИ недостаточно полагаться только на одни правила. Нужно комбинировать разные механизмы — проверять результаты вывода, ограничивать доступ моделей к инструментам и системам, изолировать чувствительные данные, отслеживать риски на уровне сессии и при необходимости подключать ручную проверку.

Why Do Safety Guardrails Degrade Across Languages?

Tricking AI By Simply Switching Which Spoken Language You Use In Your Prompts

Pixabay

// оригинал
TechNews / AI ↗ Читать оригинал
3 просмотров
// поделиться Telegram VK