Генеративный ИИ продолжает сталкиваться с новыми угрозами в сфере безопасности. Злоумышленники нашли способ обходить защитные механизмы — они используют не только английские подсказки (prompts), но и редкие языки, а также смешивают несколько языков в одном запросе. Такой метод называют «языковой сменой» или «переключением кодов» (code-switching): он запутывает модели и мешает им распознать злонамеренные намерения.
Проблема кроется в том, что большинство больших языковых моделей (LLM) при обучении и этапе «синхронизации с безопасными данными» слишком сильно зависят от англоязычных данных. Из‑за этого системы слабее защищают от запросов на языках с малым количеством доступных данных (low-resource languages).
Попытки решить эту проблему не дают простого ответа. Например, если система автоматически переводит неанглийские подсказки на английский и затем применяет правила безопасности, могут возникнуть ошибки: из‑за неточностей перевода или потери смысла часть угроз ускользнёт, а безобидные запросы могут быть ошибочно заблокированы. Ограничение ввода только английским языком тоже не выход — это резко сократит аудиторию и помешает глобальному развёртыванию ИИ-продуктов.
Разработчики ИИ ускоряют работу над многоязычной защитой. Недавние исследования показывают, что механизмы безопасности по разным языкам работают с разной эффективностью — это подтверждает чрезмерную ориентацию на английский. В будущем потребуется универсальная многоязычная система защиты.
Эта тенденция перекликается с недавним случаем обхода защиты в Grok 4.5. Международная организация по безопасности OWASP определяет подобные атаки как «инъекцию подсказок» (prompt injection): злоумышленник специально подбирает ввод, чтобы модель игнорировала правила безопасности. Даже если модель прошла предварительные тесты (например, red teaming), после запуска её всё равно могут взломать с помощью новых видов атак.
Эксперты по кибербезопасности подчёркивают: для создания надёжной защиты ИИ недостаточно полагаться только на одни правила. Нужно комбинировать разные механизмы — проверять результаты вывода, ограничивать доступ моделей к инструментам и системам, изолировать чувствительные данные, отслеживать риски на уровне сессии и при необходимости подключать ручную проверку.
Why Do Safety Guardrails Degrade Across Languages?
Tricking AI By Simply Switching Which Spoken Language You Use In Your Prompts
Pixabay