Новый метод поможет сделать языковые модели безопаснее: разреженные автоэнкодеры выявляют слабые места
Разработан метод оценки надёжности LLM с помощью разреженных автоэнкодеров; предложена стратегия тонкой настройки для повышения безопасности языковых моделей.