DeepDigest
Leiphone · · ~4 мин

GeoLAN: как математика помогает раскрыть «чёрный ящик» ИИ

Математические достижения всё активнее применяются в обучении больших языковых моделей. Инструмент GeoLAN, основанный на трёхмерной гипотезе о подвесном ущелье, призван решить проблему «чёрного ящика» в LLM. ИИ уже демонстрирует впечатляющие результаты в математике, опережая людей в решении сложных задач. Взаимодействие математики и ИИ ускоряется, создавая новые возможности и вызовы.

GeoLAN: как математика помогает раскрыть «чёрный ящик» ИИ

Математическое сообщество и сообщество ИИ тесно связаны: достижения математики напрямую применяются в обучении больших моделей. Например, команда Флоридского университета внедрила трёхмерную гипотезу о подвесном ущелье в процесс обучения нейронных сетей — так появился инструмент GeoLAN. Его цель — решить проблему «чёрного ящика» в больших языковых моделях (LLM).

Проблема «чёрного ящика» состоит в том, что модели с высокой точностью решают задачи, но не могут объяснить логику своих решений. Её корень — «коллапс представления» (representation collapse): при обучении Transformer-модели концентрируют семантическую информацию в узкой области семантического пространства (явление «анизотропии»). Из‑за этого понятия запутываются, их трудно разделить — это приводит к путанице даже при незначительном изменении формулировки вопроса. Проблема характерна для GPT, Llama, Gemma.

Ранее решения проблемы сводились к «постфактумным» мерам: после обучения модели с помощью инструментов вроде разрежённых автоэнкодеров пытались разделить запутанные понятия. Но такие решения не гарантировали соответствия реальной логике модели.

GeoLAN предлагает иной подход: с самого начала обучения накладывать геометрические ограничения на пространство представлений, чтобы каждое понятие занимало своё место. В основе GeoLAN — понятие «вязкое подвесное множество», введённое в процессе доказательства трёхмерной гипотезы о подвесном ущелье (её поставил математик Гугу в 1917 году). Гипотеза касается вопроса: какова минимально возможная площадь, которую может охватить игла длиной 1 см, совершив оборот на поверхности стола. Оказалось, что эта площадь может быть близка к 0. В трёхмерном пространстве объём фигуры также можно сжать почти до нуля, однако её микроструктура сохраняет «трёхмерную насыщенность». Для оценки плотности структуры введено понятие «фрактальная размерность». Ван Хун и коллеги доказали, что даже при минимальном объёме фигура сохраняет плотную внутреннюю структуру, необходимую для учёта всех направлений.

Для внедрения правила в процесс обучения GeoLAN разработала две количественные штрафные функции: KT-CW и KT-Attn. KT-CW в процессе обучения проверяет семантическое пространство в разных направлениях и штрафует модель за избыточное скопление семантической информации в каком‑либо направлении — это заставляет модель равномерно распределять знания в многомерном пространстве. KT-Attn направлена на борьбу с гомогенизацией механизмов внимания: требует, чтобы каждый механизм внимания охватывал разные семантические области, предотвращая «сжатие» внимания.

Результаты применения подхода:
* в Llama-3-8B — преобразование сплюснутого конического пространства представлений в сферическое, снижение степени сжатия, повышение равномерности по направлениям при сохранении точности задач;
* в Gemma-3-4B — рост MMLU с 0,59 до 0,60 (прирост около 0,75 процентных пункта), улучшение семантической стабильности в TruthfulQA;
* в Gemma-3-12B — статистически значимое снижение уровня предвзятости.

Также выявлено явление «зоны золотого феникса»: строгие геометрические ограничения на равномерное распределение вредны для моделей с малым количеством параметров — им необходимо семантическое сжатие через переплетение концепций, принудительное рассредоточение ухудшает внутреннюю геометрическую структуру. Для моделей с слишком большим объёмом параметров (с чрезмерно сложным процессом предобучения) применение определённых правил ухудшает производительность. Оптимальный результат дают модели среднего объёма — с 4–8 млрд параметров.

В одной из работ ACL сформулирован «принцип семантической вязкости»: если представление соответствует «правилу предотвращения переполнения», разные семантические понятия автоматически разделяются на приближённо взаимно перпендикулярные подпространства (их называют «частицами»); каждое подпространство можно независимо объяснять и настраивать — это делает «проблему чёрного ящика» прозрачной.

Взаимодействие математики и ИИ ускоряется. Например, после доказательства трёхмерной гипотезы Гаусса через три месяца появился GeoLAN — инструмент для обучения больших моделей, основанный на чисто математических результатах.

Лауреат премии Филдса Jacob Tsimerman объявил о скором вступлении в OpenAI (направление безопасности ИИ). Год назад он в соавторстве с Andrew Critch (исследователь безопасности ИИ из Беркли) опубликовал статью A Taxonomy of Omnicidal Futures Involving Artificial Intelligence — в ней построена строгая классификация путей риска ИИ. В 2025 году у Tsimerman выйдет 5 математических статей на arXiv; он утверждает, что ИИ повысил эффективность его исследований вдвое.

За три дня до вручения премии студент Tsimerman Levent Alpöge с помощью Claude Fable 5 (Anthropic) за одну ночь опроверг гипотезу Якоби, которая оставалась нерешённой 87 лет.

За последние два месяца ИИ установил несколько рекордов в математике:
* AlphaProof (DeepMind) получил серебро на международной олимпиаде по математике;
* модель рассуждения OpenAI опровергла гипотезу об единичном расстоянии Эрдёша (проблема, остававшаяся нерешённой 80 лет);
* GPT-5.6 за час решила гипотезу о циклическом двойном покрытии;
* Claude Fable 5 за ночь опровергла гипотезу Якоби.

Jacob Tsimerman считает, что через два года ИИ превзойдёт людей в доказательстве математических теорем. Возникает вопрос: будет ли в 2030 году среди лауреатов премии Филдса человек? Премия имеет возрастное ограничение — лауреат должен быть моложе 40 лет. Если ИИ за четыре года превзойдёт людей в создании оригинальных математических результатов, комиссия столкнётся с дилеммой: награждать лучшего математика или лучшего из людей-математиков.

Статья о работе команды Флоридского университета: GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models. <<<CODE_BLOCK_N>>>
<<<IMG_N>>>
Ссылка

// оригинал
Leiphone ↗ Читать оригинал
3 просмотров
// поделиться Telegram VK