Попросите нейросеть показать кота-космонавта — и через десять секунд получите картинку, хотя такой фотографии не существует. Генеративные модели не ищут готовое изображение и не собирают коллаж из чужих кусков. Они рисуют с нуля — из чистого случайного шума. Рассказываем, как это работает, без единой формулы.
Диффузионную модель обучают задом наперёд. Берут миллионы настоящих фотографий и постепенно засоряют их шумом, пока не останется только рябь. Модель следит за каждым шагом порчи и запоминает, как его обратить вспять. Генерация — та же порча, запущенная в обратную сторону. Получив случайную рябь и текстовую подсказку, модель шаг за шагом убирает шум и проявляет то, что вы просили. В слайдере ниже — четыре стадии одного кадра: от помех до заката в горах.
Именно поэтому два одинаковых ответа у нейросети не бывают: другой стартовый шум — другая картинка. И поэтому она путается в деталях вроде пальцев: модель не знает анатомии, она лишь помнит, как выглядят миллионы рук одновременно. Шум — это мрамор, из которого можно высечь что угодно. А ваша фраза — резец в руках скульптора.
Top comments (0)