Можно ли перенести визуальный язык пикториализма в современную генеративную модель и сохранить не только форму, но и ощущение изображения?
— вопрос, который я задала себе в начале поиска идеи. Я давно интересуюсь фотографией и разными её направлениями. В процессе поиска мне попались работы Кларенса Уайта — автора, чей визуальный язык я исследую в проекте. Его фотографии сильно меня зацепили, поэтому итоговый проект напрямую связан с попыткой переосмыслить и перенести этот стиль в генеративную среду
Исходные данные
Обучение модели построено на работах Кларенса Уайта — одного из ключевых представителей пикториализма начала XX века. Его фотография отличается не столько документальностью, сколько стремлением к художественной интерпретации: мягкий рассеянный свет, размытые контуры, точная работа с тональными переходами и вниманием к внутреннему состоянию сцены
Уайт был выбран как референс благодаря способности передавать сложные эмоциональные смыслы через минимальные визуальные средства и выверенную композицию


Этюд фигуры — Кларенс Уайт, 1910 / Окно студии — Кларенс Уайт, 1924
В рамках проекта был собран и подготовлен датасет, состоящий из фотографий автора. Отбор фокусировался на сохранении характерных визуальных признаков: мягкого фокуса, низкого контраста, статичных композиций и работы со светом. Эти изображения легли в основу обучения модели и сформировали её визуальный язык


Пузырь — Кларенс Уайт, 1905 / Пещера — Кларенс Уайт, 1901
Генерация реализована на базе Stable Diffusion XL с дообучением через DreamBooth и LoRA, что позволило адаптировать модель под узкий художественный стиль при ограниченном объёме данных. Используются параметры: разрешение 512, batch size 1, gradient accumulation 4, mixed precision fp16 и оптимизация через 8-bit Adam. Такой конфиг обеспечивает стабильное обучение на T4 GPU и позволяет сохранить баланс между качеством генерации и вычислительными ресурсами


soft pictorialist photo, woman by window, diffused light, silence

pictorialist scene, figure in mist, gentle light, timeless mood
В результате обучения была получена серия генераций, визуально близких к пикториализму
Сцены остаются простыми и статичными: фигуры у окна, человек в тумане, природные мотивы, вода, животные. При этом ключевым становится не сюжет, а состояние — ощущение тишины, замедленности и внутреннего напряжения
Серия не повторяет конкретные работы, а интерпретирует их принципы, создавая новые сцены в рамках того же визуального языка


person in lake / ducks in lake


sheepheard with sheeps / dark clouds in sky


оригинальное изображение: Нагота — Кларенс Уайт, 1900 / генерация: soft focus nude form, curved pose, warm sepia tone


оригинальное изображение: Нагота — Кларенс Уайт, 1909 / генерация: soft focus nude form, curved pose, warm sepia tone


korean street / bus in japan
person on the beach


dog in a sunbeam / cat in a basket


kid in a cave / woman in a cave


raven in a cave / raven on a roof
Что удалось сделать
В итоговой серии удалось частично воспроизвести ключевые характеристики работ Кларенса Уайта
— Во-первых, хорошо передается работа со светом: изображения остаются мягкими, без резких контрастов, с плавными переходами между тонами. Это создает ощущение растворенности формы в пространстве
— Во-вторых, сохраняется композиционная статичность. Большинство сцен построено вокруг одной фигуры или простого действия, что соответствует оригинальному подходу автора
Что не получилось в полной степени
Нейросеть не всегда точно воспроизводит глубину смысла. В некоторых генерациях сцены выглядят скорее как стилизация, чем как полноценная эмоциональная конструкция. Это связано с тем, что модель обучается на визуальных паттернах, а не на концептуальном уровне




