ИИ-фотосессия по одному фото: сравнил 5 подходов к сохранению лица
Мне понадобились нормальные фото для профиля и аватарки, а идти к фотографу не хотелось. Почти каждый ИИ-сервис сейчас обещает «фотосессию по одному селфи». Я решил проверить это на себе: одно фото, три сцены, пять подходов и одна попытка на кадр, без перегенераций до красивого результата.
Исходник — обычное селфи на телефон у белой стены, при ровном дневном свете. Я специально не брал студийное фото: так снимает большинство.
Что сравнивал
- Nano Banana Pro (Gemini 3 Pro Image от Google) — «голая» модель через API.
- GPT Image 2 от OpenAI — через агрегатор Venice.
- Seedream 5 Pro от ByteDance — тоже через Venice.
- Flux 2 Max от Black Forest Labs — наследник Flux Kontext, тоже через Venice. PuLID в список не попал: это надстройка для ComfyUI, и сравнивать её «из коробки» с остальными было бы нечестно.
- Fotoro — русскоязычный сервис с готовыми шаблонами фотосессий. Внутри у него Nano Banana 2 (Gemini 3.1 Flash Image).
Первые четыре модели я гонял через API. В ChatGPT и в приложении Gemini модели те же, но там к запросу добавляются свои системные инструкции, поэтому результаты могут немного отличаться.
Как тестировал
Для четырёх моделей я писал промпт так, как написал бы обычный пользователь: пара предложений о сцене и «сохрани моё лицо». В Fotoro выбирал готовые шаблоны с похожими сценами: «Современный бизнес-портрет в студии», «Пиджак у кирпичной стены» и «Вечер у костра». Формат везде 3:4, разрешение около 1K, одна генерация на сцену: что получилось с первого раза, то и показываю.
Сходство оценивал двумя способами. Первый — глазами. Второй — нейросетью распознавания лиц ArcFace из библиотеки InsightFace. Она превращает лицо в числовой «отпечаток», и я считал, насколько отпечаток на результате совпадает с исходником. Единица означает одно и то же фото. Для разных снимков одного человека обычно получается 0,5–0,8, для разных людей — около нуля.
Важная оговорка: ArcFace больше награждает кадры, где совпадают ракурс и выражение лица. Ниже станет видно, почему это важно.
Сцена 1: деловой портрет

С задачей «пиджак, табурет, серый фон» справились все пятеро. Разница — в лице.
GPT Image 2 скопировал меня почти дословно, вплоть до чуть удивлённого взгляда с селфи. Сходство 0,95, но и кадр вышел как «селфи, переодетое в костюм». Seedream (0,91) и Nano Banana Pro (0,87) тоже узнаваемы, а взгляд у них спокойнее. У Flux 2 Max цифра неплохая (0,89), но глазами видно, что волосы уложены иначе и лицо «причёсаннее» моего.
Fotoro (0,79) — единственный, кто дал улыбку и расслабленную позу. Для аватарки это самая «продающая» картинка, но по цифре — самая далёкая: улыбка меняет геометрию лица, и ArcFace за это штрафует.
Сцена 2: город, кирпичная стена

GPT Image 2 снова даёт 0,96 и снова тот же напряжённый взгляд. Seedream (0,85) держит хороший баланс: похоже и при этом живо. Flux 2 Max (0,82) проигнорировал «серый костюм» и сделал светлый, а лицо заметно изменилось: другие брови и форма бороды. Nano Banana Pro (0,79) узнаваем, но выглядит чуть старше.
Fotoro (0,80) аккуратнее всех выполнил сцену целиком: закатанные рукава, часы, руки в карманах. Промпт шаблона на полстраницы описывает каждую деталь позы, и это видно. Лицо при этом чуть моложе и мягче оригинала.
Сцена 3: осенний вечер у костра

Самая сложная сцена: тёплый свет огня сбоку и синие сумерки перекрашивают лицо, поэтому сходство упало у всех. У GPT Image 2 — 0,88, у остальных — от 0,74 (Nano Banana Pro) до 0,83 (Flux 2 Max).
Кадр Fotoro (0,78) по атмосфере самый «киношный»: искры, дрова, контровой свет. У Nano Banana Pro огонь пересветил лицо, и узнать меня там сложнее всего.
Итоговая таблица
| Подход | Сходство, среднее | Время на кадр | Цена за кадр |
| GPT Image 2 | 0,93 | 85–111 с | $0,34 |
| Seedream 5 Pro | 0,86 | 23–26 с | $0,06 |
| Flux 2 Max | 0,85 | 40–43 с | $0,12 |
| Nano Banana Pro | 0,80 | 16–19 с | $0,18 |
| Fotoro | 0,79 | 9–11 с | 10 токенов, ≈18–49 ₽ в зависимости от пакета |
Цены на модели указаны по прайсу Venice на сентябрь 2026 года, разрешение 1K.
Что я понял
- Нужен максимум сходства — GPT Image 2. Но он переносит с исходника и выражение лица: если на селфи вы уставший или напряжённый, таким же будете и в костюме. Ещё он самый медленный и самый дорогой.
- Лучший баланс — Seedream 5 Pro. Почти так же похоже, но в пять раз дешевле и в четыре раза быстрее.
- Flux 2 Max хуже всех слушается промпта: поменял цвет костюма и «облагородил» лицо.
- Nano Banana Pro хорош при студийном свете, но при сложном освещении (костёр) теряет лицо сильнее остальных.
- Готовые шаблоны (Fotoro) выигрывают не сходством, а тем, что делают работу за вас.
Если будете пробовать сами
- Исходник важнее модели: снимайте анфас, при ровном свете, без очков и фильтров.
- Выражение лица с селфи часто переезжает в результат. Хотите улыбку на фото — улыбнитесь на исходнике.
- Сложный свет (огонь, неон, закат) сильнее всего искажает лицо. Для первых проб берите студию или пасмурную улицу.
- Делайте 2–3 генерации одной сцены и выбирайте лучшую: разброс заметный у всех моделей. Я этого сознательно не делал, чтобы сравнение было честным.
- Метрики вроде ArcFace полезны, но последнее слово — за вашими глазами и за глазами тех, кто вас знает.
И последнее: одна проверка на одном лице — это личный опыт, а не исследование. На другом лице и в других сценах расклад может оказаться другим.
От кликов к GEO и LTV: почему Brandformance стал единственной жизнеспособной стратегией Статья
Буква «ё», странные шутки, обилие списков: как отличить текст нейросети от человеческого Статья
Рынок продвижения мобильных приложений в России вырастет до 24 млрд рублей Статья
Метрики GEO-эффективности: Чем заменить привычные позиции в топ-10, CTR и органический трафик в 2026 Статья
Что такое SEO-продвижение: ошибки, которые мешают вывести сайт в топ Статья
Как запустить рекламу мини-курса и не получить случайные продажи. Разбор Дмитрия Батухтина Статья





