TGTGInsightаналитика telegramLIVE / telegram public index
← Когнитивная нагрузка Майка Новикова
Когнитивная нагрузка Майка Новикова avatar

TGINSIGHT POST

Post #514

@cogload

Когнитивная нагрузка Майка Новикова

Просмотры139Количество просмотров
Опубликован6 мар.06.03.2026, 15:01
Содержимое поста

Содержимое

Все не так сладко с редактирующими нейронками Я много раз восторгался возможностям нано бананы и Flux Klein. Они очень впечатляют своими возможностями, когда пробуешьделать что-то Но самое интересное начинается, когда нужно получить именно то, что нужно. 😬 Я тут помогаю прекрасной Арине Швецовой визуализировать шалость с велосипедной формой. В процессе отлаживаю пайплайн создания и доработки картинок. На удивление Gemini 3 pro image (Nano Banana Pro) и Flux Klein хорошо друг друга дополняют: там где не справляется одна модель, затаскивает другая, и наоборот. Gemini отлично работает, чтобы совмещать несколько объектов, переносить рисунок или менять позу. Klein лучше сохраняет исходную позу, отлично меняет освещение, лучше сохраняет логотипы и детали при точечных правках (особенно с нодой inpaint crop&stich на высоком разрешении) Вот еще несколько советов, которые помогают выжимать согласованные результаты с хорошим качеством из обеих моделей: ● Убирать все лишнее с референсных фото. Даже мощные нейронки путаются, когда нужно совместить слишком много сущностей: стиль, освещение, направление камеры, детали конкретных объектов и т.п. Я отдельно готовил лица персонажей, форму на «невидимом манекене», отдельно редактировал шорты, очки и т.п. Общий принцип такой: если зажмуриться и посмотреть на картинку и в ней видны ненужные элементы — надо их несчадно убирать. Klein для этого идеально подходит ● Дорабатывать текстовый запрос для ясности. В Nano Banana встроена рассуждающая нейронка, которая под капотом дописывает базовый запрос до сложного и детального, и уже его отправляет в генерацию. Klein вообще никак не улучшает промпт — что написал, то он и отправит в модель. Поэтому для него я сделал специальный дописывальщик промпта: закидываешь свою картинку и говоришь, что надо сделать. Он на основе картинки выдает более эффективный промпт, привязываясь к деталям. На удивление, улучшенный таким способом текст, даже в банане повышает качество результата! ● Волшебства не существует. Как бы не были хороши нейронки, а все-таки с некоторыми вещами они неимоверно тупят. Чтобы получить позу со скрещенными руками двух людей мне пришлось знатно попотеть: сделать маску по глубине и очень детально расписывать промпт чтобы получить нужное выражение и расслабленный вайб у персонажей. А детали формы местами пришлось допиливать по старинке в Affinity — совмещая лучшие попытки и подчищая косяки. Так что если хотите получить по-настоящему крутой результат, готовьтесь к фрустрирующей итерационной работе с периодическими возгласами «да капец, что-ж ты творишь, это не то!» 🐱 Там Арина в канале рассказывает со своей стороны историю, ну и вся финальная красота тоже там, так что подписывайтесь! 🎤Ссылки на утро — второй канал ⏲Устойчивый VPN за звезду #опыт@cogload#text2image@cogload