Просите «надпись СКИДКА 30%» — получаете «СКИЛКА ЗО0/о». Или что-то, что издали похоже на кириллицу, а вблизи оказывается набором закорючек, которые не складываются ни в одно слово ни на одном языке.
Это самая частая причина, по которой российский пользователь бросает нейросеть на полпути. Английский текст модели пишут прилично уже пару лет, а русский до сих пор превращается в глиф-кашу.
Разберём, почему так, какие модели всё-таки справляются и — главное — как получать нужный результат независимо от того, справляются они или нет.
Почему так происходит
Причины три, и все они системные, а не «модель плохая».
Мало данных. Изображения с русским текстом в обучающих выборках занимают доли процента. Английских вывесок, обложек и постеров в интернете на порядки больше. Модель просто видела мало примеров того, как выглядит правильно набранное русское слово.
Текст для модели — не текст. Диффузионная модель не набирает буквы, она рисует пиксели, похожие на буквы. Ей неизвестно, что «Д» и «Л» — разные символы с разным смыслом; она знает, что в этом месте композиции обычно бывает нечто с такими очертаниями. Отсюда буквы-химеры и слова, которых не существует.
Похожие начертания путаются. Ш и Щ, Ц и Ч, И и Н, Ь и Ъ отличаются деталью, которая на уровне пикселей едва различима. Даже когда модель почти справилась, она добавит лишний хвостик или потеряет нужный.
Отсюда закономерность: чем короче слово, тем выше шанс на успех. Одно слово из 4–6 букв капслоком получается регулярно. Фраза из трёх слов — почти никогда.
Способ 1. Выбрать модель, которая умеет
Разброс между моделями огромный, и он не совпадает с общим качеством картинки.
Хуже всего с кириллицей у моделей, ориентированных на художественную генерацию — Midjourney в их числе. Она рисует красиво и текст воспринимает как декоративный элемент, а не как символы.
Лучше справляются модели с раздельной обработкой текстового слоя — то есть те, что технически рендерят надпись, а не рисуют её. Сюда относятся современные редактирующие модели и специализированные генераторы для дизайна и рекламы. Отдельно стоит смотреть на отечественные модели: у них доля кириллицы в обучении несопоставимо выше, и на коротких надписях они часто выигрывают у зарубежных флагманов.
Проверять надо самому и на своей задаче — модели обновляются, и расклад меняется каждые несколько месяцев. Тест простой: попросите одно слово капслоком, потом фразу из трёх слов, потом слово со сложными буквами (например, «ОБЪЁМ» — тут и Ъ, и Ё).
Что помогает независимо от модели:
- Пишите нужный текст в кавычках:
a sign with the text "СКИДКА"— кавычки повышают шанс, что модель воспримет содержимое буквально. - Просите капслок:
in uppercase Cyrillic letters. Заглавные буквы проще, у них меньше вариативных элементов. - Указывайте язык явно:
Russian Cyrillic text, иначе модель может подставить латиницу. - Просите простой шрифт:
bold sans-serif. Декоративные начертания разваливаются первыми. - Оставляйте место:
large empty area around the text. В тесноте буквы слипаются.
a minimal poster with the text "СКИДКА" in uppercase Russian
Cyrillic letters, bold geometric sans-serif typeface, large empty
space around the text, flat solid background, high contrast,
clean graphic design
Даже с этим промтом закладывайте 5–10 генераций на одну удачную надпись. И проверяйте побуквенно — глаз достраивает знакомое слово, и опечатку легко пропустить.
Способ 2. Разделить слои — рабочий метод
Главный совет: перестаньте просить нейросеть писать текст.
Задача разбивается на две, и каждая решается тем инструментом, который для неё создан:
- Нейросеть рисует фон — сцену, фактуру, товар, композицию. То, где она сильна.
- Текст накладывается сверху в любом редакторе — Canva, Figma, Photoshop, да хоть в мобильном приложении.
Это не костыль, а нормальный дизайнерский процесс. Так делается любая коммерческая графика: фотография отдельно, типографика отдельно.
Ключ — попросить у модели фон, спроектированный под текст:
minimal product background for a promo banner, soft gradient from
warm beige to cream, a large empty area in the upper third for
text placement, subtle geometric shapes in the lower right corner,
clean commercial design, no text, no letters, no typography
Три важные детали:
a large empty area ... for text placement— модель оставит спокойное место, куда текст ляжет читаемо.no text, no letters, no typography— прямой запрет. Без него модель добавит декоративные псевдобуквы, которые придётся замазывать.- Указание, где именно нужно пустое место — иначе получите красивый, но плотно заполненный кадр.
Этот маршрут даёт стопроцентный результат по тексту и полный контроль над шрифтом, кернингом и фирменным стилем. Для карточек маркетплейсов, где инфографика обязана быть читаемой в размере иконки, другого варианта, по сути, нет.
Способ 3. Дорисовать текст поверх генерации моделью-редактором
Промежуточный вариант: сгенерировать изображение, а затем отдельным запросом попросить редактирующую модель добавить надпись в конкретное место.
Работает лучше, чем генерация текста сразу, потому что модель решает одну задачу вместо двух. Но результат всё равно нестабилен и требует проверки. Имеет смысл, когда текст должен лежать на объекте с перспективой и фактурой — надпись на вывеске, на упаковке, на футболке.
Для плоской промо-графики второй способ проще и надёжнее.
Что не получится
- Длинные тексты. Абзац, состав, описание — забудьте. Только редактор.
- Мелкий текст. Всё, что меньше примерно двадцатой доли высоты кадра, превратится в шум.
- Точное соответствие шрифту бренда. Модель нарисует «что-то похожее». Фирменный стиль — только вручную.
- Гарантированная орфография. Даже удачная генерация может содержать одну неверную букву. Проверяйте каждую.
- Ё. Отдельная боль: точки живут своей жизнью, съезжают или дублируются.
Практическое правило
Разделите задачи по критичности текста:
| Что делаете | Как делать |
|---|---|
| Инфографика для карточки | Фон генерацией, текст в редакторе |
| Промо-баннер, сторис | Фон генерацией, текст в редакторе |
| Вывеска в сцене как элемент антуража | Можно генерацией, читаемость не критична |
| Надпись на товаре | Только редактор или реальное фото |
| Декоративная псевдонадпись для настроения | Генерация, никого не смутит |
Логика простая: если текст должны прочитать — не доверяйте его нейросети.
Коротко
- Кириллица ломается из-за малой доли русских данных в обучении и потому, что модель рисует буквы, а не набирает их.
- Разброс между моделями большой, тестируйте под свою задачу — расклад меняется каждые несколько месяцев.
- Помогают: кавычки вокруг текста, капслок, простой гротеск, явное указание языка, пустое место вокруг.
- Надёжный маршрут — генерировать фон с запретом
no textи накладывать надпись в редакторе. - Если текст должны прочитать, нейросеть его не пишет. Это не поражение, а нормальное разделение труда.
→ Промты для рекламы и промо — фоны и подложки, спроектированные под надпись. → Промты для артов и постеров — если текст декоративный и читаемость не критична. → Промт по картинке — узнать, как сделан понравившийся кадр, и повторить приём со своим текстом.