Просите «надпись СКИДКА 30%» — получаете «СКИЛКА ЗО0/о». Или что-то, что издали похоже на кириллицу, а вблизи оказывается набором закорючек, которые не складываются ни в одно слово ни на одном языке.

Это самая частая причина, по которой российский пользователь бросает нейросеть на полпути. Английский текст модели пишут прилично уже пару лет, а русский до сих пор превращается в глиф-кашу.

Разберём, почему так, какие модели всё-таки справляются и — главное — как получать нужный результат независимо от того, справляются они или нет.

Почему так происходит

Причины три, и все они системные, а не «модель плохая».

Мало данных. Изображения с русским текстом в обучающих выборках занимают доли процента. Английских вывесок, обложек и постеров в интернете на порядки больше. Модель просто видела мало примеров того, как выглядит правильно набранное русское слово.

Текст для модели — не текст. Диффузионная модель не набирает буквы, она рисует пиксели, похожие на буквы. Ей неизвестно, что «Д» и «Л» — разные символы с разным смыслом; она знает, что в этом месте композиции обычно бывает нечто с такими очертаниями. Отсюда буквы-химеры и слова, которых не существует.

Похожие начертания путаются. Ш и Щ, Ц и Ч, И и Н, Ь и Ъ отличаются деталью, которая на уровне пикселей едва различима. Даже когда модель почти справилась, она добавит лишний хвостик или потеряет нужный.

Отсюда закономерность: чем короче слово, тем выше шанс на успех. Одно слово из 4–6 букв капслоком получается регулярно. Фраза из трёх слов — почти никогда.

Способ 1. Выбрать модель, которая умеет

Разброс между моделями огромный, и он не совпадает с общим качеством картинки.

Хуже всего с кириллицей у моделей, ориентированных на художественную генерацию — Midjourney в их числе. Она рисует красиво и текст воспринимает как декоративный элемент, а не как символы.

Лучше справляются модели с раздельной обработкой текстового слоя — то есть те, что технически рендерят надпись, а не рисуют её. Сюда относятся современные редактирующие модели и специализированные генераторы для дизайна и рекламы. Отдельно стоит смотреть на отечественные модели: у них доля кириллицы в обучении несопоставимо выше, и на коротких надписях они часто выигрывают у зарубежных флагманов.

Проверять надо самому и на своей задаче — модели обновляются, и расклад меняется каждые несколько месяцев. Тест простой: попросите одно слово капслоком, потом фразу из трёх слов, потом слово со сложными буквами (например, «ОБЪЁМ» — тут и Ъ, и Ё).

Что помогает независимо от модели:

  • Пишите нужный текст в кавычках: a sign with the text "СКИДКА" — кавычки повышают шанс, что модель воспримет содержимое буквально.
  • Просите капслок: in uppercase Cyrillic letters. Заглавные буквы проще, у них меньше вариативных элементов.
  • Указывайте язык явно: Russian Cyrillic text, иначе модель может подставить латиницу.
  • Просите простой шрифт: bold sans-serif. Декоративные начертания разваливаются первыми.
  • Оставляйте место: large empty area around the text. В тесноте буквы слипаются.
a minimal poster with the text "СКИДКА" in uppercase Russian
Cyrillic letters, bold geometric sans-serif typeface, large empty
space around the text, flat solid background, high contrast,
clean graphic design

Даже с этим промтом закладывайте 5–10 генераций на одну удачную надпись. И проверяйте побуквенно — глаз достраивает знакомое слово, и опечатку легко пропустить.

Способ 2. Разделить слои — рабочий метод

Главный совет: перестаньте просить нейросеть писать текст.

Задача разбивается на две, и каждая решается тем инструментом, который для неё создан:

  1. Нейросеть рисует фон — сцену, фактуру, товар, композицию. То, где она сильна.
  2. Текст накладывается сверху в любом редакторе — Canva, Figma, Photoshop, да хоть в мобильном приложении.

Это не костыль, а нормальный дизайнерский процесс. Так делается любая коммерческая графика: фотография отдельно, типографика отдельно.

Ключ — попросить у модели фон, спроектированный под текст:

minimal product background for a promo banner, soft gradient from
warm beige to cream, a large empty area in the upper third for
text placement, subtle geometric shapes in the lower right corner,
clean commercial design, no text, no letters, no typography

Три важные детали:

  • a large empty area ... for text placement — модель оставит спокойное место, куда текст ляжет читаемо.
  • no text, no letters, no typography — прямой запрет. Без него модель добавит декоративные псевдобуквы, которые придётся замазывать.
  • Указание, где именно нужно пустое место — иначе получите красивый, но плотно заполненный кадр.

Этот маршрут даёт стопроцентный результат по тексту и полный контроль над шрифтом, кернингом и фирменным стилем. Для карточек маркетплейсов, где инфографика обязана быть читаемой в размере иконки, другого варианта, по сути, нет.

Способ 3. Дорисовать текст поверх генерации моделью-редактором

Промежуточный вариант: сгенерировать изображение, а затем отдельным запросом попросить редактирующую модель добавить надпись в конкретное место.

Работает лучше, чем генерация текста сразу, потому что модель решает одну задачу вместо двух. Но результат всё равно нестабилен и требует проверки. Имеет смысл, когда текст должен лежать на объекте с перспективой и фактурой — надпись на вывеске, на упаковке, на футболке.

Для плоской промо-графики второй способ проще и надёжнее.

Что не получится

  • Длинные тексты. Абзац, состав, описание — забудьте. Только редактор.
  • Мелкий текст. Всё, что меньше примерно двадцатой доли высоты кадра, превратится в шум.
  • Точное соответствие шрифту бренда. Модель нарисует «что-то похожее». Фирменный стиль — только вручную.
  • Гарантированная орфография. Даже удачная генерация может содержать одну неверную букву. Проверяйте каждую.
  • Ё. Отдельная боль: точки живут своей жизнью, съезжают или дублируются.

Практическое правило

Разделите задачи по критичности текста:

Что делаетеКак делать
Инфографика для карточкиФон генерацией, текст в редакторе
Промо-баннер, сторисФон генерацией, текст в редакторе
Вывеска в сцене как элемент антуражаМожно генерацией, читаемость не критична
Надпись на товареТолько редактор или реальное фото
Декоративная псевдонадпись для настроенияГенерация, никого не смутит

Логика простая: если текст должны прочитать — не доверяйте его нейросети.

Коротко

  • Кириллица ломается из-за малой доли русских данных в обучении и потому, что модель рисует буквы, а не набирает их.
  • Разброс между моделями большой, тестируйте под свою задачу — расклад меняется каждые несколько месяцев.
  • Помогают: кавычки вокруг текста, капслок, простой гротеск, явное указание языка, пустое место вокруг.
  • Надёжный маршрут — генерировать фон с запретом no text и накладывать надпись в редакторе.
  • Если текст должны прочитать, нейросеть его не пишет. Это не поражение, а нормальное разделение труда.

Промты для рекламы и промо — фоны и подложки, спроектированные под надпись. Промты для артов и постеров — если текст декоративный и читаемость не критична. Промт по картинке — узнать, как сделан понравившийся кадр, и повторить приём со своим текстом.