VIDEMIND
AI & Design AI-инструменты для дизайнера

Почему машинная генерация плохо справляется с типографикой

Текст внутри сгенерированных изображений остаётся слабым местом. Разбираем причину и то, что это говорит о природе таких инструментов.

Абстрактная графика VIDEMIND: горизонтальные слои разной плотности, часть в тонкую полоску
VIDEMIND
Содержание · 9
  1. Буквы — не текстура
  2. Кириллица страдает сильнее
  3. Что это говорит об инструментах
  4. Практический вывод
  5. Почему это не чинится увеличением модели
  6. Как встроить генерацию в работу с текстом
  7. Что именно ломается в наборе
  8. Где инструмент всё же полезен
  9. Что в итоге

Текст внутри сгенерированных изображений остаётся слабым местом. Разбираем причину и то, что это говорит о природе таких инструментов.

Буквы — не текстура

Модели, работающие с изображениями, оперируют визуальными закономерностями. Для них буква — набор форм, похожих на другие формы, а не знак с точным контуром, который либо верен, либо нет.

Небольшое отклонение в текстуре дерева незаметно; такое же отклонение в букве превращает её в другую букву или в бессмыслицу.

Кириллица страдает сильнее

Латиница представлена в обучающих данных в разы шире, поэтому её формы воспроизводятся заметно лучше. Кириллические знаки часто получаются как гибриды: латинские формы с добавленными элементами.

Особенно страдают знаки, не имеющие латинских аналогов: «ж», «щ», «ы», «ъ», «э», «ю».

Типичные искажения кириллических знаков в генеративных изображениях
Типичные искажения кириллических знаков в генеративных изображенияхVIDEMIND

Что это говорит об инструментах

Слабость в типографике — хороший индикатор общего свойства: генеративные модели сильны там, где допустима вариативность, и слабы там, где требуется точность.

Это распространяется на все задачи: технические чертежи, схемы, интерфейсы с реальными данными, точное воспроизведение объектов.

ЗадачаТребуетсяПригодность генерации
Текстура, фонПравдоподобиеВысокая
Атмосферный образНастроениеВысокая
ТипографикаТочностьНизкая
Схема, чертёжТочностьНизкая
ЛоготипТочность и уникальностьНизкая
Абстрактная графика VIDEMIND: плавные волнистые линии
VIDEMIND

Практический вывод

Рабочий подход — разделять слои: изображение генерируется, типографика набирается поверх обычным способом в редакторе.

Это даёт и качество набора, и возможность редактировать текст, и корректную работу с фирменными гарнитурами.

  • Генерировать изображение без текста.
  • Набирать типографику в редакторе поверх.
  • Никогда не оставлять сгенерированные буквы в финале.
  • Проверять, не появился ли текст случайно на фоне.
Модель рисует не буквы, а то, что на буквы похоже. Разницу видно сразу, и она объясняет природу инструмента лучше любого описания.

Почему это не чинится увеличением модели

Обычное объяснение — «модели ещё не доучились» — предполагает, что буквы просто сложный узор, и с ростом обучающей выборки он выучится. Но письменность устроена иначе, чем текстура: значение здесь дискретное. Кирпичная кладка, где один кирпич смещён, остаётся кладкой; слово, где одна буква смещена или подменена, перестаёт быть словом. Модель, обученная на правдоподобии картинки, оптимизирует то, что выглядит похоже, а не то, что читается.

Отсюда практическое следствие: даже когда отдельные слова получаются, набор целиком остаётся ненадёжным. Ошибка не убывает плавно с размером модели — она перескакивает между «читается» и «не читается», и предсказать, на каком слове это произойдёт, нельзя. Поэтому в рабочем процессе генерация используется для изображения, а текст ставится сверху обычными средствами вёрстки — не из осторожности, а потому что это единственный способ гарантировать результат.

Как встроить генерацию в работу с текстом

  • Генерировать фон и предметную часть, а весь набор ставить слоем поверх в редакторе — тогда шрифт, кернинг и переносы остаются под контролем.
  • Если текст всё же в кадре, оставлять его крупным и коротким: одно-два слова модель держит заметно надёжнее строки.
  • Проверять кириллицу отдельно: у большинства моделей латиница выходит лучше просто потому, что её было больше в обучении.
  • Не принимать «почти правильное» слово: читатель заметит подмену буквы быстрее, чем любой недостаток картинки.
  • Для макета с реальными данными — цены, сроки, состав — генерация не годится в принципе: ошибка здесь стоит дороже экономии времени.
Абстрактная графика VIDEMIND: горизонтальные слои разной плотности, часть в тонкую полоску — к разделу «Как встроить генерацию в работу с текстом»
VIDEMIND

Что именно ломается в наборе

Ошибки машинной генерации в типографике распределены неравномерно. Форма отдельного знака воспроизводится неплохо — модели видели миллионы букв. Разрушается то, что не является формой: межбуквенные расстояния, кернинг проблемных пар, единство начертания внутри строки и оптическая компенсация. Именно эти вещи составляют профессиональную работу и именно они не выводятся из внешнего сходства.

Поэтому сгенерированная надпись почти всегда выглядит убедительно на скриншоте и разваливается при внимательном взгляде: буквы правильные, набор — нет.

Где инструмент всё же полезен

Общее у этих задач одно: результат проверяется мгновенно и стоит дёшево. Как только проверка становится дороже создания, инструмент перестаёт экономить время — и типографика попадает в эту категорию раньше почти всего остального.

  • Поиск направления: десятки вариантов настроения надписи до того, как выбрана гарнитура.
  • Заполнение макета осмысленно выглядящим текстом на этапе обсуждения композиции.
  • Векторизация и очистка растровых образцов исторических шрифтов.
  • Подбор пар: модель неплохо предлагает кандидатов, отбор остаётся за человеком.
Абстрактная графика VIDEMIND: горизонтальные слои разной плотности, часть в тонкую полоску — к разделу «Где инструмент всё же полезен»
VIDEMIND

Что в итоге

Типографика требует точности, а генерация вероятностна — отсюда устойчивая слабость в буквах, особенно кириллических.

Разделяйте слои: изображение генерируйте, текст набирайте. Это правило снимает большинство проблем.

Коротко

Почему на сгенерированных картинках нерабочий текст?
Потому что модель воспроизводит форму знаков как изображение, а не набирает текст шрифтом. Практическое следствие: любой текст в макете ставится отдельно, гарнитурой, поверх изображения.
Можно ли так рисовать шрифт?
Для поиска формы — да, для готовой гарнитуры — нет: шрифт это система метрик, кернинга и начертаний, а не набор картинок. Отрисовка знаков — меньшая часть работы над гарнитурой.
Продолжить тему · AI-инструменты для дизайнера

AI-инструменты в дизайне

Без восторгов и без отрицания. Разбираем задачи, где машинные инструменты дают измеримый выигрыш, и те, где создают больше работы, чем экономят.Дальше

Нашли ошибку или неточность в атрибуции? Напишите нам

Обсуждение

Загружаем…

Только имя и мысль. Ссылки, разметку, код и номера телефонов журнал не публикует — учётных записей на сайте нет, и оставлять здесь ссылку бессмысленно.

0 / 1500