Компания Microsoft создала технологию на базе искусственного интеллекта, которая способна рисовать изображение на основе текстового описания (например, желтую птичку с черными крыльями и коротким клювом). Согласно исследованию, разработчики почти в 3 раза улучшили рекорд качества получаемых изображений.
В основе бота лежит технология GAN (Generative Adversarial Network). Она содержит две модели машинного обучения, одна из которых генерирует изображения по текстовому описанию, а другая отвечает за оценку их достоверности. Работая вместе, они совершенствуют качество получающихся рисунков. Ученые также разработали специальный алгоритм AttnGAN, который позволяет не обрабатывать предложение целиком, а разбивать его на отдельные слова. За счет этого технология более точно выбирает область для размещения каждой детали изображения.
Помимо того, что содержится в описании, бот способен дорисовывать объекты, которые подходят к композиции по смыслу. К примеру, на большинстве фотографий птицы изображены сидящими на ветвях деревьев. Технология может добавить этот элемент, даже если он не прописан в задании.
Технология преобразования текста в изображения может применяться для помощи дизайнерам и художникам в создании эскизов. По мнению разработчиков, при возможности использования больших вычислительных мощностей, алгоритм сможет также создавать анимационные фильмы по тексту сценария.
Полезные ссылки (на английском языке):
- Скачайте описание AttnGAN
- Узнайте больше о деятельности исследователей искусственного интеллекта из Microsoft на сайте Vision and Language Intelligence
- Познакомьтесь с CaptionBot и Seeing AI
- Прочтите статью Элисон Линн Decades of computer vision research, one ‘Swiss Army knife’