Рубрики
МЕНЮ
Виталий Войчук
Программный бот использует так называемую технологию GAN — Generative Adversarial Network, сообщает "3Dnews".
Она содержит две модели машинного обучения, одна из которых генерирует изображения по текстовому описанию, а другая отвечает за оценку их достоверности.
Учёные разработали специальный алгоритм AttnGAN, который позволяет не обрабатывать предложение целиком, а разбивать его на отдельные слова. За счёт этого технология более точно выбирает область для размещения каждой детали изображения.
В качестве примера Microsoft приводит создание изображения птицы. В текстовом описании сказано лишь, что она имеет оперение жёлтого цвета, чёрные крылья и короткий клюв.
Система способна дорисовывать объекты, которые подходят к композиции по смыслу. На большинстве фотографий птицы изображены сидящими на ветвях деревьев. Технология может добавить этот элемент, даже если он не прописан в задании.
Технология преобразования текста в изображения может применяться для помощи дизайнерам и художникам в создании эскизов. По мнению разработчиков, при возможности использования больших вычислительных мощностей, алгоритм сможет также создавать анимационные фильмы по тексту сценария.
Фото: "3Dnews"
Обсуждения
Новости партнеров
Новости