Компания Google объявила о запуске экспериментальной версии Gemini 2.0 Flash, доступной для разработчиков по всему миру. Эта новая функция позволяет создавать изображения с использованием мультимодальных входных данных, улучшенного рассуждения и понимания естественного языка.
Gemini 2.0 Flash предоставляет пользователям возможность рассказывать истории, которые модель будет иллюстрировать с сохранением последовательности персонажей и окружения. Пользователи также могут давать обратную связь, и модель изменить стиль рисунков или пересказать историю по-новому.
В отличие от многих других моделей генерации изображений, Gemini 2.0 Flash опирается на глобальные знания и усовершенствованные алгоритмы рассуждения для создания реалистичных изображений, что идеально подходит для таких задач, как иллюстрация рецептов. Тем не менее, как и все языковые модели, она не обладает абсолютным знанием.
Внутренние тесты показали, что Gemini 2.0 Flash превосходит аналогичные модели на рынке в точности воспроизведения длинных последовательностей текста, тем самым обеспечивая высокое качество для создания рекламных материалов, социальных публикаций и приглашений.
Пользователи могут начать экспериментировать с Gemini 2.0 Flash через GEMINI API, и компания надеется на активное участие разработчиков в создании новых визуальных решений с использованием этой технологии.
