Skip to content

NataAntro/IMG_Story

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

35 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Привет, это Натали Антро и мой новый проект IMG_Story!

Launch App

Выполнено в рамках магистерской диссертации.

Разработка и оценка алгоритмов компьютерного зрения для автоматизированного повествования на основе последовательностей изображений

Awesome Matrix Code

Набор данных:

Для реализации поставленных задач использован набор данных VIST (Visual Storytelling), который включает более 80 тысяч уникальных фотографий, сгруппированных в более 20 тысяч 
последовательностей. Эти данные были нормализованы и предварительно обработаны, чтобы улучшить обучение модели.

View Dataset

Разработка модели:

Основная архитектура

Работа основывается на использовании архитектуры Sequence-to-Sequence (Seq2Seq) с применением LSTM. Эта архитектура позволяет эффективно учитывать контекст предыдущих изображений и текстов при генерации повествований. Модель состоит из трех основных компонентов: энкодера текста, энкодера изображений и декодера.

Awesome Matrix Code

Энкодер текста

  • Преобразование текстовых данных: Текстовые данные преобразуются в числовые векторы с помощью модели GloVe, которая создает 300-мерные векторы слов.
  • Обработка последовательностей: Эти векторы затем передаются через несколько слоев LSTM, которые помогают модели запоминать и обрабатывать последовательности слов, учитывая их контекст.

Энкодер изображений

  • Извлечение признаков: Изображения обрабатываются с помощью предварительно обученной модели Xception для извлечения важных признаков, таких как формы и текстуры.
  • Анализ последовательностей: Извлеченные признаки передаются через несколько слоев LSTM, которые помогают анализировать последовательность изображений, учитывая их взаимосвязь.

Декодер

  • Хранение контекста: Объединенные признаки текста и изображений передаются в ячейку памяти, которая хранит контекст всей последовательности.
  • Генерация текста: Декодер использует несколько слоев LSTM для генерации текста, предсказывая следующее слово в предложении на основе контекста.
  • Функция активации: Каждый выходной слой LSTM подключен к функции активации Softmax, которая выбирает наиболее вероятное следующее слово.

Typing SVG

Python

Результаты

Основные достижения

  • Улучшение контекстуальной связности: Работа демонстрирует, что модель, основанная на Seq2Seq с использованием LSTM, превосходит модели с использованием GRU по метрикам METEOR и ROUGE. Это является значительным достижением, так как демонстрирует улучшение качества генерируемых текстов.

Awesome Matrix Code

  • Эффективность модели: Предложенная модель показывает примерно равную производительность по сравнению с более сложными архитектурами, такими как Greedy и AREL, что подтверждает ее эффективность без избыточной сложности.

Awesome Matrix Code

 class WhoAmI:
    user = 'NataAntro'
    current_adventure = ('URFU Student', 'AI/ML Engineer', 'QA Specialist (BaccaSoft)', 
			 'Metaverse Researcher', 'Digital artist')
    passions = [
        'Music',
        'Snowboarding',
        'Reading Pelevins books',
        'Gathering many good ideas into one great idea'
    ]

    @independent_method
    def home_base():
        return 'Moscow_Russia'

    @independent_method
    def on_agenda():
        return ['LearnAIandML', 'CreateStartUp', 'LiveinHappiness']
        # Assume 10 more awesome ambitions here  ;)

	

About

Магистерская работа (2024): мультимодальная Seq2Seq-модель для генерации связного повествования по последовательности изображений; Xception, LSTM, VIST, METEOR и ROUGE.

Resources

Stars

Watchers

Forks

Releases

Packages

Used by

Contributors

Languages