Привет, это Натали Антро и мой новый проект IMG_Story!
Выполнено в рамках магистерской диссертации.
Разработка и оценка алгоритмов компьютерного зрения для автоматизированного повествования на основе последовательностей изображений
Для реализации поставленных задач использован набор данных VIST (Visual Storytelling), который включает более 80 тысяч уникальных фотографий, сгруппированных в более 20 тысяч
последовательностей. Эти данные были нормализованы и предварительно обработаны, чтобы улучшить обучение модели.
Работа основывается на использовании архитектуры Sequence-to-Sequence (Seq2Seq) с применением LSTM. Эта архитектура позволяет эффективно учитывать контекст предыдущих изображений и текстов при генерации повествований. Модель состоит из трех основных компонентов: энкодера текста, энкодера изображений и декодера.
- Преобразование текстовых данных: Текстовые данные преобразуются в числовые векторы с помощью модели GloVe, которая создает 300-мерные векторы слов.
- Обработка последовательностей: Эти векторы затем передаются через несколько слоев LSTM, которые помогают модели запоминать и обрабатывать последовательности слов, учитывая их контекст.
- Извлечение признаков: Изображения обрабатываются с помощью предварительно обученной модели Xception для извлечения важных признаков, таких как формы и текстуры.
- Анализ последовательностей: Извлеченные признаки передаются через несколько слоев LSTM, которые помогают анализировать последовательность изображений, учитывая их взаимосвязь.
- Хранение контекста: Объединенные признаки текста и изображений передаются в ячейку памяти, которая хранит контекст всей последовательности.
- Генерация текста: Декодер использует несколько слоев LSTM для генерации текста, предсказывая следующее слово в предложении на основе контекста.
- Функция активации: Каждый выходной слой LSTM подключен к функции активации Softmax, которая выбирает наиболее вероятное следующее слово.
- Улучшение контекстуальной связности: Работа демонстрирует, что модель, основанная на Seq2Seq с использованием LSTM, превосходит модели с использованием GRU по метрикам METEOR и ROUGE. Это является значительным достижением, так как демонстрирует улучшение качества генерируемых текстов.
- Эффективность модели: Предложенная модель показывает примерно равную производительность по сравнению с более сложными архитектурами, такими как Greedy и AREL, что подтверждает ее эффективность без избыточной сложности.
class WhoAmI:
user = 'NataAntro'
current_adventure = ('URFU Student', 'AI/ML Engineer', 'QA Specialist (BaccaSoft)',
'Metaverse Researcher', 'Digital artist')
passions = [
'Music',
'Snowboarding',
'Reading Pelevins books',
'Gathering many good ideas into one great idea'
]
@independent_method
def home_base():
return 'Moscow_Russia'
@independent_method
def on_agenda():
return ['LearnAIandML', 'CreateStartUp', 'LiveinHappiness']
# Assume 10 more awesome ambitions here ;)




