На пути к науке о данных: От преобразователя набора к пробоотборнику восприятия
•Современные мультимодальные LLM основаны на существующих архитектурах LLM с изменениями для различных источников ввода. •Сложность заключается в преобразовании различных типов данных в единый формат. •Flamingo использует архитектуру на основе декодера и перекрестного внимания. •Проблема с архитектурой на основе перекрестного внимания заключается в преобразовании встраивания видения в уровень перекрестного внимания. •Set Transformer расширил модель Transformer для решения задач, не зависящих от перестановок. •Использует блоки индуцированного заданного внимания (ISAB) для экономии вычислительных затрат. •Модель Perceiver разделяет матрицу запросов на короткие последовательности для изучения скрытых вложений. •Перекрестное внимание заимствовано из декодирующей части оригинального преобразователя. •Flamingo использует предварительно обученную сеть ResNet для извлечения элементов изображения. •Ресэмплер Perceiver изучает скрытое внедрение фиксированного размера перед передачей на уровень перекрестного внимания. •Обучаемые векторы объединяются с векторами ключа/значения для повышения производительности. •Визуальный кодер Flamingo использует ресэмплер Perceiver для минимизации затрат на вычисление перекрестного внимания. •Perceiver минимизирует затраты на вычисление перекрестного внимания, используя информацию из пространственной и временной областей.
Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.