VLM Survey

Использование мультимодальных подходов, в первую очередь изображения плюс текст, все активнее становится ключевой киллер фичей при разработке general моделей. Недавно еще крышесносные LLM-чаты уже не воспринимаются как полноценные решения, если в них нет поддержки изображений. Я планирую сделать серию постов про VLM (vision-language models) и начать я бы хотел с технического обзора статей, обеспеченных мировым сообществом к сегодняшнему дню. Если вы специалист в ML и хотите разобраться в том, что понаписали про VLM, я отоборал вам самую мякотку, одна статья, чтобы зайти в новую сферу. Чтобы не писать один огромный пост - все красиво оформил тут: https://telegra.ph/VLM-Survey-02-27. Заходите и оценивайте!

Еще больше интересных и полезных постов в моем tg-канале: https://t.me/lechim_ai