DeepSeek добавила зрение в V4-Flash для ИИ-агентов
DeepSeek выпустила экспериментальную V4-Flash-Vision-Exp. Теперь через API модели можно передавать не только текст, но и изображения: скриншоты, документы и графики.
Для меня здесь сразу виден сценарий с GUI-автотестами.
Тест падает. Агент получает скриншот окна, логи и состояние процесса. По изображению можно определить, что реально появилось на экране, сопоставить это с остальными данными и уже после этого решать, куда идти дальше.
Раньше визуальный разбор приходилось добавлять в такой пайплайн отдельным инструментом. Здесь изображение становится обычной частью контекста агента вместе с текстом и вызовами инструментов.
API поддерживает Chat Completions, Responses и Messages. Одно изображение занимает максимум 384 токена, поэтому такой сценарий выглядит пригодным и для регулярных автоматических прогонов.
DeepSeek пишет, что на мультимодальных агентных тестах модель приблизилась к Claude Opus 4.8. Пока это их собственная оценка, а сама версия помечена как экспериментальная.
Для тестирования мне интереснее другая цифра: насколько одинаково модель разберёт один и тот же экран после десяти прогонов. Вот это уже можно проверять руками.