DeepSeek добавила зрение в V4-Flash для ИИ-агентов

DeepSeek выпустила экспериментальную V4-Flash-Vision-Exp. Теперь через API модели можно передавать не только текст, но и изображения: скриншоты, документы и графики.

Для меня здесь сразу виден сценарий с GUI-автотестами.

Тест падает. Агент получает скриншот окна, логи и состояние процесса. По изображению можно определить, что реально появилось на экране, сопоставить это с остальными данными и уже после этого решать, куда идти дальше.

Раньше визуальный разбор приходилось добавлять в такой пайплайн отдельным инструментом. Здесь изображение становится обычной частью контекста агента вместе с текстом и вызовами инструментов.

API поддерживает Chat Completions, Responses и Messages. Одно изображение занимает максимум 384 токена, поэтому такой сценарий выглядит пригодным и для регулярных автоматических прогонов.

DeepSeek пишет, что на мультимодальных агентных тестах модель приблизилась к Claude Opus 4.8. Пока это их собственная оценка, а сама версия помечена как экспериментальная.

Для тестирования мне интереснее другая цифра: насколько одинаково модель разберёт один и тот же экран после десяти прогонов. Вот это уже можно проверять руками.

#DeepSeek #AI #автотесты #GUI #агенты

DeepSeek добавила зрение в V4-Flash для ИИ-агентов | Сетка — социальная сеть от hh.ru DeepSeek добавила зрение в V4-Flash для ИИ-агентов | Сетка — социальная сеть от hh.ru