👁️ DeepSeek добавила своим моделям глаза — и сразу полезла в агенты DeepSeek выпустила экспериментальную DeepSeek-V4-Flash-Vision-Exp — мультимодальную версию V4 Flash, которая принимает не только текст, но и изображения. Модель уже доступна через API: ей можно отдавать фотографии, скриншоты, документы и графики. Но обычное «теперь умеет смотреть на картинки» здесь не самая интересная часть. DeepSeek явно целится в визуальных агентов — системы, которые должны понимать интерфейс или окружающую сцену и затем что-то делать с увиденным. Компания утверждает, что на соответствующих тестах экспериментальная версия заметно обошла обычную V4 Flash и приблизилась к Anthropic Opus 4.8 К последней цифре стоит относиться спокойно: это собственные результаты DeepSeek, а не независимое сравнение. Кроме того, модель пока прямо обозначена как экспериментальная. Зато направление видно очень хорошо. Следующая конкуренция больших моделей всё меньше похожа на соревнование «кто лучше продолжает текст». Ценность постепенно смещается к системам, которые видят интерфейс, понимают происходящее и могут сами выполнить последовательность действий. И DeepSeek теперь явно хочет участвовать именно в этой гонке.