DeepSeek представила мультимодальную модель, приблизившуюся к Claude Opus 4.8
Она создана на базе V4 Flash, но получила поддержку изображений.

DeepSeek представила экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp. Она построена на базе V4 Flash, но дополнительно умеет работать с изображениями: распознавать содержимое фотографий и скриншотов, анализировать графики и учитывать визуальные данные при выполнении задач.
По оценке самой DeepSeek, текстовые возможности модели, включая рассуждение, знания и работу в агентных сценариях, находятся примерно на уровне V4 Flash.
В тестах, где ИИ-агенту необходимо одновременно анализировать визуальную информацию и выполнять действия, DeepSeek-V4-Flash-Vision-Exp показала результат, близкий к Claude Opus 4.8 от Anthropic. При этом независимого подтверждения этих результатов пока нет.
Claude Opus 4.8 вышла в конце мая 2026 года. Anthropic позиционирует ее как наиболее производительную общедоступную модель компании. Она предназначена для программирования, работы ИИ-агентов, сложных рассуждений и профессиональных задач.
DeepSeek-V4-Flash-Vision-Exp уже доступна через API компании. Контекстное окно модели составляет 1 млн токенов, а максимальный размер ответа — 384 тыс. токенов.
Изображения при обработке преобразуются в токены и оплачиваются по тем же тарифам, что и запросы к V4 Flash. На одну картинку приходится не более 384 токенов.
Модель поддерживает смешанные запросы, состоящие одновременно из текста и изображений. Загружать картинки можно напрямую, по ссылке или через Files API.
Для DeepSeek мультимодальные модели не являются новым направлением. Ранее компания развивала семейство визуально-языковых моделей DeepSeek-VL. Однако новая версия впервые добавляет работу с изображениями непосредственно в актуальную линейку V4 Flash, расширяя ее возможности для агентных сценариев.
Ранее DeepSeek также представила официальную версию языковой модели DeepSeek V4 Pro. Она доступна в веб-версии сервиса, приложении и через API.
Развитие мультимодальных моделей постепенно расширяет набор задач, которые бизнес может передавать ИИ, от анализа текста до работы с визуальными материалами и автоматизации отдельных процессов. В маркетинге похожая тенденция касается и операционной части: в Vitamin.tools можно объединить работу с рекламными бюджетами разных площадок, документами и другими сопутствующими задачами в одном сервисе.
Использование нейросетей при разработке лендинга Статья
Почти половина российских пользователей совершала покупки по рекомендациям ИИ Статья
Сбер представил новую флагманскую модель – GigaChat 3.5 Ultra с ускоренной генерацией Статья
Как клинике косметологии собрать оффер, против которого скидка конкурентов бессильна? Статья
Как клиника косметологии теряет миллионы на ушедших пациентах и почему дело не в рекламе Статья
Мобильное приложение как канал удержания: что работает Статья
Учёные предупредили о риске снижения когнитивных навыков из-за ИИ Статья
В Минцифры сообщили о запуске сетей 5G в России Статья
В ChatGPT нашли уязвимость, позволявшую получать данные из Gmail Статья





