DeepSeek представила мультимодальную модель, приблизившуюся к Claude Opus 4.8
Она создана на базе V4 Flash, но получила поддержку изображений.

DeepSeek представила экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp. Она построена на базе V4 Flash, но дополнительно умеет работать с изображениями: распознавать содержимое фотографий и скриншотов, анализировать графики и учитывать визуальные данные при выполнении задач.
По оценке самой DeepSeek, текстовые возможности модели, включая рассуждение, знания и работу в агентных сценариях, находятся примерно на уровне V4 Flash.
В тестах, где ИИ-агенту необходимо одновременно анализировать визуальную информацию и выполнять действия, DeepSeek-V4-Flash-Vision-Exp показала результат, близкий к Claude Opus 4.8 от Anthropic. При этом независимого подтверждения этих результатов пока нет.
Claude Opus 4.8 вышла в конце мая 2026 года. Anthropic позиционирует ее как наиболее производительную общедоступную модель компании. Она предназначена для программирования, работы ИИ-агентов, сложных рассуждений и профессиональных задач.
DeepSeek-V4-Flash-Vision-Exp уже доступна через API компании. Контекстное окно модели составляет 1 млн токенов, а максимальный размер ответа — 384 тыс. токенов.
Изображения при обработке преобразуются в токены и оплачиваются по тем же тарифам, что и запросы к V4 Flash. На одну картинку приходится не более 384 токенов.
Модель поддерживает смешанные запросы, состоящие одновременно из текста и изображений. Загружать картинки можно напрямую, по ссылке или через Files API.
Для DeepSeek мультимодальные модели не являются новым направлением. Ранее компания развивала семейство визуально-языковых моделей DeepSeek-VL. Однако новая версия впервые добавляет работу с изображениями непосредственно в актуальную линейку V4 Flash, расширяя ее возможности для агентных сценариев.
Ранее DeepSeek также представила официальную версию языковой модели DeepSeek V4 Pro. Она доступна в веб-версии сервиса, приложении и через API.
Развитие мультимодальных моделей постепенно расширяет набор задач, которые бизнес может передавать ИИ, от анализа текста до работы с визуальными материалами и автоматизации отдельных процессов. В маркетинге похожая тенденция касается и операционной части: в Vitamin.tools можно объединить работу с рекламными бюджетами разных площадок, документами и другими сопутствующими задачами в одном сервисе.
В чате с Алисой AI появились ИИ-персонажи Статья
Законопроект «Об искусственном интеллекте в РФ»: модели могут разделить на суверенные и национальные Статья
OpenAI представит «суперприложение» с обновлённым ChatGPT Статья
5 фраз из-за которых администраторы клиники косметологии теряют до 40% запись каждый месяц Статья
Потолок стоимости пациента: метрика, без которой реклама клиники косметологии превращается в лотерею Статья
YouTube предложит авторам контента миллионы долларов за отказ от сотрудничества с Netflix Статья
Яндекс тестирует покупательские сценарии в видеорекламе на Connected TV Статья
«RWB Медиа» добавила новые возможности таргетинга для селлеров Wildberries Статья
В российских магазинах с 1 сентября появится единый QR-код для оплаты Статья





