Перейти к содержимому
IMOEX 2 134,97 0.6%
·Технологии·22 августа 2026 г.·2 мин

DeepSeek добавила зрение в модель V4-Flash: новая модель нацелилась на уровень Claude в AI-агентах

DeepSeek добавила зрение в модель V4-Flash: новая модель нацелилась на уровень Claude в AI-агентах

Экспериментальная версия V4-Flash-Vision-Exp умеет работать с текстом и изображениями в одном запросе, а в опубликованных DeepSeek тестах приблизилась к Anthropic Opus 4.8

DeepSeek 21 августа представила экспериментальную версию V4-Flash-Vision-Exp — мультимодальную модель, которая добавляет анализ изображений к возможностям линейки V4-Flash. Модель доступна через API и рассчитана прежде всего на ИИ-агентов, которым необходимо одновременно работать с текстом и визуальной информацией: скриншотами, графиками, документами и интерфейсами.

По данным DeepSeek, новинка сохраняет возможности V4-Flash в работе с агентами, рассуждениями и общими знаниями, но теперь может учитывать изображения непосредственно в процессе выполнения задачи. В опубликованных компанией тестах модель получила 83,9 балла в Terminal Bench 2.1, 57,7 в NL2Repo, 59,3 в DeepSWE, 63,6 в DSBench-Hard и 64,3 в Chartography. DeepSeek заявляет, что по совокупности результатов модель приблизилась к Anthropic Opus 4.8.

При этом сравнение не означает безусловного превосходства DeepSeek. Согласно опубликованной таблице, новая модель обошла Opus 4.8 в трёх из 11 тестов, включая DeepSWE, Agents' Last Exam и ZeroBench, но уступила в остальных. Разрыв особенно заметен в некоторых задачах: например, в NL2Repo разница составила 12 баллов, а в DSBench-Hard — 8,1 балла. Кроме того, результаты являются опубликованными самими разработчиками и зависят от конфигурации тестов, инструментов и настроек запуска.

Практически важным дополнением стал Files API. Изображение можно передать модели через Base64, внешнюю ссылку или загрузить один раз в API и затем обращаться к нему по 'file_id'. DeepSeek заявляет, что Files API предоставляется бесплатно, а изображения учитываются при тарификации V4-Flash — до 384 токенов на изображение.

Одновременно компания выпустила DeepSeek Harness 0.1.1 с поддержкой новой модели.

Для разработчиков главное изменение заключается в том, что визуальное восприятие теперь можно встроить непосредственно в тот же агентский сценарий, где модель рассуждает и вызывает инструменты. Это открывает более практичные сценарии для работы, однако V4-Flash-Vision-Exp остаётся экспериментальной моделью, поэтому её надёжность в конкретных задачах ещё предстоит проверять отдельно.

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

iXBT