Китайский разработчик систем искусственного интеллекта DeepSeek представил экспериментальную мультимодальную версию своей модели V4-Flash. От базового варианта она отличается способностью обрабатывать в качестве запросов не только текст, но и изображения.
Источник изображения: Solen Feyissa / unsplash.com
Экспериментальная модель DeepSeek V4-Flash-Vision-Exp умеет анализировать изображения, скриншоты и прочие визуальные запросы наряду с текстовыми, сохраняя при этом существующие возможности, в том числе функции работы с текстом, навыки логических рассуждений, применение знаний об окружающем мире и управление автономными ИИ-агентами.
Источник изображения: x.com/deepseek_ai
«В тестах для мультимодальных агентов V4-Flash-Vision-Exp демонстрирует значительный прогресс по сравнению с [базовой] V4-Flash, поднимая производительность мультимодальных агентов на уровень, близкий к Opus-4.8», — заявили в компании. Дополнительно вышел инструмент DeepSeek Harness 0.1.1, который поддерживает новую модель «из коробки».
Обновлённая модель уже доступна через API DeepSeek. При тарификации изображения преобразуются в токены (до 384 токенов на каждое) и идут по расценкам базовой модели DeepSeek V4-Flash.
Источники:


MWC 2018
2018
Computex
IFA 2018






