DeepSeek-V4-Flash-Vision-Exp: Експериментален визуално-мултимодален модел за автономни агенти

Публикувано от Svetni.me Editorial на 22 август 2026 г.

DeepSeek V4 Flash Vision Experimental hero image
Изображение: Svetni.me / ИИ генерирано изображение

Китайската технологична компания DeepSeek пусна новия си експериментален мултимодален модел DeepSeek-V4-Flash-Vision-Exp [1]. Разработката разширява стандартния DeepSeek-V4-Flash, като добавя разбиране на изображения, без да компрометира представянето на текстовия модел при логическо мислене и общи знания. В официалните тестове на компанията новият визуален вариант се доближава или дори надминава възможностите на водещия модел Claude Opus 4.8 при изпълнение на задачи за автономни агенти [2].

Моделът е проектиран с фокус върху визуалните агентни работни процеси и може директно да описва картинки, да извлича текст от екранни снимки (OCR) и да анализира сложни технически диаграми. DeepSeek-V4-Flash-Vision-Exp поддържа широк набор от файлови формати, включително JPEG, PNG, GIF и WebP, като разпознава формата на базата на реалното съдържание на файла, а не от неговото разширение [1].

Инфографика за спецификациите на DeepSeek-V4-Flash-Vision-Exp
Изображение: Svetni.me / ИИ генерирана инфографика

Архитектура, интеграция и инструменти

Новият модел е съвместим от самото начало с популярните софтуерни приложно-програмни интерфейси на пазара. Той може лесно да се внедри в проекти, използващи Chat Completions и Responses на OpenAI, както и Messages на Anthropic [1]. Заедно с модела разработчиците получиха и обновена версия 0.1.1 на собствената отворена рамка на компанията DeepSeek Harness, която поддържа новия визуален модел без допълнителни модификации [2].

Лимити за изображения и Files API

DeepSeek-V4-Flash-Vision-Exp поддържа три метода за изпращане на изображения: директно Base64 кодиране, връзки към публични адреси (до 32 MiB) или чрез безплатния файлов интерфейс Files API [3]. Чрез Files API разработчиците могат да качат изображения с големина до 64 MiB и да ги реферират по идентификатор (ID) в множество последващие заявки.

Моделът позволява обработка на до 600 изображения в рамките на една заявка. Максималният размер на страната на изображението е 8192 пиксела, като този лимит пада на 4096 пиксела, ако заявката съдържа 15 или повече изображения [1]. Допълнителният параметър "detail" позволява на разработчиците да намалят мащаба на изображенията до 512 × 512 пиксела, за да спестят токени, когато не са необходими визуални детайли. Независимо от оригиналната резолюция, всяко изображение се таксува с максимално 384 токена [1].

Ценоразпис и икономическа ефективност

Ценообразуването на DeepSeek-V4-Flash-Vision-Exp съвпада с това на базовия Flash модел, който се конкурира с нива на производителност от ранга на GPT-5 (съпоставим с GPT-5.6 Luna), но на значително по-ниска цена. В часовете с ниско натоварване (off-peak) входните токени без кеш струват $0.22 на 1 милион токена, а изходните – $0.66 на милион. По време на пиковите часове (peak) цените са съответно $0.44 за вход и $1.32 за изход [2]. Тези цени правят модела изключително икономичен вариант за мащабни корпоративни системи с визуални агенти.

Източници:

[1]: DeepSeek Vision API Guide - DeepSeek API Docs
[2]: DeepSeek AI Official Announcement - X/Twitter
[3]: DeepSeek Files API Guide - DeepSeek API Docs
[4]: DeepSeek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks - The Decoder