O AGENTICO
DeepSeek lança V4 Flash Vision Exp com suporte a imagens
5 fontesdesde 18 de agosto de 202611 artigos
A DeepSeek lançou o DeepSeek-V4-Flash-Vision-Exp, um modelo multimodal experimental que processa imagens e mantém capacidades de texto. A empresa afirma que o desempenho em tarefas de agente rivaliza com o Opus 4.8 da Anthropic, e o modelo supera o concorrente em benchmarks visuais como ALE e ZeroBench. Disponibilizado inicialmente na plataforma paga, ele suporta três formas de envio de imagens: Base64, URLs públicas e a nova API de arquivos gratuita.



Resumo
A DeepSeek lançou o DeepSeek-V4-Flash-Vision-Exp, um modelo experimental multimodal que adiciona processamento de imagens às capacidades de texto.
Isso marca a expansão da DeepSeek para modelos que entendem imagens, competindo diretamente com empresas como a Anthropic.
Segundo a DeepSeek, o desempenho do novo modelo em tarefas de agente fica próximo ao do Opus 4.8, da Anthropic.
Isso posiciona o modelo chinês como um concorrente forte no mercado de IA multimodal.
O modelo mantém as capacidades de texto da versão anterior, incluindo raciocínio lógico e conhecimento geral.
Isso significa que não há perda de desempenho em tarefas de texto ao adicionar a visão.
Os desenvolvedores podem enviar imagens ao modelo usando codificação Base64, URLs públicas ou a nova API de arquivos gratuita.
Essa flexibilidade facilita a integração do modelo em diferentes aplicações.
O modelo superou o Opus 4.8 da Anthropic em dois benchmarks visuais, chamados ALE e ZeroBench.
Embora seja rival em tarefas gerais, ele se destaca especificamente em análise de imagens.
O modelo V4 Flash Vision Exp está inicialmente disponível apenas na plataforma paga da DeepSeek, sem versão gratuita no lançamento.
Isso indica que o acesso ao modelo é restrito a desenvolvedores que pagam pela API, podendo limitar a adoção inicial.
O DeepSeek-V4-Flash-Vision-Exp suporta os formatos JPEG, PNG, GIF e WebP, identificando o formato real do arquivo em vez do nome ou tipo MIME declarado.
Isso mostra a robustez técnica do modelo no tratamento de diferentes tipos de imagem, essencial para uso prático em aplicações visuais.
O modelo é compatível com as APIs de Chat Completions e Responses da OpenAI e com o endpoint Messages da Anthropic, além do lançamento da versão 0.1.1 do framework Harness que o suporta nativamente.
Essa compatibilidade ampla facilita a integração do modelo em sistemas já existentes, aumentando seu potencial de adoção.
Em sete benchmarks de texto comparados com o V4 Flash, o novo modelo superou o antecessor em todos exceto o Cybergym, que avalia vulnerabilidades de software.
Isso mostra que as melhorias de imagem não comprometeram o desempenho textual, exceto em uma área específica de segurança.
O modelo superou o Opus 4.8 da Anthropic em dois benchmarks visuais, ALE e ZeroBench, com mais de 10% de melhoria em dois dos quatro testes visuais realizados pela DeepSeek.
Isso reforça a competitividade do modelo no processamento de imagens, um diferencial importante no mercado de IA multimodal.
Todo dia, só o que dois veículos independentes confirmaram — no seu feed.