Sábado, 29 de agosto de 2026

O AGENTICO

o futuro da IA, todo dia, num clique

Voltarver como story →

DeepSeek lança V4 Flash Vision Exp com suporte a imagens

5 fontesdesde 18 de agosto de 202611 artigos

A DeepSeek lançou o DeepSeek-V4-Flash-Vision-Exp, um modelo multimodal experimental que processa imagens e mantém capacidades de texto. A empresa afirma que o desempenho em tarefas de agente rivaliza com o Opus 4.8 da Anthropic, e o modelo supera o concorrente em benchmarks visuais como ALE e ZeroBench. Disponibilizado inicialmente na plataforma paga, ele suporta três formas de envio de imagens: Base64, URLs públicas e a nova API de arquivos gratuita.

Resumo

  • A DeepSeek lançou o DeepSeek-V4-Flash-Vision-Exp, um modelo experimental multimodal que adiciona processamento de imagens às capacidades de texto.

    Isso marca a expansão da DeepSeek para modelos que entendem imagens, competindo diretamente com empresas como a Anthropic.

  • Segundo a DeepSeek, o desempenho do novo modelo em tarefas de agente fica próximo ao do Opus 4.8, da Anthropic.

    Isso posiciona o modelo chinês como um concorrente forte no mercado de IA multimodal.

  • O modelo mantém as capacidades de texto da versão anterior, incluindo raciocínio lógico e conhecimento geral.

    Isso significa que não há perda de desempenho em tarefas de texto ao adicionar a visão.

  • Os desenvolvedores podem enviar imagens ao modelo usando codificação Base64, URLs públicas ou a nova API de arquivos gratuita.

    Essa flexibilidade facilita a integração do modelo em diferentes aplicações.

  • O modelo superou o Opus 4.8 da Anthropic em dois benchmarks visuais, chamados ALE e ZeroBench.

    Embora seja rival em tarefas gerais, ele se destaca especificamente em análise de imagens.

  • O modelo V4 Flash Vision Exp está inicialmente disponível apenas na plataforma paga da DeepSeek, sem versão gratuita no lançamento.

    Isso indica que o acesso ao modelo é restrito a desenvolvedores que pagam pela API, podendo limitar a adoção inicial.

  • O DeepSeek-V4-Flash-Vision-Exp suporta os formatos JPEG, PNG, GIF e WebP, identificando o formato real do arquivo em vez do nome ou tipo MIME declarado.

    Isso mostra a robustez técnica do modelo no tratamento de diferentes tipos de imagem, essencial para uso prático em aplicações visuais.

  • O modelo é compatível com as APIs de Chat Completions e Responses da OpenAI e com o endpoint Messages da Anthropic, além do lançamento da versão 0.1.1 do framework Harness que o suporta nativamente.

    Essa compatibilidade ampla facilita a integração do modelo em sistemas já existentes, aumentando seu potencial de adoção.

  • Em sete benchmarks de texto comparados com o V4 Flash, o novo modelo superou o antecessor em todos exceto o Cybergym, que avalia vulnerabilidades de software.

    Isso mostra que as melhorias de imagem não comprometeram o desempenho textual, exceto em uma área específica de segurança.

  • O modelo superou o Opus 4.8 da Anthropic em dois benchmarks visuais, ALE e ZeroBench, com mais de 10% de melhoria em dois dos quatro testes visuais realizados pela DeepSeek.

    Isso reforça a competitividade do modelo no processamento de imagens, um diferencial importante no mercado de IA multimodal.

Todo dia, só o que dois veículos independentes confirmaram — no seu feed.

Siga @oagentico →