← Portal SSTFLIX👁️ Modelos, Visão

Deepseek lança IA multimodal com visão que desafia Opus 4.8 em agentes

A nova ferramenta experimental da Deepseek adiciona capacidade de visão ao seu modelo Flash, mirando tarefas complexas de agentes. Profissionais e empresas ganham mais uma opção robusta para automação visual.

Redação SSTFLIXPortal SSTFLIX.AI
3 min de leituraRedigida por IA · revisão editorial
Deepseek lança IA multimodal com visão que desafia Opus 4.8 em agentes

A Deepseek, empresa chinesa de inteligência artificial, liberou o V4-Flash-Vision-Exp. É um modelo multimodal experimental que combina as capacidades de texto do V4-Flash com o entendimento de imagens. Nos testes internos da Deepseek, ele chega perto do Opus 4.8 em tarefas de agentes, e às vezes até o supera. Isso mostra um avanço significativo no campo.

O modelo foi desenhado para fluxos de trabalho com agentes de IA. Ele consegue descrever imagens, extrair texto de capturas de tela e analisar diagramas. Isso abre novas portas para automatizar tarefas que antes exigiam interação visual humana. Para quem desenvolve ou usa agentes, é uma ferramenta a mais para resolver problemas complexos.

O que ele faz na prática?

O V4-Flash-Vision-Exp suporta diversos formatos de imagem, como JPEG, PNG, GIF e WebP. Ele identifica o tipo de arquivo pelo conteúdo real, não só pela extensão. A Deepseek garante que o modelo mantém a performance em raciocínio e conhecimento geral do V4-Flash original, mesmo com a adição da visão.

  • Descrever o conteúdo de imagens de forma detalhada.
  • Extrair texto e dados de screenshots, documentos e relatórios.
  • Analisar diagramas técnicos e fluxogramas para identificar padrões.
  • Integrar com frameworks de agentes para automação visual de tarefas.

Como funciona e quanto custa?

O modelo é compatível com as APIs de Chat Completions e Responses da OpenAI, além do endpoint de Messages da Anthropic. Isso facilita a integração para desenvolvedores que já trabalham com essas plataformas. A Deepseek também lançou o framework Harness 0.1.1, que já vem com suporte para este novo modelo.

Para enviar imagens, há três opções. É possível incorporar as imagens diretamente usando Base64, apontar para URLs públicas (até 32 MiB) ou usar a nova API de Arquivos, que é gratuita. Com a API de Arquivos, você sobe o arquivo uma vez e o referencia por ID em várias chamadas, com limite de 64 MiB.

Há um campo "detail" opcional que reduz imagens para 512x512 pixels. Isso economiza tokens quando a precisão visual não é crucial. Imagens são normalizadas automaticamente para cerca de 800x800 pixels antes do processamento. Cada imagem custa no máximo 384 tokens, seguindo os preços do V4-Flash.

É importante lembrar que os benchmarks são internos da Deepseek. Embora promissores, resultados de terceiros ainda precisam confirmar o desempenho comparável ao Opus 4.8. Sendo um modelo experimental, pode haver ajustes e evoluções futuras. Contudo, a flexibilidade de integração e as opções de envio de imagens são pontos positivos.

#ia multimodal#deepseek#agentes ia#visao computacional#benchmarks

Continue lendo