Deepseek lança IA multimodal com visão que desafia Opus 4.8 em agentes
A nova ferramenta experimental da Deepseek adiciona capacidade de visão ao seu modelo Flash, mirando tarefas complexas de agentes. Profissionais e empresas ganham mais uma opção robusta para automação visual.
A Deepseek, empresa chinesa de inteligência artificial, liberou o V4-Flash-Vision-Exp. É um modelo multimodal experimental que combina as capacidades de texto do V4-Flash com o entendimento de imagens. Nos testes internos da Deepseek, ele chega perto do Opus 4.8 em tarefas de agentes, e às vezes até o supera. Isso mostra um avanço significativo no campo.
O modelo foi desenhado para fluxos de trabalho com agentes de IA. Ele consegue descrever imagens, extrair texto de capturas de tela e analisar diagramas. Isso abre novas portas para automatizar tarefas que antes exigiam interação visual humana. Para quem desenvolve ou usa agentes, é uma ferramenta a mais para resolver problemas complexos.
O que ele faz na prática?
O V4-Flash-Vision-Exp suporta diversos formatos de imagem, como JPEG, PNG, GIF e WebP. Ele identifica o tipo de arquivo pelo conteúdo real, não só pela extensão. A Deepseek garante que o modelo mantém a performance em raciocínio e conhecimento geral do V4-Flash original, mesmo com a adição da visão.
- Descrever o conteúdo de imagens de forma detalhada.
- Extrair texto e dados de screenshots, documentos e relatórios.
- Analisar diagramas técnicos e fluxogramas para identificar padrões.
- Integrar com frameworks de agentes para automação visual de tarefas.
Como funciona e quanto custa?
O modelo é compatível com as APIs de Chat Completions e Responses da OpenAI, além do endpoint de Messages da Anthropic. Isso facilita a integração para desenvolvedores que já trabalham com essas plataformas. A Deepseek também lançou o framework Harness 0.1.1, que já vem com suporte para este novo modelo.
Para enviar imagens, há três opções. É possível incorporar as imagens diretamente usando Base64, apontar para URLs públicas (até 32 MiB) ou usar a nova API de Arquivos, que é gratuita. Com a API de Arquivos, você sobe o arquivo uma vez e o referencia por ID em várias chamadas, com limite de 64 MiB.
Há um campo "detail" opcional que reduz imagens para 512x512 pixels. Isso economiza tokens quando a precisão visual não é crucial. Imagens são normalizadas automaticamente para cerca de 800x800 pixels antes do processamento. Cada imagem custa no máximo 384 tokens, seguindo os preços do V4-Flash.
É importante lembrar que os benchmarks são internos da Deepseek. Embora promissores, resultados de terceiros ainda precisam confirmar o desempenho comparável ao Opus 4.8. Sendo um modelo experimental, pode haver ajustes e evoluções futuras. Contudo, a flexibilidade de integração e as opções de envio de imagens são pontos positivos.