Skip to main content
Os modelos de visão podem analisar imagens junto com prompts de texto. Use-os para compreensão de imagens, extração, classificação, resposta a perguntas visuais e raciocínio multimodal. A Venice oferece suporte a mensagens de chat multimodais compatíveis com OpenAI. Coloque blocos de texto e imagem na mesma mensagem do usuário e envie a requisição para um modelo com capacidade de visão.

Uso Básico

Usar Imagens em Base64

Você também pode passar um data URL em base64 quando a imagem for local ou privada:

Escolha um Modelo de Visão

Use a página Modelos de Texto ou a API de Modelos para encontrar modelos que suportam visão. O suporte à visão é listado nas capacidades do modelo.
Para entradas semelhantes a documentos, use Entradas de Arquivo quando desejar que a Venice extraia texto de um arquivo. Use visão quando o layout visual ou o conteúdo da imagem em si importar.

Dicas de Prompt

  • Diga ao modelo em que focar: objetos, texto, layout, segurança, defeitos ou diferenças.
  • Solicite saída estruturada quando sua aplicação precisar de campos que você possa fazer parse.
  • Mantenha as URLs das imagens acessíveis à API ou use data URLs em base64 para imagens privadas.
  • Use um modelo com contexto suficiente se combinar imagens com instruções longas.

Recursos Relacionados