Skip to main content
Vision-Modelle können Bilder zusammen mit Textprompts analysieren. Verwende sie für Bildverständnis, Extraktion, Klassifikation, visuelle Fragebeantwortung und multimodales Reasoning. Venice unterstützt OpenAI-kompatible multimodale Chat-Nachrichten. Füge Text- und Bildblöcke in dieselbe Benutzernachricht ein und sende die Anfrage anschließend an ein vision-fähiges Modell.

Grundlegende Nutzung

Base64-Bilder verwenden

Du kannst auch eine Base64-Data-URL übergeben, wenn das Bild lokal oder privat ist:

Ein Vision-Modell auswählen

Nutze die Seite Textmodelle oder die Models-API, um Modelle zu finden, die Vision unterstützen. Die Vision-Unterstützung ist in den Modellfähigkeiten aufgeführt.
Verwende bei dokumentähnlichen Eingaben Datei-Eingaben, wenn Venice Text aus einer Datei extrahieren soll. Verwende Vision, wenn das visuelle Layout oder der Bildinhalt selbst wichtig ist.

Prompt-Tipps

  • Sag dem Modell, worauf es sich konzentrieren soll: Objekte, Text, Layout, Sicherheit, Defekte oder Unterschiede.
  • Verlange strukturierte Ausgaben, wenn deine Anwendung Felder benötigt, die du parsen kannst.
  • Achte darauf, dass Bild-URLs für die API zugänglich sind, oder verwende Base64-Data-URLs für private Bilder.
  • Verwende ein Modell mit ausreichend Kontext, wenn du Bilder mit langen Anweisungen kombinierst.

Verwandte Ressourcen