Hero Image full

Multimodal AI

7 min read
Content

Wat is Multimodal AI?

Multimodal AI verwijst naar modellen die meer dan één type input accepteren en erover redeneren, zoals tekst, beelden, audio, en video, binnen één systeem. Voor softwareteams is het de capaciteit die een agent een screenshot laat lezen, een diagram interpreteren, of een schermopname bekijken in plaats van alleen vanuit tekst te werken. De capaciteit arriveerde met kracht: GPT-4, een groot multimodaal model dat beeld- en tekstinput accepteert, scoorde rond de top 10% van kandidaten op een gesimuleerd bar-exam in 2023 [1].

De belangrijkste punten

  • Moderne frontier-modellen zijn standaard multimodaal. Visuele input is nu een basisvereiste; audio- en video-ondersteuning varieert per aanbieder.
  • Beelden worden gefactureerd als tokens, en een grote screenshot kan meer kosten dan een pagina tekst, dus hebben beeldzware agentlussen kostenaandacht nodig.
  • Multimodale input is wat computer-use-agents mogelijk maakt: het model ziet pixels, niet alleen de DOM of accessibility-tree.
  • Nauwkeurigheid op visuele input loopt nog achter op tekst. Modellen lezen kleine lettertypes, dichte tabellen, en precieze coördinaten vaker verkeerd dan ze proza verkeerd lezen.

Hoe het werkt

Een multimodaal model zet elk inputtype om naar dezelfde interne representatie. Tekst wordt tokens via een tokenizer. Een beeld gaat door een vision-encoder die het in patches snijdt en elke patch omzet in embeddings die in dezelfde ruimte zitten als tekstembeddings. Audio krijgt een vergelijkbare behandeling via zijn eigen encoder. Zodra alles embedded is, verwerkt de transformer de gemengde sequentie precies zoals hij dat met gewone tekst zou doen, en geeft vrij aandacht over modaliteiten heen. Daarom kun je een screenshot plakken en er in hetzelfde bericht een vraag over stellen: voor het model zijn beide gewoon posities in één sequentie die hetzelfde contextvenster bezetten. Die vensters zijn groot geworden; Googles Gemini 1.5 Pro verwerkt multimodale input over een standaardcontext van 128.000 tokens, met tot 1 miljoen tokens beschikbaar in preview per februari 2024 [2].

De engineeringgevolgen volgen uit dat ontwerp. Beelden verbruiken tokens gebaseerd op hun resolutie, dus documenteren aanbieders per-beeld-tokenformules, en een naïeve agent die elke stap van een browsersessie screenshot, kan stilletjes zijn rekening vermenigvuldigen. Latentie stijgt ook, want het coderen van grote beelden voegt verwerking toe voor het eerste outputtoken. Output is een ander verhaal: de meeste productiemodellen genereren tekst (en soms beelden via een aparte head of model), dus betekent "multimodaal" meestal multimodale input met tekstoutput. Wanneer een AI-coding-agent een CSS-bug fixt vanuit een screenshot, gaat het beeld erin, en komt er een tekstdiff uit.

Voorbeeld

Een team dat een intern dashboard bouwt, bedraadt visuele checks in hun agentworkflow. Nadat de agent een UI-wijziging implementeert, legt een headless browser een screenshot vast, en de screenshot gaat terug naar het model samen met de originele designmock en een prompt die vraagt of ze matchen. Bij één run slaagde de code van de agent voor elke unittest, maar de screenshotvergelijking ving dat een grafieklegenda achter de grafiek zelf rendert, iets wat geen enkele DOM-assertion dekte. De agent paste toen de z-index aan en verifieerde opnieuw met een verse vastlegging. De hele lus, code plus twee screenshots per iteratie, kost een paar cent per run en vervangt een handmatige visuele QA-doorgang.

Veelvoorkomende misvattingen

De hardnekkige misvatting is dat een model dat beelden accepteert ze waarneemt zoals een mens dat doet. Vision-encoders comprimeren agressief, en het model redeneert over die gecomprimeerde samenvatting. Fijn detail lijdt: kleine tekst wordt verkeerd gelezen, gelijkende iconen worden verward, en pixel-precieze locaties komen bij benadering terug, wat precies waarom vroege computer-use-agents net naast hun doel klikten. Behandel visueel begrip als sterk in layout, content, en gestalt, en zwak in precisie. Wanneer exacte waarden ertoe doen, extraheer ze via een deterministisch pad, zoals de DOM, OCR, of de onderliggende data, en laat het model daarover redeneren in plaats van over de pixels.

FAQ

Is ChatGPT multimodaal? Ja, en dat zijn de huidige Claude- en Gemini-vlaggenschipmodellen ook. Alle accepteren beelden naast tekst; verschillende behandelen ook audio of video. De verschillen die er in de praktijk toe doen zijn kosten per beeld, resolutielimieten, en hoe nauwkeurig elk model dicht visueel materiaal zoals tabellen en grafieken leest.

Wat is het verschil tussen multimodal AI en computer use? Multimodal AI is de onderliggende capaciteit van beelden en andere media verwerken. Computer use is een toepassing ervan: een agent maakt screenshots, redeneert over wat hij ziet, en geeft klikken en toetsaanslagen af. Zonder multimodale input zouden scherm-besturende agents beperkt zijn tot wat een accessibility-tree blootstelt.

Werkt multimodale input met RAG- en toolpipelines? Ja. Gangbare patronen omvatten beelden embedden voor retrieval, gestructureerde data extraheren uit documenten zoals facturen en presentaties, en grafieken doorgeven aan het model tijdens analysetaken. De vraag is echt: Anthropic meldde in maart 2024 dat sommige enterprise-klanten tot 50% van hun kennisbanken bewaren in visuele formaten zoals PDF's, flowcharts, en presentatiedia's [3]. De belangrijkste voorzichtigheid is kosten: mediatokens lopen sneller op dan tekst, dus cache extracties in plaats van elke beurt hetzelfde beeld opnieuw te sturen.

Bronnen

  1. OpenAI. "GPT-4 Technical Report: top 10% van kandidaten op een gesimuleerd bar-exam." https://arxiv.org/abs/2303.08774. Geraadpleegd augustus 2026.
  2. Google. "Gemini 1.5 Pro: standaard multimodale context van 128.000 tokens, tot 1 miljoen tokens in preview." https://blog.google/technology/ai/google-gemini-next-generation-model-february-2024/. Geraadpleegd augustus 2026.
  3. Anthropic. "Aankondiging van de Claude 3-familie: tot 50% van sommige enterprise-kennisbanken in visuele formaten." https://www.anthropic.com/news/claude-3-family. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.