Alle inzichten
15 mei 2024Door AI

Multimodaal werken: AI die ziet, hoort en leest

De eerste keer dat ik een foto naar een AI stuurde en een bruikbaar antwoord terugkreeg, moest ik even stilstaan. Niet omdat het antwoord perfect was — dat was het niet — maar omdat ik besefte dat de spelregels net fundamenteel waren veranderd. Tot dat moment was AI een tekst-ding. Je typte iets, je kreeg tekst terug. Maar nu kon ik een rommelig whiteboard fotograferen, die foto uploaden, en een gestructureerde samenvatting terugkrijgen. Mijn handschrift is, laten we zeggen, niet mijn sterkste punt. Maar het model las alles correct, vatte het samen, en stelde zelfs verbeterpunten voor.

Dat was het moment dat ik dacht: dit verandert alles.

Welkom in het tijdperk van multimodale AI. En geloof me — de impact hiervan wordt zwaar onderschat.

Eerst even terug: wat kon AI tot nu toe?

In het eerste artikel van deze serie legde ik uit wat AI eigenlijk is — een gereedschap, geen denker. En in het vorige artikel over deep learning doken we achter het gordijn van ChatGPT: neurale netwerken, Transformers, en het raden van het volgende woord.

Maar al die uitleg ging over een AI-wereld die fundamenteel beperkt was. De meeste AI-systemen tot nu toe waren unimodaal: ze konden precies een ding. Taal begrijpen. Of beelden herkennen. Of geluid verwerken. Maar nooit alles tegelijk.

ChatGPT kon briljante teksten schrijven, maar als je een foto stuurde, had het daar niks mee. Google's beeldherkenning kon je vertellen dat er een golden retriever op een foto stond, maar het kon geen gesprek voeren over die foto. Spraakassistenten als Siri en Alexa begrepen je stem, maar hadden geen idee wat er op je scherm stond.

Elke AI zat opgesloten in zijn eigen wereld. Tekst-AI leefde in een wereld van woorden. Beeld-AI in een wereld van pixels. Audio-AI in een wereld van geluidsgolven. Ze konden niet naar buiten kijken.

Tot nu.

Wat is multimodale AI?

Het woord "multimodaal" klinkt ingewikkeld, maar het is eigenlijk simpel. "Modi" zijn manieren waarop informatie binnenkomt. Tekst is een modus. Beeld is een modus. Geluid is een modus. Video is een modus.

Een mens is van nature multimodaal. Als je in een restaurant zit, verwerk je tegelijkertijd:

  • Wat je ziet (het menu, de gerechten, de inrichting)
  • Wat je hoort (de ober, achtergrondmuziek, het gerinkel van bestek)
  • Wat je leest (de menukaart, het krijtbord bij de ingang)
  • Wat je ruikt (knoflook uit de keuken, verse koffie)
  • Wat je voelt (de stoel, de temperatuur)

Al die informatie combineert je brein tot een compleet beeld. Je vormt een oordeel over het restaurant op basis van alles tegelijk — niet alleen het eten, niet alleen de sfeer, maar het geheel.

Multimodale AI doet hetzelfde. Het is AI die meerdere soorten informatie tegelijk kan verwerken en begrijpen. Tekst en beeld. Of tekst en audio. Of tekst, beeld, audio en video gecombineerd.

En het verschil met een jaar geleden is enorm.

De doorbraak: GPT-4 met Vision

Het begon eind 2023. OpenAI bracht GPT-4 Vision uit — een versie van GPT-4 die niet alleen tekst kon verwerken, maar ook afbeeldingen. Je kon een foto uploaden en vragen stellen. "Wat zie je op deze afbeelding?" "Kun je dit diagram uitleggen?" "Wat is er grappig aan deze meme?"

En het werkte. Niet perfect, maar verbluffend goed.

Maar dat was nog maar het begin. Want deze maand — mei 2024 — heeft OpenAI GPT-4o gelanceerd. De "o" staat voor "omni". Alomvattend. En het is een gamechanger.

GPT-4o: de nieuwe standaard

GPT-4o is niet zomaar een update. Het is een fundamenteel ander model. Waar eerdere versies tekst, beeld en audio als aparte systemen behandelden die aan elkaar geknoopt waren, verwerkt GPT-4o alles in een enkel neuraal netwerk. Tekst, beeld en audio gaan er samen in en komen er samen uit.

Als je in systemen denkt — en dat is hoe mijn brein werkt — dan is dit een architectuurwijziging, geen feature-update. Het is het verschil tussen drie losse systemen die met ducttape aan elkaar zitten, en een geintegreerd systeem dat van de grond af is ontworpen om alles tegelijk te verwerken.

Wat betekent dat in de praktijk?

  • Je kunt tegen het model praten (audio), het een foto laten zien (beeld), en een geschreven vraag stellen (tekst) — allemaal in dezelfde conversatie
  • Het reageert in real-time, met een vertraging die vergelijkbaar is met een menselijk gesprek
  • Het kan emotie in je stem herkennen en daar zijn toon op aanpassen
  • Het kan wiskundige formules op een foto oplossen terwijl je er mondeling vragen over stelt

Dit is niet langer "AI die tekst genereert met een camera eraan vastgeplakt." Dit is AI die de wereld beleeft zoals wij dat doen: via meerdere zintuigen tegelijk.

Niet alleen OpenAI

Eerlijkheid gebiedt te zeggen: OpenAI is niet de enige speler. Het multimodale veld beweegt razendsnel.

Google Gemini 1.5 Pro werd eerder dit jaar gelanceerd en is van de grond af opgebouwd als multimodaal model. Het kan teksten van honderdduizenden woorden verwerken, maar ook uren aan video analyseren. Google demonstreerde hoe je een hele film kon uploaden en het model vragen kon stellen over specifieke scenes. "Op welk moment lacht het hoofdpersonage voor het eerst?" Het model vond het fragment.

Claude 3, het model van Anthropic dat in maart uitkwam, kan nu ook afbeeldingen verwerken. Upload een screenshot van een spreadsheet, en Claude legt uit wat de data betekent. Stuur een foto van een foutmelding op je scherm, en het helpt je het probleem oplossen. Het is niet zo uitgebreid multimodaal als GPT-4o — het verwerkt tekst en beeld, geen audio — maar het is een enorme stap vooruit.

De trend is duidelijk: elk groot AI-bedrijf investeert zwaar in multimodaliteit. Het is niet de vraag of dit de standaard wordt. Het is de vraag hoe snel.

Concrete voorbeelden: wat kun je ermee?

Technologie is pas interessant als je er iets mee kunt doen. Hier zijn scenario's die vandaag al werken:

Foto naar diagnose

Stuur een foto van een huiduitslag naar een multimodaal model, en het kan een eerste inschatting geven. "Dit lijkt op contactdermatitis, mogelijk veroorzaakt door een allergische reactie. Ik raad aan om een huisarts te raadplegen." Het vervangt geen arts — dat moet ik benadrukken — maar het kan een eerste filter zijn. Vooral in gebieden waar een arts niet direct beschikbaar is.

Screenshot naar code

Maak een screenshot van een webdesign, upload het naar GPT-4o of Claude, en vraag: "Bouw dit na in HTML en CSS." Het model analyseert de lay-out, de kleuren, de typografie, de positionering, en genereert werkende code. Niet pixel-perfect, maar een solide startpunt dat je uren werk kan schelen.

Ik gebruik dit zelf regelmatig. Niet als vervanging voor het bouwen — maar als accelerator. Een screenshot uploaden, een eerste versie laten genereren, en dan zelf finetunen. Het scheelt mij dagelijks tijd.

Foto naar tekst naar vertaling

Maak een foto van een menukaart in het Japans. De AI herkent de tekst op de afbeelding (OCR), leest het Japans, vertaalt het naar het Nederlands, en geeft zelfs uitleg bij gerechten die je niet kent. "Okonomiyaki is een Japanse hartige pannenkoek met kool en vlees of zeevruchten." Drie stappen — beeldherkenning, tekstextractie, vertaling — in een naadloze handeling.

Technische documentatie begrijpen

Upload een foto van een ingewikkeld bedradingsschema, een architectuurtekening, of een installatiehandleiding in het Chinees. Stel je vraag in het Nederlands. Krijg een helder antwoord. Dit is niet theoretisch — installateurs, technici en ingenieurs gebruiken dit nu al.

Vergaderingen samenvatten

Neem een vergadering op (audio), laat de AI het transcriberen, een samenvatting maken, actiepunten extraheren, en die in een nette lijst zetten. Eerdere tools deden dit stap voor stap met verschillende systemen. Multimodale AI doet het in een flow.

Grafiek naar inzicht

Upload een grafiek uit een rapport — omzetcijfers, websiteverkeer, marktonderzoek — en vraag: "Wat valt je op?" De AI analyseert de visuele data, herkent trends, uitschieters, en patronen, en geeft een samenvatting in mensentaal. "De omzet daalde 12% in Q3, maar herstelde in Q4. Opvallend is dat het herstel samenvalt met de lancering van het nieuwe product."

Waarom dit alles verandert

Misschien denk je: leuk, maar is dit niet gewoon een betere versie van wat we al hadden? Nee. En hier is waarom.

De muur tussen data-types verdwijnt

Tot nu toe leefden tekst, beeld en audio in gescheiden werelden. Als je een foto wilde analyseren, had je een ander programma nodig dan wanneer je tekst wilde verwerken. Multimodale AI breekt die muren af. Informatie is informatie, ongeacht de vorm. Dat is een paradigmaverschuiving.

AI begrijpt context beter

Wanneer je alleen tekst hebt, mis je nuance. De zin "dat ging goed" kan sarcastisch of oprecht zijn — je weet het niet zonder de toon te horen of het gezicht te zien. Multimodale AI kan die toon horen, dat gezicht zien, en de tekst lezen. Tegelijkertijd. Dat maakt de interpretatie rijker en nauwkeuriger.

De drempel wordt lager

Niet iedereen kan goed typen. Niet iedereen kan zijn vraag helder formuleren in tekst. Maar vrijwel iedereen kan een foto maken en zeggen: "Wat is dit?" Multimodale AI maakt de technologie toegankelijk voor mensen die voorheen buitengesloten werden. Ouderen die moeite hebben met toetsenborden. Mensen die beter communiceren via spraak. Vakmensen die hun handen vol hebben en een foto sneller is dan een beschrijving typen.

Nieuwe toepassingen worden mogelijk

Sommige problemen kun je simpelweg niet oplossen met alleen tekst. Een arts die een rontgenfoto wil laten beoordelen. Een makelaar die een inschatting wil van de staat van een pand op basis van foto's. Een boer die een foto van een gewas stuurt om een ziekte te identificeren. Deze toepassingen vereisen dat AI kan zien. En nu kan het dat.

De beperkingen: het is niet perfect

Ik zou mezelf niet zijn als ik hier niet eerlijk over was. Multimodale AI heeft ook flinke beperkingen.

Hallucinaties worden visueel

Net als tekst-AI soms bronnen verzint die niet bestaan, kan multimodale AI dingen "zien" die er niet zijn. Het kan een object verkeerd identificeren, tekst op een afbeelding fout lezen, of een grafiek verkeerd interpreteren. De zelfverzekerde toon maakt het extra gevaarlijk: het model zegt met overtuiging dat het getal op de grafiek 47% is, terwijl het 74% is.

Privacy en ethiek

Als AI foto's kan analyseren, kan het ook gezichten herkennen. Locaties bepalen op basis van achtergronden. Persoonlijke informatie afleiden uit beelden die je deelt. De privacyvragen die we al hadden met tekst-AI worden met multimodale AI vele malen groter.

Context missen ze nog steeds

Een mens die een foto van een rommelige kamer ziet, begrijpt meteen: hier woont iemand die een drukke week heeft gehad. AI ziet objecten, posities, kleuren. Het mist de menselijke interpretatie, het verhaal achter het beeld. Het kan beschrijven wat het ziet, maar niet altijd begrijpen wat het betekent.

Rekenkracht en kosten

Multimodale modellen zijn hongerig. Ze verwerken veel meer data dan tekst-alleen modellen, wat meer rekenkracht vraagt. GPT-4o is sneller en goedkoper dan zijn voorgangers, maar het verwerken van video en audio op grote schaal is nog steeds duur. Voor MKB-bedrijven die deze technologie willen inzetten, is de kostenoverweging reeel.

Wat betekent dit voor jou?

Als ondernemer, als professional, als iemand die de wereld om zich heen probeert bij te houden — multimodale AI is relevant. Nu. Niet over vijf jaar.

De bedrijven die als eerste leren om deze technologie in te zetten, hebben een voorsprong. Niet omdat de technologie magisch is — dat hebben we in eerdere artikelen uit de weg geruimd — maar omdat het processen versnelt die voorheen onmogelijk waren.

Een makelaar die in tien seconden een eerste taxatie kan doen op basis van foto's. Een monteur die een foto van een kapot onderdeel stuurt en direct de juiste vervanging vindt. Een marketeer die een concurrentiepresentatie uploadt en binnen een minuut een analyse heeft. Een klantenservicemedewerker die een screenshot van een klant ontvangt en direct het probleem ziet.

Dit zijn geen futuristische scenario's. Dit is nu. Met tools die vandaag beschikbaar zijn. En het verschil tussen bedrijven die dit snappen en bedrijven die afwachten, wordt elke maand groter.

De reis gaat door

We zijn pas halverwege het verhaal van AI. Van de eerste vraag van Turing — "Kunnen machines denken?" — via machine learning en deep learning, naar AI die nu ziet, hoort en leest tegelijkertijd. Elke stap leek onmogelijk totdat het er was.

Wat me het meest fascineert aan multimodale AI is niet de technologie zelf, maar wat het zegt over de richting. AI wordt niet alleen slimmer — het wordt completer. Het begint de wereld te ervaren zoals wij dat doen: via meerdere kanalen tegelijk. Niet perfect. Niet bewust. Maar steeds capabeler.

Ik ben iemand die gefascineerd is door hoe dingen werken. En multimodale AI is een van die zeldzame ontwikkelingen waar de technologie sneller beweegt dan de meeste mensen kunnen bijhouden. Dat maakt het spannend. En dat maakt het belangrijk om het fundament te begrijpen — zodat je niet achter de feiten aanloopt als de volgende doorbraak komt. En die komt. Sneller dan je denkt.

De vraag is niet meer of AI relevant is voor jouw werk of leven. Die vraag is al beantwoord. De vraag is: hoe ga jij het gebruiken?

Ik help je graag op weg. In het volgende artikel in deze serie gaan we het hebben over de AI-termen die je echt moet kennen — zodat je niet meer hoeft te knikken in vergaderingen als iemand met jargon strooit.

Maar dat is voor de volgende keer. Voor nu is het belangrijkste inzicht dit:

AI die alleen tekst begrijpt, was indrukwekkend. AI die ziet, hoort en leest tegelijk? Dat is een heel nieuw hoofdstuk. En het staat nu pas open.

Hierover sparren?

Start een gesprek →