Transformer
Een Transformer is een neurale netwerkarchitectuur die sinds de introductie in 2017 het fundament vormt van vrijwel elk modern taalmodel. Waar oudere AI-modellen tekst woord voor woord verwerkten, kan een Transformer een hele zin of zelfs een heel document in één keer analyseren. Deze architectuur ligt aan de basis van de letter T in GPT, wat staat voor Generative Pre-trained Transformer, en verklaart in belangrijke mate waarom moderne AI zo goed is geworden in taal.
Het trucje waarmee een Transformer alles tegelijk leest
De kern van een Transformer is het zogeheten aandachtsmechanisme, ook wel attention genoemd. Hierdoor kan het model voor elk woord in een tekst bepalen welke andere woorden relevant zijn voor de betekenis, ongeacht hoe ver deze woorden uit elkaar staan. In de zin “de hond die blafte, rende weg” begrijpt een Transformer bijvoorbeeld moeiteloos dat “rende” bij “de hond” hoort, ook al staan er meerdere woorden tussen. Dit in tegenstelling tot oudere modellen, die tekst strikt na elkaar verwerkten en langeafstandsverbanden vaak misten.
Waarom deze architectuur alles veranderde
Voordat Transformers hun intrede deden, waren AI-modellen relatief traag en beperkt in hoe lang een tekst mocht zijn om nog goed verwerkt te worden. Doordat een Transformer tekst parallel verwerkt in plaats van sequentieel, kunnen modellen nu veel sneller getraind worden op enorme hoeveelheden data. Dit maakte de weg vrij voor Large Language Models (LLM) met miljarden parameters, die dankzij deze architectuur in staat zijn om coherente, contextbewuste teksten te genereren.
Transformers overal om je heen
Vandaag de dag draait vrijwel elke bekende AI-tool op een Transformer-architectuur, van ChatGPT en Claude tot beeldgeneratoren zoals DALL-E. Ook toepassingen als vertaalmachines, spraakherkenning en aanbevelingssystemen maken er dankbaar gebruik van. Binnen prompt engineering is het juist deze architectuur die ervoor zorgt dat een model een prompt in de juiste context plaatst en daar een passend antwoord op formuleert.
Veelgestelde vragen
Een Transformer is een neurale netwerkarchitectuur die woorden in een tekst tegelijk analyseert en met elkaar in verband brengt, via een aandachtsmechanisme.
Ja, ChatGPT is gebouwd op een Generative Pre-trained Transformer-model, de basis van vrijwel elk modern taalmodel.
De T in GPT staat voor Transformer, de architectuur waarop het model gebaseerd is.
Transformers maakten het mogelijk om tekst parallel te verwerken in plaats van woord voor woord, wat de ontwikkeling van krachtige taalmodellen enorm versnelde.