Zum Hauptinhalt Zur Navigation Zur Suche

Golem Plus Artikel
Transformer erklärt:
Die Technik hinter fast aller modernen KI

Attention, please! Wir erklären, wie die Transformer und ihr Attention-Mechanismus funktionieren, die Basis für die meisten Sprachmodelle sind.
/ Tim Elsner
15 Kommentare Auf Google folgen (öffnet im neuen Fenster)
Der Transformer-Ansatz, der in fast jeder KI steckt, kann ressourcenhungrig werden. (Bild: MasterTux/Pixabay)
Der Transformer-Ansatz, der in fast jeder KI steckt, kann ressourcenhungrig werden. Bild: MasterTux/Pixabay

"Attention is all you need": Die Geschichte hinter diesem Satz hat die Gesellschaft in den vergangenen Jahren so sehr verändert wie vielleicht in diesem Jahrhundert nur die Erfindung des Smartphones. Der Satz ist der Titel eines Google-Forschungspapiers, in dem der Konzern seine Erfindung vorstellt: den Transformer. Diese Architekturblaupause für neuronale Netzwerke aus dem Jahr 2017 ist bis heute die Basis für die allermeisten Sprachmodelle, von ChatGPT über Kimi bis Deepseek, und ist mittlerweile auch in der Bildverarbeitung sowie in ziemlich allen anderen Domänen angekommen.

Wir erklären, wie die Transformer und im Speziellen deren Attention-Mechanismus eigentlich funktionieren, und was wir daraus lernen können.

Golem Plus Artikel