Zum Hauptinhalt Zur Navigation Zur Suche

Künstliche Intelligenz: Mehr Rechenleistung bringt immer Fortschritt, aber keine AGI

Was ist mit der bitteren Lektion der KI gemeint – und wie hängt diese mit AGI zusammen? Bringen neue Datenquellen die Lösung?
/ Tim Elsner
17 Kommentare Auf Google folgen (öffnet im neuen Fenster)
Rechenkraft bestimmt die Zukunft der KI. (Bild: Yamu_Jay/Pixabay (KI-generiert))
Rechenkraft bestimmt die Zukunft der KI. Bild: Yamu_Jay/Pixabay (KI-generiert)

In einem vielzitierten Blogpost(öffnet im neuen Fenster) aus dem Jahr 2019 hat der Turing-Award-Gewinner Rich Sutton, einer der Wegbereiter des Reinforcement Learning (unter anderem ein essenzieller Schritt des Trainings für alle modernen LLMs(öffnet im neuen Fenster)), von einer bitteren Lektion ("Bitter Lesson") gesprochen: Egal wie klug wir uns anstellen, am Ende wird immer rohe Rechenkraft die nächste große Innovation ermöglichen und jede noch so kluge Idee, die Forscher haben, überholen.

Zusammen mit den Moore'schen Gesetzen, also der konstanten Leistungssteigerung von Computerchips, ergibt sich aus dem Mehr an Rechenkraft damit automatisch ein inhaltlicher Fortschritt durch die Zeit. Vielfach wird daraus dann das Narrativ gesponnen, es gebe damit einen Automatismus zum Stein der Weisen der Informatik, eine selbstständige Maschine, die alle Probleme lösen könne: eine Artificial General Intelligence, kurz AGI.

Wir analysieren, was mit der bitteren Lektion gemeint ist, geben Beispiele für die Stichhaltigkeit dieser These, und extrapolieren, ob dadurch wirklich AGI nur eine Frage der Zeit ist, wie viele Tech-CEOs gerne gegenüber den Medien und damit auch gegenüber potenziellen Geldgebern behaupten – auch wenn der Zeithorizont sich immer weiter nach hinten zu verschieben scheint(öffnet im neuen Fenster).

Was Sutton meint

Die Informatik nahm ursprünglich mit dem Design von Algorithmen ihren Anfang: Stringente Programmabläufe mit "wenn dies, dann das", konkrete Rechenvorschriften, die einen Zweck erfüllen. Dieses Paradigma wandelte sich langsam, weg von einem Menschen, der ein Vorgehen vorgibt, hin zu maschinellem Lernen, wo nur mit einem vorgegebenen Ziel automatisch ein Weg zur Lösung gesucht wird.

In dieser Entwicklung sind Algorithmen aber nie plötzlich verschwunden, sondern schrittweise ersetzt worden. Ein Beispiel dafür gibt Sutton für die Computer Vision, also dem maschinellen Sehen: Die ersten Algorithmen auf Bildern verglichen statisch benachbarte Pixel und erkannten dadurch Kanten, die wiederum zu größeren Bausteinen(öffnet im neuen Fenster) zusammengesetzt wurden.

Bilder vollständig in neuronalen Netzen zu verarbeiten, war deutlich zu teuer. Als erster gelernter Baustein beim Eintauschen von Rechenleistung gegen Leistung wurden diese handgemachten Elemente dann mittels gelernter Klassifikatoren ausgewertet, etwa eine gewisse Summe festgelegt, ab der ein Bild in eine Kategorie sortiert wird.

Mit mehr Rechenleistung und technischer Innovation durch sogenannte Convolutions wurde es dann möglich, auch den Rest der Pipeline zu ersetzen: Anstatt das Bild komplett in ein neuronales Netz zu stecken, kann damit ein neuronales Netz mehrfach benutzt werden und wird an mehreren lokalen Fenstern des Bildes angelegt. An die Stelle von handgemachten Features traten also gelernte Filter. Zwar ist diese auch heute noch übliche Pipeline durchgehend gelernt, aber das Benutzen des gleichen Netzes an verschiedenen Stellen bzw. das dadurch entstehende Betrachten von lokalen Fenstern des Bildes hat immer noch einen gewissen induktiven Bias: Pixel werden zunächst in lokalen Nachbarschaften betrachtet, erst später werden größere und weiter entfernte Regionen zusammengefügt.

Einen weiteren Schritt in Richtung Freiheit ohne diese Biases machte dann die Einführung des Transformers(öffnet im neuen Fenster), die wohl aktuell wichtigste Architektur für neuronale Netzwerke vom Sprachmodell bis zum Bildgenerator, für die Anwendung auf Bildern(öffnet im neuen Fenster). Hier werden Bilder zwar immer noch als lokale Kacheln von Pixeln eingegeben, das Netz kann aber frei und ohne Hierarchie die einzelnen Komponenten miteinander in Kontext bringen, etwa bereits im ersten Layer beim Bild eines Menschen das Auge mit dem Fuß in Beziehung setzen.

Ein ähnliches Muster lässt sich beim Verarbeiten von Sprache beobachten: angefangen von etwa Übersetzen von Text mit handgemachten Regeln für Grammatik bis zum Lernen von Sprache durch das Vorhersagen des nächsten Wortfetzens. Aber auch hier sind die Wortfetzen, die ein Sprachmodell vorhersagt, letztlich eine menschengemachte Vereinfachung, ein induktiver Bias, der etwas von der maximalen Leistungsfähigkeit des Modells für eine deutliche Erleichterung im Training eintauscht. Aktuelle Ansätze(öffnet im neuen Fenster) tauschen daher die groben, algorithmisch festgelegten Wortfetzen bzw. Tokens durch feingliedrige Buchstaben und gelernte Tokens aus.

Egal ob in der Computer Vision oder allen anderen Domänen: Das Mehr an Freiheit bringt, genug Daten und Rechenleistung vorausgesetzt, deutlich bessere Ergebnisse. Es werden grundsätzlich die Anforderungen an Rechenleistung und Datenmenge erhöht, um gleichzeitig die Freiheit für die Auswahl an möglichen Lösungsstrategien zu erhöhen und vorgegebene Stücke bzw. induktive Biases im Design abzubauen. Einfach nur mehr Rechenleistung auf exakt der gleichen Architektur bringt natürlich ebenso Erfolg, etwa lernen Transformer-Modelle für die Vorhersage von Sprache einfach besser, je größer und mächtiger sie sind.

Man kann also eindeutig sagen: Mehr Rechenleistung und gegebenenfalls weniger menschengemachte Vereinfachungen bedeuten bessere Netze. Der Trugschluss steckt allerdings in der Schlussfolgerung, dass dieser Leistungszuwachs entsprechend linear und unbegrenzt möglich sei.

Dabei ist das Internet als größte Textquelle der Menschengeschichte längst leergefischt, und ab einer gewissen Größe bringen auch größere Modelle kaum noch signifikante Vorteile: Man könnte mutmaßen, wir befinden uns in einer doppelten Sättigungskurve. Immer weniger neue Daten und immer weniger Effekt von mehr Rechenleistung bringen zwar trotzdem noch Verbesserungen, aber der Fortschritt stagniert.

Bringen neue Datenquellen die Lösung?

Eine mögliche Lösung dafür, mehr Daten und mehr Verständnis zu bekommen, steckt in der Multimodalität: Man verwendet nicht nur Text, sondern auch Bilder und Videos. Dabei sehen viele gerade Videogeneration als vollständigsten Ansatz, um unsere Welt darzustellen: Ein Modell, das plausibel aussehende Clips produziert, muss zwangsweise die Regeln unserer Welt abbilden können, etwa physikalische Gesetze simulieren, wenn etwas zu Boden fällt oder eine Reflexion zu sehen ist.

Und eigentlich beinhalten diese Modelle auch alles an Wissen: Wer als Prompt "Eine Frau, die einen Sortieralgorithmus in Python auf eine Tafel schreibt" eingibt, bekommt zwar aktuell noch dürftige Ergebnisse. Das Grundprinzip aber funktioniert, das Modell kann nicht nur Bilder erzeugen, sondern auch alles andere, was in unserer Welt passiert, damit zumindest ansatzweise abbilden.

Ein solch komplexes Welt-Modell fällt dann streng genommen wieder unter Suttons bittere Lektion: Mit genug Daten und Rechenleistung kann so ein Modell alles lernen, von Programmcode über Physik bis zu Videospielen. Die Entwickler müssen nichts explizit designen oder bauen. Skalierung und ein möglichst allgemeines Konzept reichen dafür aus. Aber auch dabei gibt es begrenzt viele Daten und begrenzt viel Rechenleistung, weil Videoerzeugung noch einmal teurer ist als Text oder Bilder, wie wir bereits in einem früheren Artikel analysierten. Selbst ohne diese Probleme gibt es einiges an Aspekten, die nicht mit Rechenkraft allein gelöst werden können. Dazu gehören fundamentale Aspekte des Trainings.

Fehlende Reflexion

Rein technisch können Modelle, wie sie aktuell trainiert werden, nicht einfach dazu lernen, während sie laufen. Zwar lassen sich Sprachmodelle zumindest noch mit der Zugabe von extra Kontext in den Prompt temporär dazu bringen, auch neue Probleme zu lösen, sie sind aber dennoch statisch. Vereinfacht gesagt hat das Modell bei der nächsten Anfrage in einem neuen Fenster wieder alles vergessen. Es kann weder aktuelle bzw. neue Informationen dauerhaft aufnehmen noch aus seinen Fehlern lernen.

Außerdem fehlt dem Modell ein Kernaspekt von Intelligenz, die Reflexionsfähigkeit beim Aufnehmen neuer Fakten im Training. Wandern im Extremfall etwa Daten von Verschwörungstheoretikern über die flache Erde oder sogar Falschinformationen von Holocaustleugnern(öffnet im neuen Fenster) in die Trainingsdaten, steckt diese Information dort noch drin und zeigt sich bestenfalls in einer leicht erhöhten Wahrscheinlichkeit für besagte Falschinformationen, schlimmstenfalls in einer KI, die absonderliche Behauptungen macht. Es werden schließlich nur Muster in der Sprache vervollständigt, es wird gelernt, dass im Kontext von "Everest" häufig "8.842 Meter" vorkommt, aber echte Reflexion oder Gedanken dazu gibt es während des Auswendiglernens dieser Daten im Modell nicht.

Diese Probleme sind inherent in der aktuellen Architektur der Modelle, und während mehr Rechenleistung und Daten zwar bessere Ergebnisse liefern, ist das keinesfalls ein Automatismus zur AGI. Insbesondere das fehlende Verständnis dafür, was in neuronalen Netzen eigentlich passiert, führt oftmals zu falschen Annahmen, die dann die Narrative der AGI durch mehr Rechenleistung weiter nähren.

Ein Extrembeispiel für solche Fehlschlüsse selbst in der Forschung ist etwa, dass lange angenommen wurde, ab bestimmten Modellgrößen würden bestimmte Fähigkeiten zutage treten (emerging properties): Etwa, dass ab einer bestimmten Anzahl von Parametern das Modell Humor verstehen könne, vorher aber nicht. Eine magische Schwelle, ab der ein Modell klug genug ist. Auch das trägt zur Annahme bei, die Suttons bittere Lektion wirken lässt, als ob sie ein Heilsversprechen sei, mehr Rechenleistung alle Probleme löse und ungeahnte Möglichkeiten schaffe.

In Wahrheit wird aber mittlerweile vermutet(öffnet im neuen Fenster), dass das Phänomen eher auf falschen Metriken beruhe und keine fundamentale Eigenschaft der größeren Skalierung von Modellen sei. In Wahrheit skalieren solche Fähigkeiten genauso wie alles andere langsam mit der Modellgröße und treten nicht plötzlich zutage. Die Lektion daraus wäre also, dass mehr Rechenleistung nicht zwangsläufig irgendwann einen Durchbruch bringt, den wir gerade noch nicht beobachten können, es also keine unsichtbare Wand gibt, ab der plötzlich neue Fähigkeiten zu sehen sind.

Fazit

Suttons bittere Lektion besagt erst einmal nur, dass noch so kluges menschliches Design und alle Cleverness in der Regel einem maschinell gelernten Prinzip unterliegt, sofern wir Abstriche in Geschwindigkeit durch mehr Rechenleistung und Daten ausgleichen. Das bedeutet aber lediglich, dass wir auf der Sättigungskurve etwas weiter vorankommen, mit immer geringeren Fortschritten. Mathematisch gesprochen wird die Summe in einer unendlichen Reihe zwar immer größer, aber nicht zwangsweise auch unendlich groß.

Tim Elsner(öffnet im neuen Fenster) hat über bessere Repräsentationen für visuelle Daten von generativer KI geforscht und promoviert. Er berät, entwickelt und erklärt freiberuflich alles im Bereich rund um LLMs, Machine Learning und Computer Vision und bastelt gerne an allem, was mit neuronalen Netzen zu tun hat.


Relevante Themen