• IT-Karriere:
  • Services:

Gutes Lernen, schlechtes Lernen und Eigen-KO

So zeigte sich bei zwei unterschiedlichen getesteten Methoden zum Lernen, dass der eine Algorithmus (Actor-Critic) beim Training gegen die KI des Spiels am Ende so agierte, wie dies von Menschen zu erwarten sei. Der zweite Algorithmus (Q-Learning) nutzte dagegen eine Schwäche des Spiels und konnte durch Eigen-KO des Gegners gewinnen, was dauerhaft reproduzierbar war. Beide Algorithmen konnten aber noch einfach von menschlichen Spielern geschlagen werden.

Stellenmarkt
  1. DMK E-BUSINESS GmbH, Chemnitz, Berlin-Potsdam, Köln
  2. Dürr AG, Bietigheim-Bissingen

Deshalb hat das Team in Anlehnung an die Vorgehensweise von Alpha Go seine Algorithmen gegen alte Versionen ihrer selbst antreten lassen. Damit war das Netzwerk schließlich in der Lage, nicht nur gegen menschliche Spieler mit Erfahrung in SSBM zu gewinnen, sondern auch gegen jene, die von der Spieler-Community als professionell und damit besonders gut eingeschätzt werden.

Doch auch diese Version des Algorithmus hatte große Schwierigkeiten damit, auf unerwartete Aktionen seiner Gegner reagieren zu können. Einem von den Autoren der Untersuchung als besonders clever bezeichneter Spieler ist es etwa mit einem Trick gelungen, den Actor-Critic-Algorithmus zum Verzicht auf einen Angriff zu zwingen und letztlich ebenfalls in ein Eigen-KO zu treiben.

Derartige Probleme hat das Team versucht zu überwinden, indem mittels verschiedener Spielcharaktere voneinander unabhängige neuronale Netze trainiert worden sind, die dann wiederum gegeneinander angetreten sind. Zuvor ist immer nur ein einzelner Charakter genutzt worden. So konnten die Algorithmen besser auf unerwartete Situationen reagieren.

KI ohne Erinnerung

Im Gegensatz zu Menschen, die kontinuierlich Reize aufnehmen, diese verarbeiten und in Reaktionen überführen können, kann das trainierte neuronale Netz immer nur auf einen einzelnen Zustand im Spiel reagieren. Dem Algorithmus fehlt damit sozusagen das Gedächtnis, um auf einen bestimmten Spielverlauf reagieren zu können.

Zwar gibt es mit den rekurrenten neuronalen Netzwerken (RNN) die Möglichkeit, diese Art Gedächtnis als eigenen Zustand zu emulieren, mit dem das Ergebnis einer Aktion direkt wieder in das Netz eingespeist wird. Dem Team gelang es in seiner Untersuchung jedoch nicht, ein fähiges RNN zu trainieren.

Ein RNN mit dem Gedächtnis könnte im Fall von SSBM künftig dazu genutzt werden, mit der eingangs erwähnten Zeitverzögerung umgehen zu können, die wie erwähnt in dem Spiel eine große Rolle einnimmt. Ebenso wäre ein RNN in der Lage, auch Geschosse, die in SSBM vorkommen, zu beurteilen und eventuell sogar selbst zu verwenden, indem deren Flugbahn bestimmt wird.

Bitte aktivieren Sie Javascript.
Oder nutzen Sie das Golem-pur-Angebot
und lesen Golem.de
  • ohne Werbung
  • mit ausgeschaltetem Javascript
  • mit RSS-Volltext-Feed
 Deep Learning: Wenn die KI besser prügelt als Menschen
  1.  
  2. 1
  3. 2


Anzeige
Hardware-Angebote
  1. (u. a. Ryzen 5 5600X 358,03€)

violator 24. Feb 2017

Zufällig ja, aber eben ohne Taktik oder Gedanken. Da wird immer nur analysiert und...

JayJay15 24. Feb 2017

Es gibt doch nur 2 mögliche Entwicklungen im Bereich der KI. Ich bin nicht einer dieser...

Polinda Panda 24. Feb 2017

Vielleicht haben haben sie Spass am Spiel ...

Smincke 24. Feb 2017

In Melee ist Techskill wesentlich wichtiger als in den anderen Smash Teilen. Ein gut...


Folgen Sie uns
       


Honda E Probe gefahren

Der Honda E ist ein Elektro-Kleinwagen, dessen Design an alte Honda-Modelle aus den 1970er Jahren erinnert.

Honda E Probe gefahren Video aufrufen
Programm für IT-Jobeinstieg: Hoffen auf den Klebeeffekt
Programm für IT-Jobeinstieg
Hoffen auf den Klebeeffekt

Aktuell ist der Jobeinstieg für junge Ingenieure und Informatiker schwer. Um ihnen zu helfen, hat das Land Baden-Württemberg eine interessante Idee: Es macht sich selbst zur Zeitarbeitsfirma.
Ein Bericht von Peter Ilg

  1. Arbeitszeit Das Sechs-Stunden-Experiment bei Sipgate
  2. Neuorientierung im IT-Job Endlich mal machen!
  3. IT-Unternehmen Die richtige Software für ein Projekt finden

Weclapp-CTO Ertan Özdil: Wir dürfen nicht in Schönheit und Perfektion untergehen!
Weclapp-CTO Ertan Özdil
"Wir dürfen nicht in Schönheit und Perfektion untergehen!"

Der CTO von Weclapp träumt von smarter Software, die menschliches Eingreifen in der nächsten ERP-Generation reduziert. Deutschen Perfektionismus hält Ertan Özdil aber für gefährlich.
Ein Interview von Maja Hoock


    Fiat 500 als E-Auto im Test: Kleinstwagen mit großem Potenzial
    Fiat 500 als E-Auto im Test
    Kleinstwagen mit großem Potenzial

    Fiat hat einen neuen 500er entwickelt. Der Kleine fährt elektrisch - und zwar richtig gut.
    Ein Test von Peter Ilg

    1. Vierradlenkung Elektrischer GMC Hummer SUV fährt im Krabbengang seitwärts
    2. MG Cyberster MG B Roadster mit Lasergürtel und Union Jack
    3. Elektroauto E-Auto-Prämie übersteigt in 2021 schon Vorjahressumme

      •  /