KI-Glossar ·Grundlagen

Aktivierungsfunktion

Auch: Activation Function, Transferfunktion, Aktivierungsfunktionen

Die Aktivierungsfunktion bestimmt, welchen Wert ein Neuron ausgibt, nachdem es seine gewichteten Eingaben summiert hat. Sie ist nichtlinear — und erst diese Nichtlinearität macht mehrschichtige Netze leistungsfähiger als einschichtige.

Stellung im Neuron

Ein Neuron multipliziert seine Eingaben mit den zugehörigen Gewichten und addiert die Ergebnisse. Auf diese Summe wird die Aktivierungsfunktion angewendet; deren Ergebnis geht an die nächste Schicht. Das Perzeptron von 1958 nutzte dafür eine harte Schwelle: über dem Schwellenwert 1, darunter 0.

Der Grund für die Nichtlinearität

Ohne Aktivierungsfunktion wäre jede Schicht eine lineare Abbildung. Mehrere lineare Abbildungen hintereinander ergeben aber wieder nur eine lineare Abbildung — ein Netz aus hundert Schichten könnte dann nicht mehr als eine einzige. Die nichtlineare Funktion zwischen den Schichten ist es, die aus der Tiefe einen Gewinn macht.

Gebräuchliche Funktionen

  • ReLU (rectified linear unit): gibt negative Werte als 0 aus, positive unverändert. Seit etwa 2011 der Standard in tiefen Netzen, weil sie einfach zu berechnen ist und das Fehlersignal weniger stark abschwächt.
  • Sigmoid und Tanh: stauchen jeden Wert in den Bereich zwischen 0 und 1 beziehungsweise −1 und 1. Lange üblich, heute in verborgenen Schichten seltener, weil sie bei großen Werten kaum noch Steigung haben und das Training bremsen.
  • Softmax: wandelt in der Ausgabeschicht eine Reihe von Zahlen in Wahrscheinlichkeiten um, die sich zu 1 summieren. Genau so wählt ein Sprachmodell das nächste Token.

Zusammenhang mit dem Training

Damit Backpropagation funktioniert, muss die Funktion ableitbar sein — nur dann lässt sich berechnen, wie eine Änderung des Gewichts den Fehler beeinflusst. Die harte Schwelle des Perzeptrons erfüllt das nicht; ihr Ersatz durch differenzierbare Funktionen war eine Voraussetzung für das Training tiefer Netze.

Im Netz verbunden

setzt voraus
abzugrenzen von
Im Wissensnetz ansehen