Reinforcement Learning

Learn / Reinforcement Learning

Reinforcement Learning: Umfassende Grundlagen (Deutsch)

Umfassender Selbsttest auf Deutsch zu RL-Grundlagen, PPO, AlphaStar und League-Training, verteiltem RL mit Ray/RLlib, MLOps und simulationsbasiertem Lernen.

Learning path

0%

0 of 9 sections marked complete · about 35 minutes

Learning objectives

What you will be able to explain

  • Wie ist ein Markov-Entscheidungsprozess (MDP) formal definiert?
  • Was besagt die Markov-Eigenschaft?
  • Welche Rolle spielt der Diskontierungsfaktor γ\gamma?
  • Berechne den diskontierten Return
  • Ordne jede RL-Größe ihrer Definition zu
  • Was drückt die Bellman-Gleichung aus?

Section 01

Wie ist ein Markov-Entscheidungsprozess (MDP) formal definiert? to Welche Rolle spielt der Diskontierungsfaktor γ\gamma?

01

Wie ist ein Markov-Entscheidungsprozess (MDP) formal definiert?

Ein MDP ist das Tupel (S,A,P,R,γ)(S, A, P, R, \gamma). Der Agent beobachtet einen Zustand, wählt eine Aktion, die Umgebung wechselt gemäß PP in einen Folgezustand und gibt eine Belohnung RR. Ziel ist eine Policy, die den erwarteten diskontierten Return maximiert. Quelle: Sutton & Barto, Reinforcement Learning: An Introduction, Kap. 3.

Guided checkpoint

RL-Probleme werden häufig als MDP formuliert. Identifiziere zuerst die formalen Komponenten und das Optimierungsziel.

02

Was besagt die Markov-Eigenschaft?

Die Markov-Eigenschaft bedeutet, dass der aktuelle Zustand eine ausreichende Statistik für die Zukunft ist: P(st+1st,at)P(s_{t+1} \mid s_t, a_t) wird nicht besser, wenn man zusätzlich st1,st2,s_{t-1}, s_{t-2}, \dots kennt. Ist der wahre Zustand durch Verdeckung oder Sensorrauschen verborgen, erhält man ein POMDP, weshalb rekurrente Policies eingesetzt werden.

03

Welche Rolle spielt der Diskontierungsfaktor γ\gamma?

Der Return ist Gt=k=0γkrt+kG_t = \sum_{k=0}^{\infty} \gamma^k r_{t+k}. Ein kleineres γ\gamma macht den Agenten kurzsichtig (bevorzugt schnelle Belohnung), ein größeres γ\gamma bewertet langfristige Folgen. Wegen γ<1\gamma < 1 konvergiert die geometrische Reihe, die unendliche Summe bleibt endlich.

Guided checkpoint

Es gelte 0γ<10 \le \gamma < 1.

Section 02

Berechne den diskontierten Return to Was drückt die Bellman-Gleichung aus?

01

Berechne den diskontierten Return

Fall A ist eine geometrische Reihe: t=0γt=11γ=10.1=10\sum_{t=0}^{\infty} \gamma^t = \frac{1}{1-\gamma} = \frac{1}{0.1} = 10. Fall B ist endlich: 2+0.50+0.528=2+0+2=42 + 0.5 \cdot 0 + 0.5^2 \cdot 8 = 2 + 0 + 2 = 4. Einen Return von Hand zu berechnen ist ein Klassiker und kann am Whiteboard drankommen.

Guided checkpoint

Verwende G=t=0γtrtG = \sum_{t=0}^{\infty} \gamma^t r_t, wobei die Belohnung zum Zeitpunkt tt mit γt\gamma^t diskontiert wird.

  • Fall A: Der Agent erhält zu jedem Zeitschritt für immer die Belohnung +1+1, mit γ=0.9\gamma = 0.9.
  • Fall B: Die Belohnungen sind r0=2r_0 = 2, r1=0r_1 = 0, r2=8r_2 = 8, danach endet die Episode, mit γ=0.5\gamma = 0.5.

02

Ordne jede RL-Größe ihrer Definition zu

VV bewertet einen Zustand, QQ ein Zustand-Aktion-Paar, π\pi ist das Verhalten selbst, und der Advantage A(s,a)=Q(s,a)V(s)A(s,a) = Q(s,a) - V(s) misst den relativen Vorteil. Advantages sind zentral für Policy-Gradient-Verfahren wie PPO, weil sie die Varianz des Gradienten senken.

Guided checkpoint

Wähle den Begriff, den jede Beschreibung definiert.

03

Was drückt die Bellman-Gleichung aus?

Vπ(s)=E[r+γVπ(s)]V^\pi(s) = \mathbb{E}[\,r + \gamma V^\pi(s')\,]. Diese Rekursion ist das Rückgrat des wertbasierten RL: Dynamische Programmierung, Temporal-Difference-Lernen und Q-Learning bootstrappen Wertschätzungen aus den Folgezuständen über ein Bellman-Update.

Section 03

Sortiere die Algorithmen: on-policy vs. off-policy to Ordne jeden Algorithmus seiner Methodenfamilie zu

01

Sortiere die Algorithmen: on-policy vs. off-policy

Off-policy-Verfahren (Q-Learning, DQN, DDPG, SAC) verwenden alte Erfahrung aus einem Replay Buffer wieder und sind daher meist sample-effizienter. On-policy-Verfahren (SARSA, REINFORCE, A2C/A3C, PPO) müssen nach jedem Update frische Daten mit der aktuellen Policy sammeln, was einfacher und oft stabiler, aber weniger sample-effizient ist.

Guided checkpoint

On-policy-Verfahren lernen über dieselbe Policy, die die Daten erzeugt. Off-policy-Verfahren können eine Ziel-Policy aus Daten lernen, die von einer anderen Verhaltens-Policy stammen (das macht Replay Buffer erst möglich).

02

Was unterscheidet off-policy von on-policy RL?

Das entscheidende Merkmal ist die Entkopplung von Verhaltens- und Ziel-Policy. Dadurch können gespeicherte Transitionen wiederverwendet werden (Sample-Effizienz), aber es entsteht ein Verteilungs-Mismatch, der korrigiert werden muss (z. B. Importance Sampling oder die Stabilisierungstricks in DQN/SAC). Schneller oder stabiler sind sie nicht automatisch.

03

Ordne jeden Algorithmus seiner Methodenfamilie zu

Wertbasierte Verfahren lernen QQ und handeln gierig (DQN). Reine Policy-Gradient-Verfahren optimieren die Policy direkt über Monte-Carlo-Returns (REINFORCE). Actor-Critic kombiniert beides: einen Actor (Policy) und einen Critic (Wert-Baseline), z. B. A3C, und auch PPO. Modellbasierte Verfahren lernen oder nutzen ein Dynamikmodell zum Planen (MuZero, Dyna-Q). PPO gehört zur Actor-Critic-Familie.

Guided checkpoint

Wähle die Familie, die den jeweiligen repräsentativen Algorithmus am besten beschreibt.

Section 04

Modellfrei vs. modellbasiert, und Exploration to Welche Aussagen über PPO sind korrekt?

01

Modellfrei vs. modellbasiert, und Exploration

Modellbasierte Verfahren (sample-effizient, aber ein falsches Modell schadet) planen mit gelernter Dynamik; modellfreie Verfahren (DQN, PPO) verzichten auf das Modell. ϵ\epsilon-greedy exploriert durch gelegentlich zufällige Aktionen. Ein Entropie-Bonus belohnt eine weniger spitze Aktionsverteilung und fördert damit die Exploration, statt sie zu verringern. PPO und SAC nutzen beide Entropie-Terme.

Guided checkpoint

Markiere jede Aussage als wahr oder falsch.

02

Was ist der Exploration-Exploitation-Trade-off?

Zu wenig Exploration und der Agent verharrt in einer suboptimalen Gewohnheit; zu viel und er verschenkt Belohnung. Strategien: ϵ\epsilon-greedy und optimistische Initialisierung (wertbasiert), Entropie-Boni und stochastische Policies (Policy-Gradient) sowie Neugier/intrinsische Belohnung bei spärlichen Belohnungen.

03

Welche Aussagen über PPO sind korrekt?

PPO (Schulman et al., 2017) ist on-policy Actor-Critic. Das geclippte Ziel beschränkt das Verhältnis rt(θ)=πθ(as)πθalt(as)r_t(\theta) = \frac{\pi_\theta(a \mid s)}{\pi_{\theta_{alt}}(a \mid s)} auf [1ϵ,1+ϵ][1-\epsilon, 1+\epsilon] und nutzt meist GAE für varianzarme Advantages. Es ist nicht off-policy und verwendet keinen DQN-artigen Replay Buffer (ein Batch wird nur wenige Epochen wiederverwendet und dann verworfen).

Guided checkpoint

PPO ist das Verfahren, nach dem das Team am wahrscheinlichsten fragt. Wähle alle zutreffenden Aussagen.

Section 05

Warum clippt PPO das Wahrscheinlichkeitsverhältnis? to Wie wurde die Policy von AlphaStar vor dem Reinforcement Learning initialisiert?

01

Warum clippt PPO das Wahrscheinlichkeitsverhältnis?

Bewegt ein einzelnes Update die Policy zu weit, kann die neue Policy viel schlechter sein und die on-policy Daten werden unbrauchbar. TRPO erzwang eine harte KL-Trust-Region (teuer, Second-Order); PPO nähert denselben Effekt günstig an, indem es das Verhältnis clippt, sodass das Ziel Schritte über [1ϵ,1+ϵ][1-\epsilon, 1+\epsilon] hinaus nicht weiter belohnt. Dieser Kompromiss aus Stabilität und Einfachheit erklärt die weite Verbreitung von PPO.

02

Warum nutzt man eine Advantage-Funktion bzw. Baseline in Policy-Gradient-Verfahren?

Rohe Returns machen den Policy-Gradient-Schätzer sehr varianzreich. Subtrahiert man eine zustandsabhängige Baseline (typisch V(s)V(s), was den Advantage A=QVA = Q - V ergibt), bleibt der Schätzer erwartungstreu, während die Varianz sinkt, das Lernen wird schneller und stabiler. GAE steuert den Bias-Varianz-Kompromiss über einen Parameter λ\lambda.

03

Wie wurde die Policy von AlphaStar vor dem Reinforcement Learning initialisiert?

AlphaStar (Vinyals et al., 2019, Nature) wurde zunächst überwacht auf menschlichen Replays trainiert und dann mit Multi-Agent-RL verbessert. Der Imitations-Start löst das Cold-Start-Problem: In einem riesigen Aktionsraum stolpert reine Zufallsexploration fast nie über kompetentes Spiel. Dieses Muster (auf Demonstrationen vortrainieren, dann mit RL verfeinern) ist genau die Art von Forschungs-zu-System-Transfer, um die es in der Stelle geht.

Guided checkpoint

Die Stellenausschreibung nennt den Einsatz von AlphaStar-Techniken, also ist mit Fragen dazu zu rechnen.

Section 06

Welche Aussagen über das League-Training von AlphaStar sind korrekt? to Partielle Beobachtbarkeit und Entscheidungsfindung unter Unsicherheit

01

Welche Aussagen über das League-Training von AlphaStar sind korrekt?

Die League mischt Main Agents (Generalisten, die robust werden sollen), Main Exploiter (suchen Schwächen der Main Agents) und League Exploiter (suchen Schwächen in der gesamten Population). Prioritized Fictitious Self-Play (PFSP) gewichtet Gegner nach Schwierigkeit. Spezialisierte Exploiter sind der Kern der Idee, die letzte Aussage ist also falsch.

Guided checkpoint

Wähle alle zutreffenden Aussagen.

02

Warum eine vielfältige League statt naivem Self-Play gegen den neuesten Agenten?

Wenn A B schlägt, B C schlägt und C A schlägt, kann ein Training nur gegen das neueste Selbst dem Zyklus ewig hinterherjagen und Konter gegen alte Taktiken vergessen. Eine eingefrorene, vielfältige Population erzwingt Robustheit über den Strategieraum und nähert eine Best Response gegen eine Mischung von Gegnern an.

03

Partielle Beobachtbarkeit und Entscheidungsfindung unter Unsicherheit

Wenn der Agent den vollen Zustand wegen Verdeckung oder begrenzter Sensoren nicht sieht, ist eine einzelne Beobachtung nicht mehr Markov. Die Historie kann zu einem approximativen Belief verdichtet werden, in der Praxis oft mit einem rekurrenten Kern; AlphaStar nutzte dafür ein tiefes LSTM.

Guided checkpoint

Die Ausschreibung betont 'Entscheidungsfindung unter unsicheren Bedingungen'. Wie wird verdeckter Zustand behandelt?

Section 07

Verteiltes RL: Ordne jede Komponente ihrer Rolle zu to Warum brauchen große Actor-Learner-Setups (z. B. IMPALA) eine off-policy Korrektur wie V-trace?

01

Verteiltes RL: Ordne jede Komponente ihrer Rolle zu

Ray ist die verteilte Laufzeitumgebung (ursprünglich aus dem RISELab der UC Berkeley, heute von Anyscale gepflegt); RLlib ist die darauf aufbauende skalierbare RL-Bibliothek. Die typische Actor-Learner-Aufteilung hat viele CPU-Rollout-Worker, die einen zentralen GPU-Learner speisen, mit einem Replay Buffer für off-policy Algorithmen. Diese Architektur skizzieren zu können trifft direkt den Punkt 'MLOps-getriebene KI-Trainings auf Kubernetes / Ray'.

Guided checkpoint

Die Ausschreibung nennt Ray ausdrücklich. Ordne jeden Teil eines Ray/RLlib-artigen Trainingsstacks seiner Funktion zu.

02

Warum ist verteiltes Rechnen (z. B. Ray) für Deep RL besonders wertvoll?

Deep RL ist datenhungrig und der Simulator ist häufig langsamer als der Gradientenschritt. Rollouts über viele CPU-Worker zu parallelisieren (mit dem Learner auf einer GPU) ist der Standardweg zum Skalieren, wie bei IMPALA und APPO. Genau deshalb greift ein Haus mit aufwändiger Simulation und RL zu Ray und Kubernetes.

03

Warum brauchen große Actor-Learner-Setups (z. B. IMPALA) eine off-policy Korrektur wie V-trace?

Wenn Dutzende Actors asynchron laufen, stammen die gesendeten Daten von einer älteren Policy als der, die der Learner jetzt hat (Policy Lag). V-trace (Espeholt et al., 2018) wendet abgeschnittene Importance-Sampling-Gewichte an, damit die Wert-Targets trotz Mismatch (näherungsweise) erwartungstreu bleiben. Ein gutes Detail, um 'ich verstehe das Skalieren von RL' zu zeigen.

Section 08

MLOps und der Weg von Modellen in die Produktion to Warum sind spärliche, verzögerte Belohnungen eine Kernherausforderung im RL?

01

MLOps und der Weg von Modellen in die Produktion

Reproduzierbare Container, Cluster-Orchestrierung (Kubernetes, und KubeRay für Ray) sowie Experiment- und Modellversionierung sind das Rückgrat von MLOps. Erfolg in der Simulation hebt nie die Notwendigkeit realer Validierung auf, wegen der Sim-to-Real-Lücke (nächste Frage). Hier passt deine CI/CD- und Cloud-Deployment-Arbeit.

Guided checkpoint

Hier ist deine dmTECH-Erfahrung mit Docker, Terraform und CI/CD direkt relevant. Markiere jede Aussage.

02

Was ist die Sim-to-Real- (Realitäts-)Lücke?

Simulatoren nähern die Realität nur an, eine Policy kann sich also auf Eigenheiten überanpassen, die im Feld nicht existieren. Gegenmaßnahmen sind Domain Randomization (Physik, Sensorik, Erscheinung im Training variieren, damit die Policy generalisieren muss), höhere Modelltreue und Fine-Tuning in der Realität. Das ist eine zentrale Sorge, wenn die 'Übertragung akademischer Forschung auf reale Systeme' dein Job ist.

03

Warum sind spärliche, verzögerte Belohnungen eine Kernherausforderung im RL?

Kommt die Belohnung erst am Ende einer Episode, fällt es dem Agenten schwer zu wissen, welche der hunderten früheren Aktionen entscheidend war; das ist zeitliches Credit Assignment. Reward Shaping, Curriculum Learning, hierarchisches RL und intrinsische Motivation sind übliche Abhilfen.

Section 09

Warum RL in der Simulation statt direkt im realen System trainieren? to Typische C++/Python-Arbeitsteilung in einem Simulations- und RL-Stack

01

Warum RL in der Simulation statt direkt im realen System trainieren?

Simulation ist die natürliche Heimat von Verteidigungs-RL: Daten sind spärlich und sensibel, reale Exploration ist unsicher, und man kann tausende parallele Episoden starten. Was sie nicht liefert, ist ein Freifahrtschein für den Transfer, die Sim-to-Real-Lücke bleibt, weshalb Validierung wichtig ist.

Guided checkpoint

Die Ausschreibung hebt 'sicher, datensparsam und zuverlässig' hervor. Wähle alle zutreffenden Gründe.

02

Was macht StarCraft II zu einem nützlichen Benchmark für komplexes Multi-Agent-RL?

Teilweise Beobachtbarkeit, Echtzeitdruck, kombinatorische Aktionsräume, Multi-Agent-Dynamik und langfristige Planung machen StarCraft II zu einem anspruchsvollen RL-Benchmark. Es gibt keine vorausberechnete optimale Aktion pro Zustand; genau das muss der Agent lernen.

Guided checkpoint

Wähle alle Eigenschaften, die sich auf den operativen Kontext übertragen.

03

Typische C++/Python-Arbeitsteilung in einem Simulations- und RL-Stack

Üblich ist ein schneller C++-Simulationskern (oft mit Qt-Frontend), der über Bindings (z. B. pybind11) an Python angebunden wird, mit PyTorch/TensorFlow und RLlib auf der Python-Seite sowie NumPy/OpenCV für Daten und Vision. Sich an dieser Grenze sicher zu bewegen ist angesichts deiner produktionsnahen Python-Erfahrung eine konkrete Stärke.

Guided checkpoint

Die Ausschreibung verlangt C++ und Python sowie NumPy, OpenCV und Qt. Wie wird üblicherweise aufgeteilt?

Knowledge check

Turn understanding into recall.

The quiz now follows the same concepts in scored form. You can return to this lesson from the quiz whenever a gap appears.