Learning objectives
What you will be able to explain
- Wie ist ein Markov-Entscheidungsprozess (MDP) formal definiert?
- Was besagt die Markov-Eigenschaft?
- Welche Rolle spielt der Diskontierungsfaktor ?
- Berechne den diskontierten Return
- Ordne jede RL-Größe ihrer Definition zu
- Was drückt die Bellman-Gleichung aus?
Section 01
Wie ist ein Markov-Entscheidungsprozess (MDP) formal definiert? to Welche Rolle spielt der Diskontierungsfaktor ?
01
Wie ist ein Markov-Entscheidungsprozess (MDP) formal definiert?
Guided checkpoint
RL-Probleme werden häufig als MDP formuliert. Identifiziere zuerst die formalen Komponenten und das Optimierungsziel.
02
Was besagt die Markov-Eigenschaft?
03
Welche Rolle spielt der Diskontierungsfaktor ?
Guided checkpoint
Es gelte .
Section 02
Berechne den diskontierten Return to Was drückt die Bellman-Gleichung aus?
01
Berechne den diskontierten Return
Guided checkpoint
Verwende , wobei die Belohnung zum Zeitpunkt mit diskontiert wird.
- Fall A: Der Agent erhält zu jedem Zeitschritt für immer die Belohnung , mit .
- Fall B: Die Belohnungen sind , , , danach endet die Episode, mit .
02
Ordne jede RL-Größe ihrer Definition zu
Guided checkpoint
Wähle den Begriff, den jede Beschreibung definiert.
03
Was drückt die Bellman-Gleichung aus?
Section 03
Sortiere die Algorithmen: on-policy vs. off-policy to Ordne jeden Algorithmus seiner Methodenfamilie zu
01
Sortiere die Algorithmen: on-policy vs. off-policy
Guided checkpoint
On-policy-Verfahren lernen über dieselbe Policy, die die Daten erzeugt. Off-policy-Verfahren können eine Ziel-Policy aus Daten lernen, die von einer anderen Verhaltens-Policy stammen (das macht Replay Buffer erst möglich).
02
Was unterscheidet off-policy von on-policy RL?
03
Ordne jeden Algorithmus seiner Methodenfamilie zu
Guided checkpoint
Wähle die Familie, die den jeweiligen repräsentativen Algorithmus am besten beschreibt.
Section 04
Modellfrei vs. modellbasiert, und Exploration to Welche Aussagen über PPO sind korrekt?
01
Modellfrei vs. modellbasiert, und Exploration
Guided checkpoint
Markiere jede Aussage als wahr oder falsch.
02
Was ist der Exploration-Exploitation-Trade-off?
03
Welche Aussagen über PPO sind korrekt?
Guided checkpoint
PPO ist das Verfahren, nach dem das Team am wahrscheinlichsten fragt. Wähle alle zutreffenden Aussagen.
Section 05
Warum clippt PPO das Wahrscheinlichkeitsverhältnis? to Wie wurde die Policy von AlphaStar vor dem Reinforcement Learning initialisiert?
01
Warum clippt PPO das Wahrscheinlichkeitsverhältnis?
02
Warum nutzt man eine Advantage-Funktion bzw. Baseline in Policy-Gradient-Verfahren?
03
Wie wurde die Policy von AlphaStar vor dem Reinforcement Learning initialisiert?
Guided checkpoint
Die Stellenausschreibung nennt den Einsatz von AlphaStar-Techniken, also ist mit Fragen dazu zu rechnen.
Section 06
Welche Aussagen über das League-Training von AlphaStar sind korrekt? to Partielle Beobachtbarkeit und Entscheidungsfindung unter Unsicherheit
01
Welche Aussagen über das League-Training von AlphaStar sind korrekt?
Guided checkpoint
Wähle alle zutreffenden Aussagen.
02
Warum eine vielfältige League statt naivem Self-Play gegen den neuesten Agenten?
03
Partielle Beobachtbarkeit und Entscheidungsfindung unter Unsicherheit
Guided checkpoint
Die Ausschreibung betont 'Entscheidungsfindung unter unsicheren Bedingungen'. Wie wird verdeckter Zustand behandelt?
Section 07
Verteiltes RL: Ordne jede Komponente ihrer Rolle zu to Warum brauchen große Actor-Learner-Setups (z. B. IMPALA) eine off-policy Korrektur wie V-trace?
01
Verteiltes RL: Ordne jede Komponente ihrer Rolle zu
Guided checkpoint
Die Ausschreibung nennt Ray ausdrücklich. Ordne jeden Teil eines Ray/RLlib-artigen Trainingsstacks seiner Funktion zu.
02
Warum ist verteiltes Rechnen (z. B. Ray) für Deep RL besonders wertvoll?
03
Warum brauchen große Actor-Learner-Setups (z. B. IMPALA) eine off-policy Korrektur wie V-trace?
Section 08
MLOps und der Weg von Modellen in die Produktion to Warum sind spärliche, verzögerte Belohnungen eine Kernherausforderung im RL?
01
MLOps und der Weg von Modellen in die Produktion
Guided checkpoint
Hier ist deine dmTECH-Erfahrung mit Docker, Terraform und CI/CD direkt relevant. Markiere jede Aussage.
02
Was ist die Sim-to-Real- (Realitäts-)Lücke?
03
Warum sind spärliche, verzögerte Belohnungen eine Kernherausforderung im RL?
Section 09
Warum RL in der Simulation statt direkt im realen System trainieren? to Typische C++/Python-Arbeitsteilung in einem Simulations- und RL-Stack
01
Warum RL in der Simulation statt direkt im realen System trainieren?
Guided checkpoint
Die Ausschreibung hebt 'sicher, datensparsam und zuverlässig' hervor. Wähle alle zutreffenden Gründe.
02
Was macht StarCraft II zu einem nützlichen Benchmark für komplexes Multi-Agent-RL?
Guided checkpoint
Wähle alle Eigenschaften, die sich auf den operativen Kontext übertragen.
03
Typische C++/Python-Arbeitsteilung in einem Simulations- und RL-Stack
Guided checkpoint
Die Ausschreibung verlangt C++ und Python sowie NumPy, OpenCV und Qt. Wie wird üblicherweise aufgeteilt?
Knowledge check
Turn understanding into recall.
The quiz now follows the same concepts in scored form. You can return to this lesson from the quiz whenever a gap appears.