Logga in

Registrera

EL2805 · Kungliga Tekniska högskolan

Reinforcement learning

5 tentor27 ämnen

Kom igång gratis

Kursinnehåll

Applications

7 uppgifter

Cart-pole

1 uppgifter

Chapman-Kolmogorov

1 uppgifter

Computer

1 uppgifter

Dice

3 uppgifter

Vad ingår?

0 uppgifter

Sorterat efter ämne och svårighet, direkt från tentor.

5 tentor med lösningar

Alla tidigare tentor samlade, öva på riktiga examensfrågor.

AI-handledare (KAI)

Få steg-för-steg-hjälp dygnet runt, skräddarsydd för den här kursen.

0 studieplaner

Personliga studieplaner som anpassar sig till dina framsteg.

Generera tester

Skapa anpassade övningstester baserat på ämne och svårighet.

Framstegsanalys

Se vad du vet, vad du behöver granska och vad som finns kvar.

Kurs info

KurssidaKursplan
HP
7.5
Språk
Svenska
Nivå
Avancerad nivå
Fakultet
Skolan för elektroteknik och datavetenskap
Institution
EECS/Intelligenta system

Lärandemål

Efter godkänd kurs ska studenten kunna

  • noggrant formulera stokastiska reglerproblem som Markovbeslutsprocessproblem (MDP), klassificera motsvarande problem och utvärdera deras spårbarhet
  • ange principen om optimalitet i ändlig tid och oändlig tidshorisont för MDP, och lösa MDP med hjälp av dynamisk programmering
  • härleda lösningar till MDP genom att använda värde- och policyiterationer
  • lösa reglerproblem för system vars dynamik måste läras med Q-learning och SARSA-algoritmer
  • förklara skillnaden mellan on-policy- och off-policy-algoritmer
  • utveckla och implementera RL-algoritmer med funktionsapproximation (till exempel djupa RL-algoritmer där Q-funktionen approximeras av utgången från ett neuralt nätverk)
  • lösa banditoptimeringsproblem.
Kursinnehåll
Kursen ger en djupgående behandling av de moderna teoretiska verktygen som används för att utforma och analysera förstärkande inlärningsalgoritmer (RL-algoritmer). Den innehåller en introduktion till RL och dess klassiska algoritmer som Q-learning och SARSA, och presenterar vidare motiveringen bakom utformningen av de senaste algoritmerna, såsom de slående optimala avvägningarna mellan prospektering och exploatering. Kursen täcker även algoritmer som används i de senaste framgångshistorierna för RL, t.ex. djupa RL-algoritmer. Markovkedjor, Markovbeslutsprocessproblem (MDP), dynamisk programmering, värde- och policyiterationer, utformning av approximativa regulatorer för MDP, stokastisk linjär kvadratisk reglering, Multi-Armed Bandit-problemet, RL-algoritmer (Q-learning, Q-learning med funktionsapproximation).
Förutsättningar
  • För fristående kursstuderande: 120 hp samt dokumenterade kunskaper i engelska B eller motsvarande.
Litteratur

Saknas

Redo att boosta dina studier?

Gör som 15 000+ studenter och ta kontroll över ditt tentaplugg.

Kom igång gratis

Produkt

  • Priser

  • Karriär

Företag

  • Om oss

  • Blogg

  • Användarvillkor

  • Integritet

  • Support

Universitet

  • KTH

  • Uppsala universitet

  • Linköpings universitet

  • Chalmers

  • Lunds universitet

  • Luleå tekniska universitet

  • Stockholms universitet

  • Gymnasiet

Socialt

  • Instagram

  • Facebook

  • YouTube

  • TikTok

  • Linkedin

© 2026 Crash Course Sverige AB