Ενισχυτική Μηχανική Μάθηση και Στοχαστικά Παίγνια

Εξάμηνο:
7ο
Τύπος Μαθήματος:
Προαιρετικό (ΠΜ)
Κατεύθυνση:
-
Κωδικός:
ΕΠ25
ECTS:
6
Διδακτικές Ώρες
Ώρες Θεωρίας:
4
Ώρες Φροντιστηρίου:
-
Ώρες Εργαστηρίου:
-
Μάθημα στις Ειδικεύσεις
Θεμελιώσεις Πληροφορικής (S1):
-
Διαχείριση Δεδομένων και Γνώσης (S2):
-
Λογισμικό (S3):
-
Υλικό και Αρχιτεκτονική (S4):
-
Επικοινωνίες και Δικτύωση (S5):
-
Επεξεργασία Σήματος και Πληροφορίας (S6):
-
Σχετικά Μαθήματα
Σύντομη περιγραφή Μαθήματος

Το μάθημα εξετάζει την ακόλουθη ερώτηση: Πώς μπορεί ένας πράκτορας (agent) να μάθει να ενεργεί για την επίτευξη κάποιου σκοπού σε ένα δυναμικό, αβέβαιο και μερικώς παρατηρήσιμο περιβάλλον, πιθανώς υπό την παρουσία και άλλων δρώντων πρακτόρων; Το ερώτημα αυτό κι οι ειδικότερες εκδοχές του (ένας πράκτορας, γνώση του περιβάλλοντος, στοχαστικότητα, μάθηση με χρήση πρότερης γνώσης, κοινός σκοπός και συντονισμός ενεργειών των μονάδων) έχει κεντρικό ενδιαφέρον σε ένα μεγάλο φάσμα επιστημονικών περιοχών και εφαρμογών, όπως η υπολογιστική όραση, ρομποτική, αυτόνομη οδήγηση, επεξεργασία φυσικής γλώσσας, παιχνίδια (επιτραπέζια, παιχνίδια με τράπουλες, βίντεο), και στα ασύρματα συστήματα επικοινωνιών και δίκτυα.

Το μάθημα επικεντρώνει στη θεωρία, τις μεθόδους και τους αλγορίθμους της ενισχυτικής μηχανικής μάθησης (reinforcement learning) που απαντούν στο παραπάνω ερώτημα. Στοχεύοντας σε πλείστες περιπτώσεις όπου η αλληλεπίδραση μεταξύ των πρακτόρων και του περιβάλλοντος στο οποίο αυτοί ενεργούν είναι συνεχής, η βασική θεώρηση του μαθήματος είναι ότι οι πράκτορες παρατηρούν την κατάσταση του περιβάλλοντος μέσω σχετικών μετρήσεων και έμμεσα αντλούν πληροφορίες για τις ενέργειες των άλλων πρακτόρων. Κάποια στοιχεία πληροφορίας είναι κοινά σε όλους τους πράκτορες, άλλα συνιστούν ιδιωτική πληροφόρηση. Με βάση τις παρατηρήσεις που έχει στη διάθεσή του, κάθε πράκτορας επιλέγει μια ενέργεια και την εκτελεί. Η κατάσταση του περιβάλλοντος μεταβάλλεται χρονικά και εν γένει με αβέβαιο (πιθανοτικό) τρόπο, ανάλογα με τη μέχρι εκείνη τη στιγμή εξέλιξή της και με βάση τις ενέργειεις των υπολοίπων πρακτόρων του συστήματος. Οι αποφάσεις κάθε πράκτορα λαμβάνονται σε αλλεπάλληλες χρονικές στιγμές και στηρίζονται σε κανόνες προτέρας εκμάθησης, κατά συνέπεια η μηχανική μάθηση είναι ακολουθιακή. Ο κύκλος αυτός επαναλαμβάνεται συνεχώς επιτρέποντας στους πράκτορες να μαθαίνουν το τρόπο ενεργειών τους ώστε να βελτιώνουν, όχι μόνο τη στιγμιαία ανταμοιβή, αλλά το συνολικό μακροπρόθεσμο όφελος/απόδοσή τους.

Οι θεματικές ενότητες του μαθήματος:

  • Προβλήματα πολλαπλών ληστών (με ή χωρίς περιεχόμενο) που απλοποιούν τη διαδικασία αποφάσεων.
  • Μαρκοβιανές διαδικασίες απόφασης (Markov decision processes - MDPs) με γνωστά (πιθανώς στοχαστικά) μοντέλα συστήματος, υπό τη σκοπιά του δυναμικού προγραμματισμού και των εξισώσεων Bellman, επεκτείνοντας τα υπό μελέτη προβλήματα σε περιπτώσεις μερικώς-παρατηρήσιμων MDPs (partially observable MDPs - POMDPs).
  • Αλγόριθμοι εύρεσης βέλτιστων πολιτικών (Q-learning, Monte Carlo/REINFORCE) σε περιπτώσεις απουσίας γνώσης του μοντέλου περιβάλλοντος.
  • Αλγόριθμοι βαθιάς ενισχυτικής μηχανικής μάθησης που μαθαίνουν προσεγγιστικά βέλτιστες αποφάσεις με τη χρήση τεχνητών νευρωνικών δικτύων.
  • Επέκταση αλγορίθμων βαθιάς ενισχυτικής μηχανικής μάθησης ως «μοντέλα κόσμου» καθώς και σε περιβάλλοντα πολλαπλών πρακτόρων με συναδελφικότητα ή αντιπαλότητα.
  • Προγραμματιστικά περιβάλλοντα υλοποίησης αλγορίθμων βαθιάς ενισχυτικής μηχανικής μάθησης σε Python/Pytorch με τη χρήση βιβλιοθηκών Gymnasium και Stable Baselines.
Βιβλιογραφία
  1. “Reinforcement Learning: An Introduction,” R. S. Sutton and A. G. Barto, MIT Press, Cambridge, MA, 2018.
  2. “Dynamic Programming and Optimal Control,” D. P. Bertsekas, Athena Scientific, 4th edition, 2007.
  3. “Reinforcement Learning: State-of-the-Art,” M. Wiering and M. Otterlo, Springer Berlin, Heidelberg, 2012.