URI | http://purl.tuc.gr/dl/dias/52EF7270-E7E6-47C1-A576-5044960EE29D | - |
Αναγνωριστικό | https://doi.org/10.26233/heallink.tuc.92838 | - |
Γλώσσα | en | - |
Μέγεθος | 72 pages | en |
Μέγεθος | 1.7 megabytes | en |
Τίτλος | Extreme-Scale online machine learning on stream processing platforms | en |
Τίτλος | Μεγάλης κλίμακας συνεχής μηχανική μάθηση σε πλατφόρμες επεξεργασίας ροών δεδομένων | el |
Δημιουργός | Konidaris Vissarion-Bertcholnt | en |
Δημιουργός | Κονιδαρης Βησσαριων-Μπερτχολντ | el |
Συντελεστής [Επιβλέπων Καθηγητής] | Samoladas Vasilis | en |
Συντελεστής [Επιβλέπων Καθηγητής] | Σαμολαδας Βασιλης | el |
Συντελεστής [Μέλος Εξεταστικής Επιτροπής] | Garofalakis Minos | en |
Συντελεστής [Μέλος Εξεταστικής Επιτροπής] | Γαροφαλακης Μινως | el |
Συντελεστής [Μέλος Εξεταστικής Επιτροπής] | Lagoudakis Michail | en |
Συντελεστής [Μέλος Εξεταστικής Επιτροπής] | Λαγουδακης Μιχαηλ | el |
Εκδότης | Πολυτεχνείο Κρήτης | el |
Εκδότης | Technical University of Crete | en |
Ακαδημαϊκή Μονάδα | Technical University of Crete::School of Electrical and Computer Engineering | en |
Ακαδημαϊκή Μονάδα | Πολυτεχνείο Κρήτης::Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών | el |
Περιγραφή | Μεταπτυχιακή διατριβή που υποβλήθηκε στη σχολή ΗΜΜΥ Πολυτεχνείου Κρήτης για τη πλήρωση προυποθέσεων λήψης του Μεταπτυχιακού Διπλώματος Ειδίκευσης | el |
Περίληψη | Online Machine Learning (OML) techniques support training over continuous unbounded training items while simultaneously providing predictions on the same or another unlabeled stream. The explosion in the amount and complexity of digital information generated online is gradually rendering OML techniques essential for modern analytics and forecasting applications due to their ability to handle massive, unbounded, and most importantly, inherently not-static data. Having noted that support for popular Machine Learning (ML) toolchains is somewhat weak for the OML setting, we have designed the Online Machine Learning and Data Mining (OMLDM) component, a state-of-the-art engine for effortlessly deploying OML pipelines on streaming platforms. Our prototype, built on Apache Flink, validates our architecture, and identifies issues that current streaming platforms should improve on to support OML. To achieve high performance, OMLDM supports distributed online learning by utilizing the Parameter Server paradigm. We have identified the communication cost of synchronizing distributed learners as the major impediment to scalability. To overcome this obstacle, our proposed engine supports several popular model synchronization strategies. In addition, we bring forward and evaluate a novel synchronization strategy, Functional Dynamic Averaging (FDA), that minimizes the prediction loss and network communication all at once. We demonstrate through experiments that FDA is superior to current model synchronization strategies in many settings. | en |
Περίληψη | Οι αλγόριθμοι συνεχούς μηχανικής μάθησης υποστηρίζουν την δυνατότητα εκπαίδευσης πάνω σε συνεχόμενες και απεριόριστες ροές δεδομένων, ενώ ταυτόχρονα είναι ικανοί να παρέχουν προβλέψεις σε επιπλέον ροές δεδομένων χωρίς ετικέτες. Η αύξηση του όγκου και της πολυπλοκότητας των ψηφιακών δεδομένων που παράγεται καθημερινώς είναι εκρηκτική. Με τη παραγωγή τους να είναι κατανεμημένη, αδιάλειπτη και πρωτίστως μη στατική, οι αλγόριθμοι συνεχούς μηχανικής μάθησης αποτελούν πια ουσιώδεις και αναγκαίες τεχνικές για τις σύγχρονες εφαρμογές παροχής αναλύσεων και προβλέψεων. Παρακινούμενοι από την χαμηλή υποστήριξη δημοφιλών προγραμματιστικών εργαλείων σε θέματα συνεχούς μηχανικής μάθησης, υλοποιήσαμε το εργαλείο Online Machine Learning and Data Mining (OMLDM), ένα εργαλείο σύγχρονης τεχνολογίας ικανό να αναπτύξει κατανεμημένους αλγορίθμους συνεχούς μηχανικής μάθησης σε πλατφόρμες επεξεργασίας ροών δεδομένων. Για λόγους υψηλής απόδοσης, η υλοποίησή μας έγινε πάνω σε μοντέρνα συστήματα ανάλυσης μεγάλων δεδομένων όπως Apache Flink και Apache Kafka, χρησιμοποιώντας την αρχιτεκτονική του διακομιστή παραμέτρων, ή αλλιώς το μοντέλο παραλληλισμού δεδομένων. Παρατηρήσαμε πως η δικτυακή επικοινωνία για τον συγχρονισμό παράλληλων μοντέλων αποτελεί το μεγαλύτερο εμπόδιο για την αύξηση του παραλληλισμού των εν λόγο συστημάτων. Για αυτό το λόγο, υλοποιήσαμε στο εργαλείο OMLDM μια πληθώρα από μοντέρνες τεχνικές συγχρονισμού κατανεμημένων μοντέλων. Επιπροσθέτως, παρουσιάζουμε μέσω του εργαλείου μια καινούργια τεχνική συγχρονισμού, την Functional Dynamic Averaging (FDA), για την οποία αποδεικνύουμε πειραματικά ότι ελαχιστοποιεί την επικοινωνία μεταξύ κατανεμημένων μοντέλων διατηρώντας υψηλή απόδοση προβλέψεων. | el |
Τύπος | Μεταπτυχιακή Διατριβή | el |
Τύπος | Master Thesis | en |
Άδεια Χρήσης | http://creativecommons.org/licenses/by-nc/4.0/ | en |
Ημερομηνία | 2022-07-21 | - |
Ημερομηνία Δημοσίευσης | 2022 | - |
Θεματική Κατηγορία | Big data | en |
Θεματική Κατηγορία | Μηχανική μάθηση | el |
Θεματική Κατηγορία | Machine learning | el |
Θεματική Κατηγορία | Online machine learning | en |
Θεματική Κατηγορία | Cloud computing | en |
Θεματική Κατηγορία | Καταμεμημένα συστήματα | el |
Θεματική Κατηγορία | Distributed systems | en |
Θεματική Κατηγορία | Streaming data | en |
Θεματική Κατηγορία | Ροές δεδομένων | el |
Θεματική Κατηγορία | Cluster computing | en |
Βιβλιογραφική Αναφορά | Vissarion-Bertcholnt Konidaris, "Extreme-Scale online machine learning on stream processing platforms", Master Thesis, School of Electrical and Computer Engineering, Technical University of Crete, Chania, Greece, 2022 | en |
Βιβλιογραφική Αναφορά | Βησσαρίων-Μπέρτχολντ Κονιδάρης, "Μεγάλης κλίμακας συνεχής μηχανική μάθηση σε πλατφόρμες επεξεργασίας ροών δεδομένων", Μεταπτυχιακή Διατριβή, Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών, Πολυτεχνείο Κρήτης, Χανιά, Ελλάς, 2022 | el |