Ανάπτυξη εργαλείου αναγνώρισης μερών του λόγου για την ελληνική γλώσσα του κοινωνικού ιστού
Date Issued
September 26, 2019
Type
Πτυχιακή Εργασία
Abstract
Ο μεγάλος όγκος επικοινωνίας μέσω μηνυμάτων τύπου microblogging στα κοινωνικά δίκτυα έχει δημιουργήσει την ανάγκη για αποδοτικά εργαλεία Natural Language Processing (NLP), ειδικά στην επεξεργασία αδόμητου κειμένου. Η εξαγωγή πληροφοριών από social text αποτελεί μία από τις πιο απαιτητικές εργασίες NLP. Στην παρούσα έρευνα αναπτύχθηκε το πρώτο μέχρι στιγμής εργαλείο αναγνώρισης μερών του λόγου για την ελληνική γλώσσα του κοινωνικού ιστού. Η καινοτομία της έρευνας είναι εμφανής σε κάθε στάδιό της, από τη συλλογή και την επισημείωση ως προς τα μέρη του λόγου των δεδομένων (2405 tweets), έως τα αποτελέσματα των δοκιμών με τους αλγορίθμους επιβλεπόμενης μηχανικής μάθησης. Το εργαλείο αυτό, λόγω της υψηλής απόδοσής του στις δοκιμές με τους αλγορίθμους Naive Bayes (accuracy 99.87%) και ID3 (accuracy 99.44%), έχει προοπτική να χρησιμοποιηθεί ως βάση για μελλοντική έρευνα στο πεδίο της αναγνώρισης μερών του λόγου για δεδομένα τύπου microblogging στα ελληνικά από το κοινωνικό δίκτυο Twitter, αλλά και από άλλα κοινωνικά δίκτυα.
Subjects
