ΑΥΤΟΜΑΤΗ ΑΝΑΓΝΩΡΙΣΗ ΟΡΘΟΓΡΑΦΙΚΩΝ ΛΑΘΩΝ ΣΤΗΝ ΕΛΛΗΝΙΚΗ ΓΛΩΣΣΑ
Date Issued
February 12, 2019
Type
Πτυχιακή Εργασία
Abstract
Η παρούσα πτυχιακή εργασία μελετά την αυτόματη διόρθωση ορθογραφικών λαθών στην ελληνική γλώσσα. Πιο συγκεκριμένα, εξετάζει τα πολύ συνηθισμένα λάθη στον ελληνικό γραπτό λόγο που προέρχονται από τη λανθασμένη τοποθέτηση των λέξεων «πού-που» και «πώς-πως» σε μια φράση. Αν και η χρήση της λέξης «πού» στη θέση του «που», ή αντίστροφα, είναι λανθασμένη, όπως και η χρήση του «πώς» στη θέση του «πως», ή αντίστροφα, τα λάθη αυτά δεν είναι ανιχνεύσιμα από ένα λογισμικό επεξεργασίας κειμένου, καθώς δεν αφορούν αυστηρά την ορθογραφία των λέξεων αλλά προκύπτουν από τη σημασία τους. Έτσι, με βάση το ελληνικό επισημειωμένο σώμα κειμένων DELOS, επιχειρείται η εξόρυξη γνώσης για τα λάθη αυτά.
Για το σκοπό αυτό, το σώμα κειμένων τοποθετήθηκε σε μια βάση δεδομένων, για την ευκολότερη πρόσβαση στις πληροφορίες αυτού οι οποίες ήταν χρήσιμες για τη μελέτη. Έπειτα, δημιουργήθηκαν τα datasets, πάνω στα οποία πραγματοποιήθηκε η μηχανική μάθηση, μέσω του λογισμικού WEKA. Οι ταξινομητές που χρησιμοποιήθηκαν ήταν οι ZeroR, Naive Bayes, Id3, J48 και Random Forest. Επίσης, υπήρξε πειραματισμός ανάμεσα στα αρχικά datasets και την εξισορροπημένη μορφή τους, η οποία δημιουργήθηκε από την εφαρμογή του φίλτρου SMOTE, αλλά και μεταξύ των παραθύρων λέξεων, καθώς κάποια datasets περιείχαν την προηγούμενη και την επόμενη λέξη της λέξης-στόχου και άλλα περιείχαν τις δύο προηγούμενες και τις δύο επόμενες λέξεις της λέξης-στόχου.
Subjects
