BERT МОДЕЛІ МЕН ЗЕЙІН МЕХАНИЗМДЕРІ НЕГІЗІНДЕ ҚАЗАҚ ТІЛІНДЕГІ БЕЙӘДЕП СӨЗДЕРДІ АНЫҚТАУ
DOI:
https://doi.org/10.56132/2791-3368-2026-1-65-71-82Кілт сөздер:
Bert моделі, бейәдеп сөздер, зейін механизімі, әлеуметтік желі, онлайн контент, қазақ тілді сөздер корпусы, Files KappaАңдатпа
Бұл зерттеу мақалада қазақ тіліндегі әлеуметтік желілердегі бейәдеп сөздер мен агрессивті пікірлерді автоматты түрде анықтау әдістері қарастырылады. Зерттеудің өзектілігі желідегі бейәдеп тілді пікірлер көлемінің артуымен және ресурстары шектеулі тілдер үшін тиімді автоматтандырылған шешімдердің аздығымен байланысты. Қазақ тілі күрделі морфологиясымен және контекстік ерекшелігімен сипатталады, бұл дәстүрлі табиғи тілді өңдеу әдістерін қолдануды қиындық туыдрады. Ұсынылып отырған зерттеу жұмысында көп басты (multihead) зейін механизмі мен конволюциялық нейрондық желілерді біріктіре отырып, BERT трансформатор архитектурасына негізделген гибридті модель ұсынылады. Бұл архитектура бейәдеп тілді текстерді, соның ішінде курсанттар мен офицерлер талқылайтын онлайн пікірлердегі ашық және жасырын түрлерін тиімді анықтауға мүмкіндік береді. Модельді оқыту және тестілеу үшін сарапшылар аннотациялаған қазақ тіліндегі пікірлердің корпусы құрастырылды, оған курсанттар, командирлер және жеке құрам арасындағы пікірлер де енгізілді. Аңдатпа сапасы Флейсстің Каппа коэффициентін пайдаланып бағаланды, ол 0,6649 берді, жалпы келісім деңгейі 91,67%, бұл деректердің жоғары сенімділігін көрсетеді. Тәжірибелік нәтижелер ұсынылған модельдің дәлдік, F1-ұпай және ROC-AUC бойынша базалық әдістерден (Naive Bayes, LSTM, FastText) асып түсетінін көрсетті. Нәтижесінде алынған ROC-AUC мәні 0,95 болды. Зерттеу нәтижелері қазақ тіліндегі ғадауат тілді сөздерді анықтауға арналған назар аудару механизмі бар трансформаторлық модельдердің тиімділігін растайды және оларды автоматтандырылған мазмұнды модерациялау және ақпараттық қауіпсіздікті бақылау жүйелерін әзірлеуде пайдалануға болады.
##plugins.themes.default.displayStats.downloads##
Әдебиеттер тізімі
1. C. Van Hee, G. Jacobs, C. Emmery, B. Desmet, E. Lefever and B.Verhoeven, «Automatic detection of cyberbullying in social media text.» PloS one 13.10 (2018): e0203794.
2. G. Valle-Cano, «SocialHaterBERT: A dichotomous approach for automatically detecting hate speech on Twitter through textual analysis and user profiles» Expert Systems with Applications 216 (2023): 119446.
3. S. Mombekova, S. Akhmetova, G. Shaimerdenova, S. Alisheva, E. Mussirepova, A. Kydyrbekova and N. Torebay, «Eco-efficient industrial processes: Leveraging ai-powered management for reduced environmental footprint.» E3S Web of Conferences. Vol. 614. EDP Sciences, 2025.
4. K. Kumari, J.P. Singh, Y.K. Dwivedi and N.P. Rana, «Towards Cyberbullying-free social media in smart cities: a unified multi-modal approach» Soft computing 24 (2020): 11059-11070.
5. H. Elzayady, M.S. Mohamed, K.M. Badran, and G.I. Salama, «A hybrid approach based on personality traits for hate speech detection in Arabic social media» International Journal of Electrical and Computer Engineering 13.2 (2023): 1979.
6. Z. Makhanova, G. Beissenova, A. Madiyarova, M. Chazhabayeva, G. Mambetaliyev, M. Suimenova and A. Baiburin, «A Deep Residual Network Designed for Detecting Cracks in Buildings of Historical Significance.» International Journal of Advanced Computer Science & Applications 15.5 (2024).
7. J.L.Wang, L.A. Jackson, J. Gaskin and H.Z. Wang»The effects of Social Networking Site (SNS) use on college students’ friendship and well-being» Computers in Human Behavior 37 (2014): 229-236.
8. A. Toktarova, A. Abushakhma, E. Adylbekova, A. Manapova, B. Kaldarova and Y.Atayev, «Offensive language identification in low resource languages using bidirectional long-short-term memory network.» International Journal of Advanced Computer Science and Applications 14.6 (2023).
9. M. Rezvan, S. Shekarpour, L. Balasuriya and K. Thirunarayan, «A quality type-aware annotated corpus and lexicon for harassment research» Proceedings of the 10th acm conference on web science. 2018.
10. B.A. Talpur and O. Declan, «Cyberbullying severity detection: A machine learning approach» PloS one 15.10 (2020): e0240924.
11. A. Toktarova, D. Sultan, and Zh. Azhibekova, «Review of Machine Learning Models in Cyberbullying Detection Problem» 2024 IEEE 4th International Conference on Smart Information Systems and Technologies (SIST). IEEE, 2024.
12. C. Comito, F. Agostino, and C. Pizzuti, «Word embedding based clustering to detect topics in social media» IEEE/WIC/ACM International Conference on Web Intelligence. 2019.
