ОБНАРУЖЕНИЕ ОСКОРБИТЕЛЬНОГО КОНТЕНТА С ИСПОЛЬЗОВАНИЕМ МОДЕЛИ BERT И МЕХАНИЗМОВ ВНИМАНИЯ
DOI:
https://doi.org/10.56132/2791-3368-2026-1-65-71-82Ключевые слова:
модель Берта, Files Kappa, онлайн-контент, социальная сеть, механизм внимания, нецензурные слова, корпус казахского языкаАннотация
В данной исследовательской работе рассматриваются методы автоматического обнаружения нецензурной лексики и агрессивных комментариев в казахских социальных сетях. Актуальность исследования обусловлена растущим объемом нецензурных комментариев в интернете и отсутствием эффективных автоматизированных решений для языков с ограниченными ресурсами. Казахский язык характеризуется сложной морфологией и контекстной спецификой, что затрудняет использование традиционных методов обработки естественного языка. В представленной исследовательской работе предложена гибридная модель на основе архитектуры трансформера BERT, сочетающая многоголовочный механизм внимания и сверточные нейронные сети. Эта архитектура позволяет эффективно выявлять нецензурные тексты, включая как явные, так и скрытые формы комментариев, обсуждаемых курсантами и офицерами онлайн. Для обучения и тестирования модели был создан корпус казахскоязычных комментариев, аннотированных экспертами, который включает мнения курсантов, командиров и личного состава. Качество аннотации оценивалось с помощью коэффициента Каппа Флейсса, который составил 0,6649, с общим уровнем согласованности 91,67%, что указывает на высокую надежность данных. Результаты экспериментов показали, что предложенная модель превосходит базовые методы (наивный байесовский классификатор, LSTM, FastText) по точности, F1-мере и ROC-AUC. Полученное значение ROC-AUC составило 0,95. Результаты исследования подтверждают эффективность трансформерных моделей с механизмом внимания для обнаружения ненормативной лексики в казахском языке и могут быть использованы при разработке автоматизированных систем модерации контента и мониторинга информационной безопасности.
Скачивания
Библиографические ссылки
1. C. Van Hee, G. Jacobs, C. Emmery, B. Desmet, E. Lefever and B.Verhoeven, «Automatic detection of cyberbullying in social media text.» PloS one 13.10 (2018): e0203794.
2. G. Valle-Cano, «SocialHaterBERT: A dichotomous approach for automatically detecting hate speech on Twitter through textual analysis and user profiles» Expert Systems with Applications 216 (2023): 119446.
3. S. Mombekova, S. Akhmetova, G. Shaimerdenova, S. Alisheva, E. Mussirepova, A. Kydyrbekova and N. Torebay, «Eco-efficient industrial processes: Leveraging ai-powered management for reduced environmental footprint.» E3S Web of Conferences. Vol. 614. EDP Sciences, 2025.
4. K. Kumari, J.P. Singh, Y.K. Dwivedi and N.P. Rana, «Towards Cyberbullying-free social media in smart cities: a unified multi-modal approach» Soft computing 24 (2020): 11059-11070.
5. H. Elzayady, M.S. Mohamed, K.M. Badran, and G.I. Salama, «A hybrid approach based on personality traits for hate speech detection in Arabic social media» International Journal of Electrical and Computer Engineering 13.2 (2023): 1979.
6. Z. Makhanova, G. Beissenova, A. Madiyarova, M. Chazhabayeva, G. Mambetaliyev, M. Suimenova and A. Baiburin, «A Deep Residual Network Designed for Detecting Cracks in Buildings of Historical Significance.» International Journal of Advanced Computer Science & Applications 15.5 (2024).
7. J.L.Wang, L.A. Jackson, J. Gaskin and H.Z. Wang»The effects of Social Networking Site (SNS) use on college students’ friendship and well-being» Computers in Human Behavior 37 (2014): 229-236.
8. A. Toktarova, A. Abushakhma, E. Adylbekova, A. Manapova, B. Kaldarova and Y.Atayev, «Offensive language identification in low resource languages using bidirectional long-short-term memory network.» International Journal of Advanced Computer Science and Applications 14.6 (2023).
9. M. Rezvan, S. Shekarpour, L. Balasuriya and K. Thirunarayan, «A quality type-aware annotated corpus and lexicon for harassment research» Proceedings of the 10th acm conference on web science. 2018.
10. B.A. Talpur and O. Declan, «Cyberbullying severity detection: A machine learning approach» PloS one 15.10 (2020): e0240924.
11. A. Toktarova, D. Sultan, and Zh. Azhibekova, «Review of Machine Learning Models in Cyberbullying Detection Problem» 2024 IEEE 4th International Conference on Smart Information Systems and Technologies (SIST). IEEE, 2024.
12. C. Comito, F. Agostino, and C. Pizzuti, «Word embedding based clustering to detect topics in social media» IEEE/WIC/ACM International Conference on Web Intelligence. 2019.
