Методи векторизації слів при обробці текстових даних
Вантажиться...
Дата
Автори
ORCID
DOI
Науковий ступінь
Рівень дисертації
Шифр та назва спеціальності
Рада захисту
Установа захисту
Науковий керівник/консультант
Члени комітету
Назва журналу
Номер ISSN
Назва тому
Видавець
Харків : Харківський національний університет імені В. Н. Каразіна
Анотація
Мета роботи: дослідження та порівняльний аналіз методів векторизації слів, визначення їх ефективності на прикладі задачі класифікації тексту, оцінка впливу донавчання нейромережевих методів на якість їх векторів, розробка програмного продукту у вигляді телеграм-бота для пошуку цитат відомих людей з використанням найбільш ефективного алгоритму векторизації. Об'єкт дослідження: процеси обробки та аналізу текстових даних у контексті вирішення задач природної обробки мови. Методи дослідження: аналіз, порівняння, розбір, опис. Використані програмно-апаратні рішення: Python, scikit-learn, Transformers, NLTK, Aiogram, Matplotlib, TensorBoard. Результати: проведено комплексне дослідження методів векторизації слів від класичних статистичних підходів (Bag of Words, TF-IDF) до сучасних нейромережевих архітектур (Word2Vec, BERT). Експериментально підтверджено перевагу донавченої моделі BERT для критично важливих застосувань, оптимальність Word2Vec для систем реального часу та актуальність TF-IDF для ресурсо-обмежених середовищ. Розроблено та впроваджено Telegram-бот для семантичного пошуку цитат, що демонструє високу якість результатів при адекватному часу відповіді.
Objective: research and comparative analysis of word vectorization methods, determination of their effectiveness on the example of the text classification problem, assessment of the impact of additional training of neural network methods on the quality of their vectors, development of a software product in the form of a telegram bot for searching for quotes of famous people using the most effective vectorization algorithm. Object of research: processes of processing and analysis of text data in the context of solving natural language processing problems. Research methods: analysis, comparison, analysis, description. Software and hardware solutions used: Python, scikit-learn, Transformers, NLTK, Aiogram, Matplotlib, TensorBoard. Results: a comprehensive study of word vectorization methods from classical statistical approaches (Bag of Words, TF-IDF) to modern neural network architectures (Word2Vec, BERT) was conducted. The advantage of the pre-trained BERT model for critical applications, the optimality of Word2Vec for real-time systems, and the relevance of TF-IDF for resource-constrained environments have been experimentally confirmed. A Telegram bot for semantic citation search has been developed and implemented, demonstrating high quality results with adequate response time.
Objective: research and comparative analysis of word vectorization methods, determination of their effectiveness on the example of the text classification problem, assessment of the impact of additional training of neural network methods on the quality of their vectors, development of a software product in the form of a telegram bot for searching for quotes of famous people using the most effective vectorization algorithm. Object of research: processes of processing and analysis of text data in the context of solving natural language processing problems. Research methods: analysis, comparison, analysis, description. Software and hardware solutions used: Python, scikit-learn, Transformers, NLTK, Aiogram, Matplotlib, TensorBoard. Results: a comprehensive study of word vectorization methods from classical statistical approaches (Bag of Words, TF-IDF) to modern neural network architectures (Word2Vec, BERT) was conducted. The advantage of the pre-trained BERT model for critical applications, the optimality of Word2Vec for real-time systems, and the relevance of TF-IDF for resource-constrained environments have been experimentally confirmed. A Telegram bot for semantic citation search has been developed and implemented, demonstrating high quality results with adequate response time.
Опис
Керівник: Шматков Сергій Ігоревич, доктор наук, професор, професор кафедри комп'ютерних систем та робототехніки
Бібліографічний опис
Мішуров, Михайло Сергійович. Методи векторизації слів при обробці текстових даних : кваліфікаційна робота бакалавра : спеціальність 122 – Комп'ютерні науки : освітня програма «Комп'ютерні науки» / М. С. Мішуров ; кер. роботи С. І. Шматков. – Харків : Харківський національний університет імені В. Н. Каразіна, 2025. – 53 с.
