<link rel="stylesheet" href="styles.f3b1fba60ec7970c.css">

Методи векторизації слів при обробці текстових даних

dc.contributor.authorМішуров, Михайло Сергійович
dc.date.accessioned2026-09-23T11:03:46Z
dc.date.issued2025
dc.descriptionКерівник: Шматков Сергій Ігоревич, доктор наук, професор, професор кафедри комп'ютерних систем та робототехніки
dc.description.abstractМета роботи: дослідження та порівняльний аналіз методів векторизації слів, визначення їх ефективності на прикладі задачі класифікації тексту, оцінка впливу донавчання нейромережевих методів на якість їх векторів, розробка програмного продукту у вигляді телеграм-бота для пошуку цитат відомих людей з використанням найбільш ефективного алгоритму векторизації. Об'єкт дослідження: процеси обробки та аналізу текстових даних у контексті вирішення задач природної обробки мови. Методи дослідження: аналіз, порівняння, розбір, опис. Використані програмно-апаратні рішення: Python, scikit-learn, Transformers, NLTK, Aiogram, Matplotlib, TensorBoard. Результати: проведено комплексне дослідження методів векторизації слів від класичних статистичних підходів (Bag of Words, TF-IDF) до сучасних нейромережевих архітектур (Word2Vec, BERT). Експериментально підтверджено перевагу донавченої моделі BERT для критично важливих застосувань, оптимальність Word2Vec для систем реального часу та актуальність TF-IDF для ресурсо-обмежених середовищ. Розроблено та впроваджено Telegram-бот для семантичного пошуку цитат, що демонструє високу якість результатів при адекватному часу відповіді.
dc.description.abstractObjective: research and comparative analysis of word vectorization methods, determination of their effectiveness on the example of the text classification problem, assessment of the impact of additional training of neural network methods on the quality of their vectors, development of a software product in the form of a telegram bot for searching for quotes of famous people using the most effective vectorization algorithm. Object of research: processes of processing and analysis of text data in the context of solving natural language processing problems. Research methods: analysis, comparison, analysis, description. Software and hardware solutions used: Python, scikit-learn, Transformers, NLTK, Aiogram, Matplotlib, TensorBoard. Results: a comprehensive study of word vectorization methods from classical statistical approaches (Bag of Words, TF-IDF) to modern neural network architectures (Word2Vec, BERT) was conducted. The advantage of the pre-trained BERT model for critical applications, the optimality of Word2Vec for real-time systems, and the relevance of TF-IDF for resource-constrained environments have been experimentally confirmed. A Telegram bot for semantic citation search has been developed and implemented, demonstrating high quality results with adequate response time.
dc.identifier.citationМішуров, Михайло Сергійович. Методи векторизації слів при обробці текстових даних : кваліфікаційна робота бакалавра : спеціальність 122 – Комп'ютерні науки : освітня програма «Комп'ютерні науки» / М. С. Мішуров ; кер. роботи С. І. Шматков. – Харків : Харківський національний університет імені В. Н. Каразіна, 2025. – 53 с.
dc.identifier.urihttps://ekhnuir.karazin.ua/handle/123456789/27029
dc.language.isouk
dc.publisherХарків : Харківський національний університет імені В. Н. Каразіна
dc.subjectTECHNOLOGY::Information technology::Computer science
dc.subjectNLP
dc.subjectвекторизація тексту
dc.subjectкласифікація тексту
dc.subjectBAG OF WORDS
dc.subjectTF-IDF
dc.subjectWORD2VEC
dc.subjectBERT
dc.subjectмашинне навчання
dc.subjectнейронні мережі
dc.subjectсемантичний пошук
dc.subjectTelegram бот
dc.subjecttext vectorization
dc.subjecttext classification
dc.subjectmachine learning
dc.subjectneural networks
dc.subjectsemantic search
dc.subjectTelegram bot
dc.titleМетоди векторизації слів при обробці текстових даних
dc.typeBachelor thesis

Файли

Контейнер файлів

Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Mishurov_Shmatkov_Diplom_2025.pdf
Розмір:
1,79 MB
Формат:
Adobe Portable Document Format