если не нужно, то оберни в pymorpy и забирай только сущности. Если по быстрому, можно просмотреть по частоте встречаемости слов сможешь убрать общие. Это уже существенно упростит.
Но с вордвеком не работал ещё особо, надо посмотреть, можно ли векторизовать сразу несколько слов. Навскидку кажется, что это не так работает. Раньше работал только с тематическим моделированием нескольких документов.
Меня именно "удостоверение электрика" сейчас напрягло. Можно в ворд2век, но все равно нужно будет взять основу типа удостоверения, а на выходе сделать древовидную структуру. Но тут уже нужно понимать твою конечную задачу.
Приношу глубочайшие извинения тем, кого задену очень базовым вопросом.
У меня есть список строк. Их полторы тысячи. Стоп-слова я позже уберу. Хочу кластеризовать строки по темам. На ум приходит просто взять и кластеризовать их через расстояние Левентшейна, а потом мозгом уже посмотреть темы этих кластеров. Можно ли как-то получше сделать?
Можно tfidf просто взять для начала и кластеризовать Birch'ем, который сам подберет ~оптимальное количество кластеров