Приношу глубочайшие извинения тем, кого задену очень базовым вопросом.
У меня есть список строк. Их полторы тысячи. Стоп-слова я позже уберу. Хочу кластеризовать строки по темам. На ум приходит просто взять и кластеризовать их через расстояние Левентшейна, а потом мозгом уже посмотреть темы этих кластеров. Можно ли как-то получше сделать?
я бы попробовала векторы fasttext, посчитать среднее значение для строки или сумму простую, но обычно среднее делается, и попробовать разные алгоритмы кластеризации, от самого простого типа k-means и GMM и сколько найдете в sklearn или другой библиотеке