А я верно понимаю, что, если у меня, скажем, есть 20 текстов, и я хочу сравнить у них самые важные n-граммы, то я собираю их в корпус все, считаю tf-idf и потом беру для каждого текста по, скажем, 5 n-грамм с самым высоким tf-idf. И это уже имеет какой-никакой смысл.