Size: a a a

2019 March 03

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Ага, про всякие дистанции:
https://github.com/orsinium/textdistance
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
У меня compression based единственные были не сделаны, потому что какие-то они мутные, решил вот разобраться с ними спустя год)
источник

I

I Апрельский in PyData SPb
нашел да. клево! странно, что мне не попадался. я как-то искал варианты левенштайна и нашел пакетов 5
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
I Апрельский
нашел да. клево! странно, что мне не попадался. я как-то искал варианты левенштайна и нашел пакетов 5
Levenshtein, jellyfish, py_stringmatching, pylev, distance. Я знаю все 😁
источник

I

I Апрельский in PyData SPb
верю! там некоторые между собой по скорости соревнуются. а у тебя нет такой задачи пока?
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
I Апрельский
верю! там некоторые между собой по скорости соревнуются. а у тебя нет такой задачи пока?
У меня textdistance умеет к сторонним пакетам присасываться, чтобы их использовать, если возможно. А это не всегда возможно, потому что у меня задача была сделать как можно круче, и только textdistance умеет работать не только со строками, а с любыми последовательностями, и принимать на вход больше двух последовательностей (я почти все алгоритмы для этого пропатчил). Внутри для каждой библиотеки хранятся результаты бенчмарков и правила для входных значений.
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Ну типа если установлен пакет Levenshtein и на вход textdistance.Levenshtein передано две строки, то textdistance будет использвовать функцию из пакета Levenshtein.  Все эти библиотечки можно установить через extra, там в ридми описано.
источник

I

I Апрельский in PyData SPb
что-то я смотрю  на ncd и вот вопрос. выходит там чем лучше конкантенация сжимается, тем более похожи ее составляющие?  что-то здесь не так
источник

I

I Апрельский in PyData SPb
We define a compression distance based on a normal compressor
and show it is an admissible distance. I
источник

I

I Апрельский in PyData SPb
а там какой-то normal compressor
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
I Апрельский
что-то я смотрю  на ncd и вот вопрос. выходит там чем лучше конкантенация сжимается, тем более похожи ее составляющие?  что-то здесь не так
Ага. Ну типа если у тебя есть две строки test и test, то при сжатии ты просто говоришь "тут, короче test надо дважды повторить", а вот когда строки сильно разные, так не прокатит. На RLE это будет выглядеть условно как (test)x2 vs test+nani
источник

I

I Апрельский in PyData SPb
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
🤔
источник

I

I Апрельский in PyData SPb
это я по диагонали читаю пейпер
источник

I

I Апрельский in PyData SPb
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Отлично, ни один обратимый компрессор не удовлетворяет их условиям)
источник

I

I Апрельский in PyData SPb
Here, and in the later experiments using
the CompLearn Toolkit [9], we simply use C(xy) rather
than min{C(xy), C(yx)}. This is justified by the observation
that block-coding based compressors are symmetric almost
by definition, and experiments with various stream-based
compressors (gzip, PPMZ) show only small deviations from
symmetry.
источник

I

I Апрельский in PyData SPb
но я не уверен, что они там не смягчили требования
источник

I

I Апрельский in PyData SPb
ты сам лучше почитай)
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Да, я читаю, спасибо. Если что, пиши в ЛС, а то мы тут уже годовую норму сообщений чата превысили)
источник