Size: a a a

2019 February 07

DS

Dmitry Schwarz in PyData SPb
Коллеги, Есть две задачи одна по генетике другая по временным рядам (не Биржа) нужны спецы) я не хантер , сам DS, если что не бейте... 🤓
источник

AZ

Alex Zveryansky in PyData SPb
Dmitry Schwarz
Коллеги, Есть две задачи одна по генетике другая по временным рядам (не Биржа) нужны спецы) я не хантер , сам DS, если что не бейте... 🤓
Задач в мире гораздо больше чем две, и да, спецы нужны. Если вакансия то хотя бы оформи прежде чем писать, если желание обсудить недостаток специалстов, то слабо вкинул для холивара
источник

DS

Dmitry Schwarz in PyData SPb
Alex Zveryansky
Задач в мире гораздо больше чем две, и да, спецы нужны. Если вакансия то хотя бы оформи прежде чем писать, если желание обсудить недостаток специалстов, то слабо вкинул для холивара
Согласен! Не хочу спамить. Одна задача это анализ генетических данных для науки. Долго занимался этой темой, сейчас расширение задач. Будут публикации и реальные данные.Другой вариант это построение цифровой копии динамического объекта по вр. Все оплачиваемо .
источник

АН

Александр Никулин in PyData SPb
если оплачиваемо, почему бы тебе не пойти в #_call_4_collaboration / #jobs в ods слак, напиши там
источник

I

I Апрельский in PyData SPb
И наслушаться надменных комментариев о том как оформлять подобные предложения
источник

АН

Александр Никулин in PyData SPb
не без этого
источник
2019 February 15

SM

Serge Matveenko in PyData SPb
Last call!
25.02 — встреча сообщества SPb Python — последний шанс стать докладчиком!
Пишите в комментарии по ссылке или прямо мне @lig11 прямо сейчас.
https://spbpython.guru/news/meetup-20190225-cfp
источник
2019 March 03

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Normalized compression distance считается по довольно странной формуле:
https://en.wikipedia.org/wiki/Normalized_compression_distance#Normalized_compression_distance
Это единственная дистанция, которая мне не дает покоя. Проблем тут много:

1. Я сейчас всё аккуратно почитал по арифметическому сжатию, и результаты совсем не такие, как должны быть при правильной работе формулы:
In [2]: textdistance.arith_ncd('test', 'test')
Out[2]: 0.75

In [3]: textdistance.arith_ncd('test', 'text')
Out[3]: 0.7

Алгоритмически всё верно, я несколько раз перепроверил вручную.

2. Написано, что normalized, но по факту максимальное значение сверху не ограничено. Ну ок, его можно ограничить исходя из знаний о самом алгоритме сжатия, но для почти всех алгоритмов это переваливает за единицу.

3. Ну и если докопаться до формулы, то вообще-то Z(xy) != Z(yx), а значит и NCD(x, y) != NCD(y, x) по этой формуле. Ну я беру min(Z(xy), Z(yx)).

Короче, надо придумать, как эту формулу пропатчить, видимо. Я без понятия, что делать.
источник

I

I Апрельский in PyData SPb
Z(xy) — это что в действительности?
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
I Апрельский
Z(xy) — это что в действительности?
Размер сжатой последовательности. В качестве сжатия может выступать любой алгоритм, хоть RLE.
источник

I

I Апрельский in PyData SPb
xy — конкантенация x и y просто?
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Конкатенация, да. Формулу можно словми так описать:
Сжатие конкатенации минус минимальное по длине из сжатий последовательностей и всё это делить на максимальное из сжатий последовательностей. Идея в том, что чем лучше мы сжимаем все объекты вместе, чем поотдельности, тем более они похожи.
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Хм, ну да, точно, надо вероятности каждой последовательности в своём поле посчитать
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Эффект уточки)
источник

I

I Апрельский in PyData SPb
Кря
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Проблему №1 порешали:
In [2]: textdistance.arith_ncd('test', 'text')
Out[2]: 1.4285714285714286

In [3]: textdistance.arith_ncd('test', 'test')
Out[3]: 1.0


Проблему 3, как я уже говорил, можно решить через взятие минимума от сжатий пермутаций. Осталась проблема №2: дистанция вообще ненормализованная. Это единственный алгоритм вычисления дистанции в этом мире, который для полностью одинаковых последовательностей (test test) не даёт 0, а для полностью различных (test nani) не даёт единицу. Видимо, надо на каждый алгоритм сжатия делать свою нормализацию, что овообще не тривиально.
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
источник

I

I Апрельский in PyData SPb
А почему дистанция должна быть ограничена 1?
источник

'o

' or 1=1 -- `ǤŘΔΜ` σяsιηιυм official (っ◔◡◔)っ in PyData SPb
Потому что normalized обычно означает нормализацию на интервал 0-1. И, в принципе, для всех остальных алгоритмов (а я их в textdistance за 30 штук наделал), мне удалось сделать такую нормализацию, потому что известно максимальное значение, даваемое функцией.
источник

I

I Апрельский in PyData SPb
у тебя какой-то пакет есть? ща погуглю
источник