Size: a a a

2021 December 06

T

T in Data Engineers
Это для @datajobs уже
источник
2021 December 07

DM

Denis Markov in Data Engineers
Утро в чатик!

Все забываю сказать, что мы вывели в open source решение для векторного поиска vektonn.io, позволяющее радикально сократить время вывода алгоритмов в прод и очень ищем DS-инженеров, которые хотят попробовать/поделиться обратной связью/помочь в развитии проекта.

Очень ждём всех, кому интересно — https://vektonn.github.io/vektonn/quick-start/
источник

GP

Grigory Pomadchin in Data Engineers
ах триггернулся что жоба; надо спать)
источник

ММ

Максим Митяев... in Data Engineers
Спокойного утра )
источник

E

Etki in Data Engineers
Допустим что я постепенно пытаюсь вкатиться в тему из мира обычной разработки. Чем это решение будет мне интересней, чем условный annoy?
источник

V

Volume999 in Data Engineers
Здравствуйте! У кого есть опыт с Azure Synapse Analytics? Как вы сделали среды разработки и продакшна? Делали вы два отдельных воркспейса в репозитории или работали в одном репозитории (учитывая, что паблиш ветка одна, и триггеры только на паблиш ветке работают, т.е ручная проверка и затем в прод деплоить)?
источник

T

T in Data Engineers
Судя по нику hr☝️
источник

D

Dmitry in Data Engineers
подскажите в жава, что показывает -XX:+PrintGCDetails в скобках ?
[Eden: 1328.0M(1328.0M)->0.0B(1312.0M) Survivors: 81920.0K->98304.0K Heap: 9517.3M(28224.0M)->8129.3M(28224.0M)]
что такое (28224.0M) ?
источник

A

Andrew Urpin in Data Engineers
Heap: 12.6M(252.0M)->7848.3K(252.0M) – indicates that capacity of heap size was 252mb, in that 12.6mb was utilized. After this GC event, heap utilization dropped to 7848.3kb (i.e. 5mb (i.e. 12.6mb – 7848.3kb) of objects has been garbage collected in this event). And heap capacity remained at 252mb.
источник

D

Dmitry in Data Engineers
heap capacity, спасибо!
источник

A

Aleksandr in Data Engineers
привет. столкнулся с банальной проблемой в spark - ключ джойна в левой таблице сильно skewed в sortmerge джойне. в правой этот ключ уникальный для всех записей. переход к броадкасту, скорее всего, не возможен, поскольку обе таблицы очень большие. знаю, что в 3.0 есть какие-то настройки для этого, но переход к 3.0 пока что тоже не возможен. как справляться?
источник

M

Mi in Data Engineers
ну как вариант разбить на данные без skew и данные со skew и джойнить эти части двумя запросами
источник

M

Mi in Data Engineers
не очень понятно что там за skew такой который не поместится в бродкаст
источник

A

Aleksandr in Data Engineers
да, я вынес два сильно скошенных ключа в отдельный запрос
источник

M

Mi in Data Engineers
и что, не помогло?
источник

M

Mi in Data Engineers
можно еще увеличить количество партиций для шаффла, хотя не уверен что это поможет
источник

A

Aleksandr in Data Engineers
не сильно - там куча ещё ключей, некоторые встречаются по одному разу, а некоторые по нескольку десятков тысяч раз
источник

M

Mi in Data Engineers
если сначала запустить distinct по skewed таблице?
источник

M

Mi in Data Engineers
а потом джойнить
источник

A

Aleksandr in Data Engineers
я думаю. там left join, скошена левая таблица, т.е. все записи должны остаться из левой
источник