Нет фильтрации. Это итоговый файл (сделанный в R). В котором скрыто много интересного и полезного. Хотел покрутить его в пайтоне, чтобы руку набить, так как изначально Rщик.
Кривоватенько, если честно… Сэкономили. Не все на маках или линухах, многие мыслят только 1251. Black & white вытирают тщательно в репозиториях, а здесь «utf only»
Процедуры импорта надо делать максимально гибко. Ведь ими пользуются миллионы людей. Каждый прокол сказывается на многих. Ведь и остальные кодовые страницы тоже в игноре
Ну во-первых 5 это csv, в памяти это может быть как меньше, так и больше. Во-вторых, в том же пандасе с памятью странные штуки происходят, когда для некоторых операций нужно х2-х4 памяти.
Csv и не влезает в 3х по памяти? Ну, если только пожатый) строка больше числа занимает) но можно иначе - порезать и читать частями в разные фреймы, потом оптимизировать типы и сливать на диск итеративно. Когда все будет готово вычитать и объединить. Тогда влезть должно.
Скажите, а кто какие значет варианты как доставить графики до конечных пользователей? Вот скажем я написал SQL, вытащил DataFrame, построил график в bokeh/matplotlib/ещё в чём-то. Как дальше его расшарить в рамках бизнеса?
мне superset не нравится тем, что настраиваемость низкая. Я угораю по визуализации, и мне кастомизация нужна как в Tableau примерно. Redash туда же куда Superset