Size: a a a

Инфокультура

2019 April 17
Инфокультура
Алексей Кудрин об открытости государства и перезагрузке Счетной Палаты: пленарное заседание Дня открытых данных-2019 в Москве
https://clearspending.ru/news/aleksej-kudrin-ob-otkrytosti-gosudarstva-i-perezagruzke-schetnoj-palaty-plenarnoe-zasedanie-dnya-otkrytyh-dannyh-2019-v-moskve/

**" Госзатраты" начинают серию статей по итогам работы секции "Открытые
государственные данные" Дня открытых данных-2019. В первой публикации -
главные тезисы и видеозапись выступления председателя Счетной Палаты РФ
Алексея Кудрина. **

Со встречи с "главным государственным аудитором" стартовал День открытых
данных в Москве в 2019 году. В диалоге с участниками Алексей Кудрин говорил о
проблемах открытости российских госорганов, о конкуренции в госзакупках, о
данных правоохранителей и о новых нап
источник
Инфокультура
Дата-среда «Преимущества векторных представлений слов в неевклидовых геометриях»
https://www.infoculture.ru/2019/04/17/data-sreda-preimushhestva-vektornyh-predstavlenij-slov-v-neevklidovyh-geometrijah/

24 апреля 2019 приглашаем на дата-среду из цикла «Большие данные в экономике».
Тема второй встречи цикла — «Преимущества векторных представлений слов в
неевклидовых геометриях».

Как аналитики в сфере бизнеса, так и академические исследователи зачастую сталкиваются с необходимостью семантического анализа текста. Он может быть применен в таких задачах, как определение тематики и тональности новостных сообщений или предсказание размера заработной платы по описанию вакансии.

Лектор сравнит стандартные методы нахождения векторных представлений текстов с методом, основанным на неевклидовых геометриях. Эксперт покажет, как решение таких задач, как машинный перевод или анализ тональности текстов становится более точным, если сохраняется контекстное значение омонимов.
источник
2019 April 19
Инфокультура
Дата-среда: «Семантический анализ текста»
https://mailchi.mp/infoculture/datasreda_ranepa_2
источник
2019 April 21
Инфокультура
Утечки персональных данных из регулируемых государством информационных систем. Часть 1. Удостоверяющие центры
https://begtin.tech/pdleaks-p1-uc/

В данном исследовании были проанализированы утечки таких видов персональных
данных как СНИЛС, паспортные данные, сведения о трудоустройстве, сведения о
ситуации с работодателем.
источник
Инфокультура
Студенты Мюнхенского технического университета создали ИИ, который предсказал, кто погибнет и выживет в финальном сезоне «Игры престолов». Для этого они проанализировали данные более чем о двух тысячах персонажей: их принадлежность к тому или иному дому, историю бракосочетаний, пол, значимость для сюжета и так далее.

ИИ от тех же разработчиков уже продемонстрировал свою точность перед премьерой шестого сезона сериала. Тогда он спрогнозировал смерть пяти персонажей, и в трёх случаях оказался прав.

Кто умрёт, а кто выживет в восьмом сезоне — в отчёте: https://got.show/
источник
2019 April 22
Инфокультура
Что такое дата-журналистика? Вам объяснят на котиках преподаватели мастерской дата-журналистики на Летней школе 2019.

Допустим, вы хотите узнать, каких кошечек любят в разных регионах России. Обычный журналист пошел бы шерстить соцопросы, но дата-журналисты не ищут лёгких путей, а делают так:

- скачивают все объявления о продаже котят по всей стране;
- делают рейтинг и интерактивный сервис.

Посмотреть результат работы.

Как такое провернуть в обычной российский редакции? Вас научат на Летней школе: https://www.letnyayashkola.org/datajourn.

Присоединяйтесь! 🐈
источник
2019 April 23
Инфокультура
Утечки персональных данных из регулируемых государством информационных систем. Часть 2. ОнлайнИнспекция.Рф
https://begtin.tech/pdleaks-p2-oninsp/

По данным сайта онлайнинспекция.рф на нем рассмотрено 230 тысяч обращений
граждан. В виду ошибок в настройке сайта – эти обращения индексируются
поисковыми системами. В частности, поисковая система Google проиндексировала
15 тысяч обращений и при поиске
источник
2019 April 29
Инфокультура
В прошедшие выходные команда Инфокультуры участвовала во II хакатоне «Новой газеты» по дата-журналистике (@hackathon_novaya). Заглавная тема — дискриминация по разным признакам. Участники исследовали проблемы маленьких людей с помощью больших данных.

Мы предложили задачу «Меньшинство решает за большинство: люди, которые предлагают законы — кто они», в рамках которой можно было изучить, как устроен законотворческий процесс в России, и выявить факторы, влияющие на принятие того или иного законопроекта. Открытые данные по законотворческой деятельности доступны по ссылке.

— Команда «Рубильник» представила проект «Ядерный щит Рунета» с результатами исследования того, как общество и СМИ реагировали на принятие закона о «суверенном интернете». Авторы: Ксения Тихомирова, Самсон Карапетян, Дмитрий Лобанов, Екатерина Садыкова.

— В проекте «Большие маленькие люди» участники попытались проанализировать законотворческую активность депутатов Госдумы. Авторы: Герман Нечаев, Юлия Грохлина, Анастасия Уткина, Василиса Бешкинская, Антон Ухлин.

Ознакомиться с другими проектами хакатона можно по ссылке.
источник
2019 April 30
Инфокультура
Утечки персональных данных. Электронные торговые площадки
https://begtin.tech/pdleaks-p2-etp/

В этот раз речь пойдёт об утечках персональных данных на электронных торговых
площадках. Прежде чем публиковать эту часть исследования я передал их РБК для
публикации без технических подробностей и чтобы у электронных площадок было
время на то чтобы отреагировать на суть проблемы.
источник
2019 May 07
Инфокультура
Инфокультура делает много некоммерческих технологических проектов на основе открытых данных, например, таких, как ГосЗатраты, Данные НКО, Открытые НКО и Открытая полиция, и начинает разработку еще одного большого и серьёзного проекта, посвященного открытым данным Российской Федерации. Поэтому мы расширяем команду и ищем:

- тим-лида: Django, JavaScript, Python, MongoDB, PostgreSQL;
- фронтэнд-разработчика: JavaScript, MongoDB, PostgreSQL, Django, MySQL;
- бэкэнд-разработчика: SQL, Python, Django, PostgreSQL, MongoDB;
- специалиста по работе с данными: Python, MongoDB, SQL, XML.

Пишите нам на email infoculture@infoculture.ru с пометкой "Ваканасия [название позиции]".

Подробности: https://moikrug.ru/companies/infoculture.
источник
2019 May 12
Инфокультура
Могут ли успешно завершиться национальные проекты?
https://begtin.tech/natprojects-failready/

8 мая прошёл совет при президенте по стратегическому развитию и национальным
проектам. Он транслировался в прямом эфире онлайн по Россия24 и сейчас его
видеозапись и стенограмма стали доступными
источник
2019 May 13
Инфокультура
Республиканцы или демократы. Машинный разбор текстов политических программ с помощью Python. Пошаговая инструкция визуализации данных из текста политических конвенций 2012 года с помощью библиотеки Scattertext в Python.

Подробнее: https://kanoki.org/2019/03/17/text-data-visualization-in-python.
источник
Инфокультура
источник
2019 May 14
Инфокультура
Stack Overflow опубликовал результаты ежегодного опроса разработчиков со всего мира. Вопросы касаются как предпочтений в технологиях, так и образования, карьеры, профессиональных приоритетов, а также выбора музыки для прослушивания во время программирования.

Некоторые выводы:
- Самый быстрорастущий язык программирования среди разработчиков – Python.
- DevOps’ы и инженеры по надёжности сайтов являются самыми высокооплачиваемыми и довольными специалистами своей работой.
- 7,9% опрошенных являются дата-сайентистами, и еще 7,2% опрошенных идентифицируют себя как дата-инженеры.
- Около 65% респондентов работают с программным обеспечением с открытым исходным кодом хотя бы раз в год.

Анонимизированные данные опросов будут опубликованы под лицензией Open Database License (ODbL).

Подробнее: https://insights.stackoverflow.com/survey/2019.
источник
2019 May 15
Инфокультура
Иван Бегтин проанализировал данные с сайтов информационных госсистем и выявил утечку персональных данных:

- Реестр субсидий федерального бюджета Минфина —50 тыс. записей.
- Реестр отчетов некоммерческих организаций Минюста — 10 тыс. записей.
- Реестр обращений граждан на портале «Онлайн Инспектор» Роструда — 1 тыс. записей.
- Информационная система «Правовые акты ФАС России» — 2 тыс. записей.
- Портал торгов по госимуществу ФАС — 2 тыс.
- Портал управления многоквартирными домами Москвы — 1–2 тыс. записей.
- Столичный портал госзакупок — 2,5 тыс. записей.
- Портал государственного и муниципального заказа Федерального Казначейства — 300 тыс. записей.

В открытом доступе оказались персональные данные бывших вице-премьеров и вице-спикера Госдумы.

Иван Бегтин считает, что утечки возникают из-за ошибок в законодательстве, просчетов разработчиков и недостаточно продуманной работы регулирующих и контролирующих органов:

«Причина — в нежелании официальных лиц что-либо делать, хотя они знают о ситуации и непрофессионализме при разработке ИТ-систем», — говорит Иван.

Подробнее на РБК:
https://www.rbc.ru/politics/15/05/2019/5cdac8469a79479a27bd4eca
источник
2019 May 16
Инфокультура
Открытые данные без открытого правительства: о чем говорили представители госорганов на Open Data Day в Москве
https://clearspending.ru/news/otkrytye-dannye-bez-otkrytogo-pravitelstva-o-chem-govorili-predstaviteli-gosorganov-na-open-data-day-v-moskve/

Столько стоит каждое посаженное дерево? Кто в ответе за не закупленные
вовремя лекарства? Как данные помогут принять решение о походе в театр или музей? «Госзатраты» продолжают публикации по итогам работы сессии "Открытые государственные данные".

Эта сессия  Дня открытых данных 2019 в Москве объединила выступления спикеров из трех госведомств. Говорили о том, как собирают, структурируют и публикуют данные, об успешных и провальных проектах и многом другом.
источник
2019 May 17
Инфокультура
Утечки персональных данных из государственных информационных систем. Открытая часть доклада
https://begtin.tech/pdleaks-p3-govsys/

Хорошо ли государство умеет защищать персональные данные граждан? Достаточно
ли сертификатов ФСТЭК и ФСБ для подрядчика и аттестации системы по классу
защиты чтобы мы были уверены что наши данные оттуда не пропадут?
источник
Инфокультура
22 мая приглашаем на третью дата-среду из цикла «Большие данные в экономике». Тема встречи — «Сбор данных и методология парирования блокировки роботов».

Проведет дата-среду Сергей Бершадский, ведущий backend-разработчик и системный архитектор, работал с различными проектами, среди которых медицинский портал ЕМИАС.инфо, Play2Live, toptal.com и др. Эксперт расскажет об особенностях извлечения данных из сайтов, их очистки и структуризации. Во время встречи будет рассмотрен весь процесс извлечения данных: веб-скрейпинг, обработка данных, очистка данных, а также способы break-the-wall на примере Yandex и Google.

Предложенные кейсы основаны на использовании библиотек python scrapy, beautiful soup, asyncio. Будут рассмотрены подходы, позволяющие имитировать браузер, автоматическое использование имеющегося браузера, а также использование headless-браузеров (например, PhantomJS).

Для участия необходимо зарегистрироваться: http://datasreda.ru.
источник
2019 May 20
Инфокультура
Чиновники vs аналитики: сессия «Качество открытых данных» на Open Data Day 2019
https://clearspending.ru/news/chinovniki-vs-analitiki-sessiya-kachestvo-otkrytyh-dannyh-na-open-data-day-2019/

​ **Госорганы формируют открытые данные и видят их качество под одним углом, а
аналитики -  совсем иначе. На сессии «Качество открытых данных» обе стороны
искали ответ на вопрос: где золотая середина?**

Где грань между допустимой погрешностью и откровенной халтурой при
формировании наборов данных госорганов и как сделать данные качественнее и
доступнее - эти темы обсудили аналитики на Дне открытых данных в Москве.
Модератором сессии выступил Иван Бегтин. Публикуем краткий пересказ дискуссии
и п
источник
Инфокультура
Хакатон по открытым данным HACKNOWLEGE
https://www.infoculture.ru/2019/05/20/hakaton-po-otkrytym-dannym-hacknowlege/

25-26 мая 2019 года в Москве пройдет хакатон по использованию открытых данных и свободного контента.
«Информационная культура» оказывает информационную поддержку мероприятию. К
участию приглашаются программисты, проектировщики, дизайнеры и специалисты по
работе с профильными сервисами.
источник