Size: a a a

Чат к каналу @begtin

2020 August 29

PK

Phil Kulin in Чат к каналу @begtin
Не рабочий
источник

IB

Ivan Begtin in Чат к каналу @begtin
Нерабочий. Исходный код бота давно опубликован - https://github.com/datacoon/feedrebot можете сделать свой.
источник

G

Gip24 in Чат к каналу @begtin
- Более 90 процентов госкомпаний в России находятся в «серой зоне». Их, по сути, никто не контролирует, учет их не ведется, а выгоду их существование приносит только руководству, которое может завышать себе зарплату на фоне хронической убыточности.

https://lenta.ru/news/2020/08/27/stabilnost/
источник
2020 August 30

NK

ID:0 in Чат к каналу @begtin
О работе с данными в академической среде на примере компьютерной лингвистики. Многие знают что компьютерная лингвистика - это область науки где, с одной стороны много данных, включая открытые, создается исследователями, а с другой стороны часто востребованы и коммерческими компаниями, в самых разных задачах обработки естественного языка. Это приводит к появлению гибридных бизнес моделей которые можно рассматривать, и как социально ответственный бизнеc, и как возможность самофинансирования некоммерческой деятельности - смотря как взглянуть.

Пример подобного коммерческого Sketch Engine [1], британо-чешского стартапа Lexical Computing [2] в котором собраны корпусы десятков языков всего мира. Корпуса созданы как на базе текстов в Википедии, так и на базе других крупных баз корпусов языков, таких как Aranea [3].

Важная особенность корпусов языков в их значительном объёме. С ними очень сложно работать без достаточных технических ресурсов памяти, процессора и хранения, поэтому поэтому коммерческий сервис даёт возможность работать с корпусами текстов несмотря на эти ограничения и предоставляет большой набор инструментов специально для исследователей в области компьютерной лингвистики.

При этом так же команда публикует сокращённую версию продукта под лицензией GPL - NoSketchEngine [4] который можно установить у себя локально и также с ним работать.

В это важная особенность сервисов создаваемых на базе академических/исследовательских данных. Практически во всех областях где есть вовлечение бизнеса и исследователей продукты построены по схожим принципам:
- бизнес модель основана на университетской подписке и подписке коммерческих компаний
- очень сильно заточены под предметную область и создают множество инструментов и интерфейсов под потребности именно исследователей
- значительно упрощают работу с данными очень большого объёма
- есть возможность указывать точные ссылки для библиографии
- есть или бесплатный доступ для исследователей, или какая-то часть кода/данных общедоступны

Таких примеров ещё много в разных областях. Такой продукт как Wolfram Alpha [5] создан не только для математиков, но и для всех кто исследует в сотнях отраслях и предоставляет, опять же, не данные, а инструменты на них основанные.  Проект Censys [6] создавался как результаты академических работ по сканированию интернета на уязвимости, а сейчас является заметным коммерческим продуктом в области сетевой безопасности, с потребителями как из академической, так и коммерческой сред. А предоставление первичных больших данных стало в нём одним из продуктов Bulk Data [7]

Как и во всех продуктах основанных на данных, в данном случае важнейшим является то какую добавленную стоимость этот продукт создаёт.

Ссылки:
[1] https://www.sketchengine.eu
[2] https://www.lexicalcomputing.com/
[3] http://ucts.uniba.sk/aranea_about/index.html
[4] https://nlp.fi.muni.cz/trac/noske
[5] http://www.wolframalpha.com
[6] http://censys.io
[7] https://censys.io/product/product-data

#data #science #opendata #bigdata
источник

NK

ID:0 in Чат к каналу @begtin
Лучше всего получается то что делаешь под свои задачи (с)

Несколько внутренних инструментов решили перевести в open source и теперь они доступны на Github'е:
mongo2md - утилита помогающая в генерации документации/описания данных находящихся в коллекциях MongoDB [1]. Не умеет пока автодокуметировать поля к таблицам автоматически, но помогает очень сильно упростить работу тех кто документирует руками. Как можно понять из названия, создаёт Markdown файлы на основе схем коллекций которые само же распознает.

apibackuper - утилита по архивации данных отдаваемых через API. Подходит для всех тех случаев когда владелец данных предоставляет API с каким-то ограничением на один запрос, но не отдаёт нужные данные целиком для массовой выгрузки. В результате иногда надо делать тысячи запросов к API пролистывая все нужные данные. Эта утилита автоматизирует эти запросы к API, настраивается с помощью простого конфиг файла и экспортирует данные в нужном формате. Проверено на API на таких сайтах как как: Единый портал бюджетной системы, Корневой удостоверяющий центр, Headhunter API, Госрасходы. Функции именно в архивации на (полной копии данных) на определённый момент (фактически она нужна для создания внутреннего цифрового архива и архивации сайтов работащих через API/Ajax и не поддающихся веб-архивации классическими инструментами).

Ссылки:
[1] https://github.com/datacoon/mongo2md
[2] https://github.com/ruarxive/apibackuper
#opensource #api #data
источник

NK

ID:0 in Чат к каналу @begtin
Если кто-то не догадался сразу, то вот эти замечательные картинки - это "открытые данные" публикуемые Федеральным агентством лесного хозяйства в из их информационной системы дистанционного мониторинга.
источник

NK

ID:0 in Чат к каналу @begtin
источник

NK

ID:0 in Чат к каналу @begtin
Я бы восхитился вольностью интерпретации сотрудников Рослесхоза понятием открытые данные, но они такие не первые, я помню что были похожие "схемы" публикации данных и в других органах власти. Когда Word файл сохраняли в Word XML (язык разметки а ля HTML) и выдавали за машиночитаемые форматы, когда публиковали картинки вместо машиночитаемых файлов или когда с виду данные были, а одного клика было достаточно чтобы убедиться что они более недоступны.
В другой их системе, Единой государственная автоматизированная информационная система
"УЧЁТ ДРЕВЕСИНЫ И СДЕЛОК С НЕЙ" (ЛесЕГАИС) [2] также есть раздел открытых данных где их можно листать и искать, но скачать только некоторые и только в формате xlsx.  В общем то тоже, открытость там на 3-чку и то только потому что за этим разделом API на базе GraphQL к которому опытные умы могут подключаться, но учитывая объёмы публикуемых данных - это крайне неудобно делать тысячи запросов по 20 записей каждая.
При этом в самом ведомстве знают что такое открытые данные и как их публиковать потому что соответствующий раздел на сайте Рослесхоза существует [3] и обновляется, но данные из их ФГИС не включает.

Ссылки:
[1] https://public.aviales.ru/main_pages/public.shtml
[2] https://lesegais.ru/
[3] http://rosleshoz.gov.ru/opendata
#opendata #opengov #rosles
источник

VK

Vladislav Kazartsev in Чат к каналу @begtin
ID:0
Я бы восхитился вольностью интерпретации сотрудников Рослесхоза понятием открытые данные, но они такие не первые, я помню что были похожие "схемы" публикации данных и в других органах власти. Когда Word файл сохраняли в Word XML (язык разметки а ля HTML) и выдавали за машиночитаемые форматы, когда публиковали картинки вместо машиночитаемых файлов или когда с виду данные были, а одного клика было достаточно чтобы убедиться что они более недоступны.
В другой их системе, Единой государственная автоматизированная информационная система
"УЧЁТ ДРЕВЕСИНЫ И СДЕЛОК С НЕЙ" (ЛесЕГАИС) [2] также есть раздел открытых данных где их можно листать и искать, но скачать только некоторые и только в формате xlsx.  В общем то тоже, открытость там на 3-чку и то только потому что за этим разделом API на базе GraphQL к которому опытные умы могут подключаться, но учитывая объёмы публикуемых данных - это крайне неудобно делать тысячи запросов по 20 записей каждая.
При этом в самом ведомстве знают что такое открытые данные и как их публиковать потому что соответствующий раздел на сайте Рослесхоза существует [3] и обновляется, но данные из их ФГИС не включает.

Ссылки:
[1] https://public.aviales.ru/main_pages/public.shtml
[2] https://lesegais.ru/
[3] http://rosleshoz.gov.ru/opendata
#opendata #opengov #rosles
источник
2020 August 31

G

Gip24 in Чат к каналу @begtin
- Мишустин поручил вице-премьерам за два месяца доработать все подзаконные акты.

https://www.kommersant.ru/doc/4474240
источник

NK

ID:0 in Чат к каналу @begtin
Почему в России так много (а на самом деле так мало) открытых данных? Почему самыми большими данными оказываются, например, данные о госзакупках и госфинансам [1] ?

Среди множества причин: политических, экономических и культурных, я хочу обратить внимание на отличия в том что и как публикуется на российских порталах открытых данных и как это отличается от происходящего в мире.

1. Одни из наиболее крупных по объёмам публикации данных в мире - это географические и геологические данные. Например, более 26% всех наборов данных (25 тысяч из 95 тысяч) на портале открытых данных Австралии [2] опубликованы Geoscience Australia. Почти все эти данные - это геоданные, в форматах GeoJSON и SHP и других, содержащие сведения о наблюдении за территорией, спутниковые снимки и тд.

2. Ещё примерно вдвое больше данных публикуется другими научными и исследовательскими организациями и, в итоге, всё вместе - примерно 75% всех данных публикуемых на data.gov.au - это научные и исследовательские данные.

3. В Великобритании на портале data.gov.uk из публикуемых данных, также, около 15-20% - это геоданные. Точно измерить сложно поскольку публикуются они многими органами власти и организациями. Научных данных там меньше только по той причине что существуют отдельные системы раскрытия научных данных в рамках проектов Dataverse, европейского Zenodo и многих других.

4. В США ситуация похожая и большая часть данных на data.gov - это данные из многочисленных научных центров раскрывающих кроме данных ещё и совершенно невероятные объёмы открытого кода, в основном через Github.

5. В России около 64% (15286 из 23864) опубликованных данных на портале data.gov.ru [2] - это административные данные отклассифицированные в категорию "Государство". Они так или иначе касаются отчетности органов власти, вакансий, списков терр. органов и иных данных которые требуются к раскрытию по 8-ФЗ и порождённых от него НПА. Практическая их применимость есть в очень и очень узких задачах. Геоданные не публикуются практически полностью, научных данных также нет.

С чем это связано? Причин несколько:
- секретность геоинформации в России. То что во всём мире раскрывается повсеместно, в России является предметом преследования географов, засекречивается и не раскрывается даже в самых очевидных случаях. То же самое касается если не всех то многих данных о недрах в России.
- полное отсутствие коммуникаций с действующими научными проектами, по астрофизике, по изучению недр, по изучению погоды и так далее. Это ещё на уровне Открытого правительства - фактически совсем ничего не делалось в этом направлении
- фрагментированность госполитики в области управления данными. Отдельно существует регулирование открытых данных, отдельно разрабатываются НПА по СМЭВу, отдельно существуют инициативы по платформам по исследованиям в Минобре, отдельно существует регулирование информационных систем. В результате даже если огромные объёмы данных создаются в таких системах как ЕСИМО, системах Росгидромета и других, на портал открытых данных они не поступают.

Можно ли это изменить? На техническом уровне нет. Только на политическом уровне. Главная беда большинства госпорталов открытых данных не в их технической реализации, а в отсутствии политической опоры внутри исполнительной власти.  А можно ли это изменить?


Ссылки:
[1] https://spending.gov.ru
[2] https://data.gov.ru

#opendata #data #opengov
источник

G

Gip24 in Чат к каналу @begtin
Gip24
Закупки встали до 31 августа..?

- в период с 21:00 27.08.2020 по 09:00 31.08.2020 по московскому времени.
Перенос затянулся....
источник

AB

Albert Bertyakov in Чат к каналу @begtin
Gip24
Перенос затянулся....
Это не перенос - это перекур при переносе
источник

G

Gip24 in Чат к каналу @begtin
Albert Bertyakov
Это не перенос - это перекур при переносе
.. или закус по итогам?
источник

DP

Dmitry Perminov in Чат к каналу @begtin
ID:0
Почему в России так много (а на самом деле так мало) открытых данных? Почему самыми большими данными оказываются, например, данные о госзакупках и госфинансам [1] ?

Среди множества причин: политических, экономических и культурных, я хочу обратить внимание на отличия в том что и как публикуется на российских порталах открытых данных и как это отличается от происходящего в мире.

1. Одни из наиболее крупных по объёмам публикации данных в мире - это географические и геологические данные. Например, более 26% всех наборов данных (25 тысяч из 95 тысяч) на портале открытых данных Австралии [2] опубликованы Geoscience Australia. Почти все эти данные - это геоданные, в форматах GeoJSON и SHP и других, содержащие сведения о наблюдении за территорией, спутниковые снимки и тд.

2. Ещё примерно вдвое больше данных публикуется другими научными и исследовательскими организациями и, в итоге, всё вместе - примерно 75% всех данных публикуемых на data.gov.au - это научные и исследовательские данные.

3. В Великобритании на портале data.gov.uk из публикуемых данных, также, около 15-20% - это геоданные. Точно измерить сложно поскольку публикуются они многими органами власти и организациями. Научных данных там меньше только по той причине что существуют отдельные системы раскрытия научных данных в рамках проектов Dataverse, европейского Zenodo и многих других.

4. В США ситуация похожая и большая часть данных на data.gov - это данные из многочисленных научных центров раскрывающих кроме данных ещё и совершенно невероятные объёмы открытого кода, в основном через Github.

5. В России около 64% (15286 из 23864) опубликованных данных на портале data.gov.ru [2] - это административные данные отклассифицированные в категорию "Государство". Они так или иначе касаются отчетности органов власти, вакансий, списков терр. органов и иных данных которые требуются к раскрытию по 8-ФЗ и порождённых от него НПА. Практическая их применимость есть в очень и очень узких задачах. Геоданные не публикуются практически полностью, научных данных также нет.

С чем это связано? Причин несколько:
- секретность геоинформации в России. То что во всём мире раскрывается повсеместно, в России является предметом преследования географов, засекречивается и не раскрывается даже в самых очевидных случаях. То же самое касается если не всех то многих данных о недрах в России.
- полное отсутствие коммуникаций с действующими научными проектами, по астрофизике, по изучению недр, по изучению погоды и так далее. Это ещё на уровне Открытого правительства - фактически совсем ничего не делалось в этом направлении
- фрагментированность госполитики в области управления данными. Отдельно существует регулирование открытых данных, отдельно разрабатываются НПА по СМЭВу, отдельно существуют инициативы по платформам по исследованиям в Минобре, отдельно существует регулирование информационных систем. В результате даже если огромные объёмы данных создаются в таких системах как ЕСИМО, системах Росгидромета и других, на портал открытых данных они не поступают.

Можно ли это изменить? На техническом уровне нет. Только на политическом уровне. Главная беда большинства госпорталов открытых данных не в их технической реализации, а в отсутствии политической опоры внутри исполнительной власти.  А можно ли это изменить?


Ссылки:
[1] https://spending.gov.ru
[2] https://data.gov.ru

#opendata #data #opengov
Вроде сейчас по геологическим данным много открытого, правда не знаю как там с качеством , но реально много можно найти в едином фонде геологической информации и карте недропользования
источник

f

fr1 in Чат к каналу @begtin
если это аналог фонда пространственных данных, то я бы не знавал это "открытыми данными"
источник

AP

Andrey Pirogov in Чат к каналу @begtin
Dmitry Perminov
Вроде сейчас по геологическим данным много открытого, правда не знаю как там с качеством , но реально много можно найти в едином фонде геологической информации и карте недропользования
ага, вот тута: https://gis.sobr.geosys.ru/
даже шэйпы качать можно
источник

ГМ

Григорий Машанов... in Чат к каналу @begtin
А тут есть специалисты по государственным заданиям учреждений и/или государственным услугам? я пытаюсь разобраться в одном вопросе и не все понимаю
источник

ЕР

Евгения Романова. РС... in Чат к каналу @begtin
fr1
если это аналог фонда пространственных данных, то я бы не знавал это "открытыми данными"
Есть же ФПД - фонд пространственных данных
источник

AP

Andrey Pirogov in Чат к каналу @begtin
Евгения Романова. РС(Я)
Есть же ФПД - фонд пространственных данных
ФПД это из 431-ФЗ, где слово "открытость" встречается только один раз в словосочетании "открытое море". :(
источник