begtin | Бизнес и стартапы

Telegram-канал begtin - Ivan Begtin

7029

I write about Open Data, Procurement, e-Government, Open Government, Budgets, Privacy and other govtech stuff Chat https://telegram.me/begtinchat Facebook - https://facebook.com/ibegtin Secure contacts ivan@begtin.tech

Подписаться на канал

Ivan Begtin

Ещё одна утилита идентифицирующая смысл данных в базах данных - catwright [1]. Авторы декларируют что используют ИИ и поддержку категорий данных времени и геоданных. Правда они называют категориями то что все остальные называют семантическими типами данных. Сейчас правил и категорий там мало, зато есть предобученная модель.

Выглядит любопытно, но, пока, не более того. Я всё же скажу что metacrafter [2] куда практичнее поскольку расширяем.

Ссылки:
[1] https://github.com/jataware/cartwright
[2] https://github.com/apicrafter/metacrafter

#opensource #datatypes #dataengineering

Читать полностью…

Ivan Begtin

Собирать обратную связь создателям продуктов сложно, это требует навыков и понимания того как работать с аудиторией, клиентами, потребителями и экспертами. Я в последний месяц несколько часов посвятил продукту CKAN [1] - это продукт для публикации открытых данных с открытым кодом разрабатываемый большой международной компанией и поддерживаемый парой коммерческих компаний сопровождающих порталы созданные на нём CKAN.

Они недавно опубликовали результаты своего исследования [2], они полезны тем кто изучает экосистему открытости данных в мире. А я могу поделиться собственными ощущениями.

Начну с того что собирать обратную связь действительно сложно. Когда ты создаёшь продукт коммерческий то обратная связь начинается когда у него появляется лояльная аудитория. Спроси внешнего человека, он, скорее всего, проигнорирует и ещё и подумает "Зачем мне тратить на это время?". Спроси эксперта - он скажет "ребята, это консалтинг, моё время стоит денег". Продукт должен быть, либо феноменальным, либо ты им пользуешься уже много лет и есть что сказать, либо собирать надо так чтобы мотивировать пользователей. Опять же это с точки зрения пользователя, стороннего наблюдателя.

В случае с продуктами на открытом исходном коде ситуация несколько иная. Обратная связь, часто, возникает потому что даже если бенефициарами продукта являются коммерческие компании, у него есть открытый контур и коммерческая версия продукта добавляет ему качества, но открытая никуда не исчезает. Обратите внимание, не бесплатная, которую владельцы/разработчики в любой момент могут сделать платной, а именно открытая.

Поэтому какой-нибудь продукт вроде dbt, Meltano, Dagster (примеры из рынка данных) имеют какую-то невероятную обратную связь от пользователей и немало контрибьюторов в код даже при том что их создают и развивают стартапы эффективно их монетизирующие.

Всё вместе это и называется работа с сообществом. Я тут не могу не напомнить про отличную книгу от Nadia Engball под названием Working in Public: The Making and Maintenance of Open Source Software [3] о том как создаются и развиваются сообщества открытого кода и что делает их устойчивыми.

Ссылки:
[1] https://ckan.org
[2] https://ckan.org/blog/ckan-30-product-strategy-research-part-3
[3] https://www.amazon.com/gp/product/B08BDGXVK9/ref=as_li_tl?ie=UTF8&camp=1789&creative=9325&creativeASIN=B08BDGXVK9&linkCode=as2&tag=begtintech-20&linkId=5df79c2a091bee55a08f60476f15ac33

#opensource #thoughts

Читать полностью…

Ivan Begtin

Прекрасное руководство [1] с примерами по тому как можно визуализировать реки и затопленные территории с помощью QGIS и RiverREM [2], библиотеки для Python из проекта OpenTopography.

Примеры все из США где в рамках программы 3D Elevation Program [4] сейчас оцифрована почти каждая миля страны с высокой степенью геометрической детализации.

Есть, также, очень подробное руководство как создавать именно такие картинки [5] с использованием файлов DEM (Digital elevation model), а на Flickr есть коллекция изображений подобных этим [6] которые можно использовать в некоммерческих целях.

Ссылки:
[1] https://www.beautifulpublicdata.com/visualizing-rivers-and-floodplains/
[2] https://github.com/klarrieu/RiverREM
[3] https://opentopography.org/
[4] https://www.usgs.gov/3d-elevation-program
[5] https://dancoecarto.com/creating-rems-in-qgis-the-idw-method
[6] https://www.flickr.com/photos/165735975@N07/sets/72177720300430208/

#dataviz #opendata

Читать полностью…

Ivan Begtin

Mother Duck, компания созданная для развития СУБД DuckDB получили $47.5 миллионов инвестиций от Andreessen Horowitz [1]․ У них забавный лозунг Making analytics fun, frictionless and ducking awesome. Ducking awesome звучит особенно замечательно, невозможно перевести это с языка оригинала.

Для тех кто не помнит, DuckDB - это такая OLAP база данных, работающая полностью в памяти и внутри процесса из которого запускается. Её называют SQLite для аналитики и вокруг неё уже выстроилось большое сообщество, создан специальный фонд DuckDB Foundation [2] в который входят многие компании, включая Mother Duck, Mode, Posit и другие компании, в основном стартапы.

Как бы то ни было если Вы занимаетесь обсчётом больших данных в аналитических СУБД, то попробовать DuckDB стоит .

Ссылки:
[1] https://techcrunch.com/2022/11/15/motherduck-secures-investment-from-andreessen-horowitz-to-commercialize-duckdb/
[2] https://duckdb.org/foundation/

#startups #data #datatools

Читать полностью…

Ivan Begtin

В рубрике "как это устроено у них" программа Pathways to Enable Open-Source Ecosystems (POSE) [1] от Национального научного фонда США по финансированию экосистемы открытого кода. Общая сумма фонда 8 миллионов долларов (около 480 миллионов рублей)

Полный список из 25 проектов включает проекты по гражданской науке, по развитию продуктов с открытым кодом для создания экосистемы открытых данных [2]․ Средний размер гранта на этой фазе (Phase 1) - это $300 тысяч, это порядка 18 миллионов рублей и все они выдаются именно научным командам которые исследуют то как устроены те или иные экосистемы открытого кода и также, привлекают к проектам в этих экосистемах дополнительные ресурсы.

Ссылки:
[1] https://beta.nsf.gov/funding/opportunities/pathways-enable-open-source-ecosystems-pose
[2] https://www.nsf.gov/awardsearch/advancedSearchResult?ProgEleCode=211Y&BooleanElement=Any&BooleanRef=Any&ActiveAwards=true#results

#opendata #openaccess #opensource

Читать полностью…

Ivan Begtin

По поводу новости о том что российские власти в лице Минюста РФ хотят публиковать в открытом доступе СНИЛС и ИНН иностранных агентов [1] я многое могу об этом сказать, но начну с того что сама практика публикации персональных и личных данных граждан является ущербной.

В российском законе о персональных данных была и есть оговорка о том что их использование, по смыслу, включая раскрытие возможно в соответствии с нормативно-правовыми актами. Чаще всего эта практика шла, либо от целенаправленной дискриминации определённых групп граждан, или от идиотского сочетания устоявшихся юридических практик и законов которые этого не учитывали.

Несколько лет назад я публиковал исследование Утечки персональных данных из государственных информационных систем. Открытая часть доклада [2] со множеством примеров когда из государственных официальных информационных систем и реестров публиковались паспортные данные, ИНН, СНИЛС и иные персональные данные граждан. Самая яркая из описанных там историй - это раскрытие данных о СНИЛС в электронных сертификатах и цифровых подписях к документам сделанных этими сертификатами.

Другой пример в виде дискриминируемых групп был в раскрытии данных о людях подозреваемых в преступлениях, например, в сообщениях арбитражных судов [3] и разного рода уполномоченных гос-вом агентов.

До недавних пор чиновников обязанных сдавать декларации публикуемые на сайтах органов власти также можно было бы отнести к подобным дискриминируемым меньшинствам. Эта дискриминация была основана на контроле над бюрократией со стороны политического руководства и большим пластом международных практик, соглашений, инициатив по прозрачности государства. А то есть контроль политической власти над властью административной.

Сейчас, когда Минюст инициирует раскрытие данных персональных данных иностранных агентов, де факто - это как раз пример признания власти другой группы лиц, в данном случае обладающих медийной властью (по мнению Минюста, полагаю). Что, разумеется, большое лукавство и сам способ дискриминации выглядит не только архаично, но и предельно цинично.

Как и всё законодательство об инагентах эта инициатива весьма порочна по своей природе. Лично я считаю что законодательство должно меняться в сторону снижения раскрытия личных данных о гражданах, а не политически мотивированным расширением.

В России именно государство, в своей широкой массе органов власти, бюджетных учреждений и уполномоченных организаций, и является совокупностью крупнейших нарушений в сборе и публикации персональных данных. И с той поры как я публиковал то исследование по "легальным утечкам" персональных данных мало что изменилось.

Ссылки:
[1] https://www.rbc.ru/politics/13/11/2022/6370be7d9a79471426620f95
[2] https://begtin.tech/pdleaks-p3-govsys/
[3] https://www.asv.org.ru/news/612038

#privacy #security #data #personaldata

Читать полностью…

Ivan Begtin

Пока все обсуждают разного рода макрополитические аспекты саммита G20 я не могу не обратить внимание на обсуждавшиеся там вопросы открытости. А на саммите обсуждались темы связанные с прозрачностью и открытостью. Подробнее можно прочитать в B20 Indonesia 2022. Integrity and compliance task force. Policy paper [1]. Там же есть и про открытые данные в других областях, важно что тема не просто есть на повестке, но и развивается.

#opendata #opengov

Ссылки:
[1] https://t.co/T6Jd3B6sCH

Читать полностью…

Ivan Begtin

Я регулярно писал о том что в России много открытых и общедоступных данных гос-ва через открытые API, нигде не документированные, но существующие [1]. Но это, конечно же, не только российская специфика и очень многие сайты создаются по архитектуре Jamstack [2] и данные подгружаются через вызовы REST API или запросы GraphQL.

Такой подход имеет много преимуществ при доступе с мобильных устройств и для ускорения настольных браузеров, но имеет один важнейший недостаток - контент сайтов выпадает из архивации. Поэтому, к примеру, многие данные с сайта Мэрии Москвы (mos.ru) не архивируются, они доступны только через API и не присутствуют в форме HTML кода.

А вот выдался и наглядный пример из другой страны. Относительно недавно обновился официальный сайт органов власти Республики Казахстан (www.gov.kz) [3]. Выглядит он сейчас весьма прилично, быстро грузится и обладает многими полезными характеристиками: удобным поиском, чёткой структурой и быстрым откликом.

И, как Вы уже догадались новый сайт Правительства Казахстана сделан именно таким. Почти весь контент отдаётся через GraphQL или REST API. Например, документы Министерства цифрового развития, инноваций и аэрокосмической промышленности Республики Казахстан [4] возвращаются именно через такое API [5]. Аналогично новости, события, вакансии, госуслуги, жизненные ситуации и тд. по всем организациям на этом портале.

Казалось бы почему бы не публиковать их сразу как открытые данные? Но это другой вопрос. Сейчас ничто не мешает желающим превращать данные из API с этого сайта/этой госсистемы в общедоступные наборы данных.

Но, конечно, это никак не поможет тому что сайт gov.kz будет хуже индексироваться поисковыми системами, что архивы материалов в Интернет-архиве (archive.org) будут не полны и что если теперь делать архивную копию этого сайта, то надо учитывать ещё и его API.

Ссылки:
[1] /channel/begtin/3303
[2] https://jamstack.org/
[3] https://www.gov.kz
[4] https://www.gov.kz/memleket/entities/mdai?lang=ru
[5] https://www.gov.kz/api/v1/public/content-manager/documents?sort-by=created_date:DESC&projects=eq:mdai&page=1&size=10

#opendata #opengov #digitalpreservation #webarchives #api #government #kazakhstan

Читать полностью…

Ivan Begtin

В рубрике полезных инструментов по работе с данными, сервис GraphCommons [1] по визуализации графов онлайн. Он существует относительно давно и даже частично с открытым кодом [2] для подключения к нему программным образом.

Сервис позволяет рисовать довольно сложные графы, указывая типы объектов, виды связей и многое другое. Основное применение - это визуализация разного рода данных для презентаций или чтобы поделиться ими публично. Можно посмотреть на примере графа экосистемы открытости во Франции [3]. Выглядит неплохо, но не бизнес модель не тянет или тянет не до конца, компания не привлекала венчурного финансирования и создание графов в моменте не кажется ежедневно используемым продуктом. Для графов в расследованиях есть иные инструменты.

Тем не менее Graph Commons и Kumu, другой похожий продукт и компания, весьма любопытные продукты для визуализации графов.

На Kumu я когда-то делал довольно визуализаций помогающих структурировать какие-либо материалы, например, верхнеуровневый граф предустанавливаемого российского ПО в на телефоны для андроида [5]. Но это, что называется, самый что ни на есть простой пример, более сложные, увы, не имею права показывать. Но, в итоге, Kumu как продукт скорее разочаровывающий. Потенциал хороший, развитие минимальное.

Кроме этих двух продуктов есть много других: Neo4J, GraphXR, Aleph, Maltego, Linkurious, Graphistry и другие.

Ссылки:
[1] https://graphcommons.com
[2] https://github.com/graphcommons
[3] https://graphcommons.com/graphs/baa12ee7-e391-4f02-acd6-dda3b73d8c9d?show=info
[4] https://kumu.io/
[5] https://embed.kumu.io/db05ce5d67611103337a6a101da9d937

#graph #dataviz #startups #data

Читать полностью…

Ivan Begtin

Для тех кто недавно подписался и в качестве регулярных напоминаний о том кто я и о чем тут пишу.

Я много лет в занимаюсь темой открытых данных и возглавляю АНО Инфокультура НКО со специализацией на открытости данных, государства и, в последние годы, приватности. Наши проекты включают Госзатраты, Открытые НКО, Простым языком и многие другие, их можно найти на сайте. У Инфокультуры есть телеграм канал @infoculture․ Много лет мы организовывали ежегодное мероприятие Open Data Day в России, в этом годы мы не стали этого делать поскольку как диалог с гос-вом она более не работает, большинство людей активно действовавших в открытости гос-ва покинули Россию.

Также я являюсь основателем проекта Национальный цифровой архив (Ruarxive) в котором наша команда архивирует сайты и иной цифровой контент находящиеся под угрозой исчезновения. О нём можно узнать больше в телеграм канале @ruarxive.

Цифровой архив (Ruarxive) и исследования о приватности такие как Исследование приватности мобильных приложений в RuStore - это то на чём мы делали акцент последние пару лет, видя как ухудшается ситуация с открытостью в России.

Пока ещё всем этим удаётся заниматься, хотя и риски растут, а многие наши друзья и некоммерческие организации были признаны инагентами, покинули страну и подвергаются ничем не обоснованным гонениям. Но, безусловно, ресурсов на некоммерческую деятельность стало сильно меньше.

Сейчас значительная часть всей этой некоммерческой активности финансируется тем что она поддерживается нашей коммерческой ИТ компанией где наша ИТ команда делает коммерческие и некоммерческие ИТ проекты, часть из которых известны, часть гораздо меньше чем публичные некоммерческие проекты. Подробнее о нашей компании DataCoon и продаем сервисы через такие продукты как APICrafter.

В основе всех проектов лежит открытый код, значительная часть которого открыта нами и публикуется на нескольких аккаунтах на Github.

Я лично финансирую деятельность Инфокультуры и некоммерческие проекты занимаясь консалтингом, консультациями и преподаванием по темам работы с данными и передавая полученные средства на некоммерческую деятельность.

Из России вы можете помочь нашим проектам пожертвовав на сайте Инфокультуры, а также при заказе нам технологических проектов и продуктов можете быть уверены что часть этих средств пойдет на поддержание некоммерческой деятельности.

Также, для проекта Цифрового архива можно пожертвовать сервера, компьютеры, диски, системы хранения и сетевое оборудование. Мы используем его для создания резервных копий и улучшения инфраструктуры проекта.

В этом телеграм канале (@begtin) я пишу по темам открытости данных, технологиях, работы с данными в принципе, инженерии данных, государственных технологиях (gov tech) и стартапах.
Значительно реже, я пишу о общетехнологических вопросах и проблемам с которыми все мы сталкиваемся.

Пожалуйста, имейте это в виду когда подписываетесь, вполне возможно что темы этого канала могут оказаться слишком техническими для кого-то и недостаточно глубоко техническими для других.

#opendata #opensource #opengov #infoculture

Читать полностью…

Ivan Begtin

Похоже, ПЕРВАЯ УГОЛОВКА за использование VPN в личных целях!

Подписчик, Андрей Лаптев, прислал прекрасное. Томский районный суд приговорил гражданина К. к 3-м годам ограничения свободы за использование VPN-программы, квалифицировав данное деяние по ст.273 УК РФ (вредоносные программы). Осужденный признал, что с помощью VPN были нейтрализованы средства защиты компьютерной информации, выразившиеся в невозможности однозначной идентификации пользователя и его сетевой активности в сети «Интернет».

Оборот «регулярно осуществлял запуск вредоносной компьютерной программы со своего персонального компьютера, тем самым используя ее» поверг меня в легкий ступор, но такова уж наша судебная лексика.

Обратите внимание. Речь идет об ограничении свободы, а не о лишении. То есть в места не столь отдаленные 👮 виновник не пойдет, но три года - это три года! Железный занавес 🤬 все ближе…

ЗЫ. По ссылка пока только резолютивная часть - приговор в силу еще не вступил.

Читать полностью…

Ivan Begtin

Вышел доклад/исследование State of Frontend [1] по технологиям фронтэнд разработки основанный на опросе 3703 разработчиков и с комментариями нескольких экспертов. Хотя я лично и далёк от темы фронтэнда, но тут большой любопытный текст с интересными результатами.

Вот подборка фактов:
- большинство прошедших опрос работают дистанционно: 59.7%, ещё 35.3% в гибридном формате
- в безусловных лидерах фреймворки Angular (51%) и React (25%), наиболее перспективные Svelte и Next.js
- самые популярные дизайн системы Material UI, Tailwind UI и Bootstrap
- Typescript используют 84% разработчиков и большинство (43%) считают что он заменит Javascript однажды
- большинство используют сервера AWS (Amazon) или свои собственные
- подавляющее большинство используют Visual Studio Code: 74.4%

И там ещё много всего, что-то кажется очевидным, что-то совсем нет. Например, про VS Code или про Typescript.

Ссылки:
[1] https://tsh.io/state-of-frontend/

#reports #research #frontend #javascript #development

Читать полностью…

Ivan Begtin

Тем временем в Финляндии организуют конкурс на создание приложений по преодолению энергетического кризиса [1], ключевое условие - использование открытых источников данных или частных данных и реализация проекта на принципах честной экономики данных (fair data economy) о которой их мозговой центр Sitra публиковал свод правил [2]. Идей для конкурса там много, например, рекомендации потребителям по времени использования электричества за меньшую цену или анализ энергопотребления домохозяйств или бизнеса и рекомендации по корректировке.

В целом публикация открытых данных и конкурсы и хакатоны и иные соревнования для этого и нужны, для решения актуальных задач.

Для участия не обязательно быть из Финляндии, но заявки из России врядли примут. Возможные суммы финансирования: от 5 до 15 тысяч евро на первом этапе и от 20 до 65 тысяч евро на втором.

Ссылки:
[1] https://www.sitra.fi/en/projects/call-for-solutions-using-data-to-curb-energy-use/
[2] https://www.sitra.fi/en/publications/rulebook-for-a-fair-data-economy/

#opendata #contests #energy #finland

Читать полностью…

Ivan Begtin

В рубрике интересных инструментов с открытым кодом для работы с данными и не только, сегодняшняя подборка:
- Surrealdb [1] распределённая СУБД с поддержкой SQL и NoSQL, написана на Rust, позиционируется как СУБД для веба реального времени. По факту, конечно, реального времени там нет. Много разных интересных возможностей и собственный язык запросов SurrealQL [2]
- Mastodon [3] альтернатива Твиттеру с открытым кодом. О нём многие давно знают, поэтому просто напоминание для тех кому Твиттер может стать дискомфортным после прихода туда Элона Маска
- Stash [4] очень важный и нужный и актуальный инструмент по организации порно на собственном компьютере/сервере.
- Hosts [5] файл hosts из 152+ тысяч записей тщательно собранных и используемых, например, для фильтрации контента. По сути это агрегатор из десятков источников используемых для защиты компьютеров пользователей.
- Awesome forensic tools list [6] мой собственный репозиторий с коллекцией инструментов для цифрового дознания. Чаще оно называется OSINT и используется для сбора данных из доступных источников.

Ссылки:
[1] https://github.com/surrealdb/surrealdb
[2] https://surrealdb.com/features#surrealql
[3] https://github.com/mastodon/mastodon
[4] https://github.com/stashapp/stash
[5] https://github.com/StevenBlack/hosts
[6] https://github.com/ivbeg/awesome-forensicstools

#opendata #opensource #datatools

Читать полностью…

Ivan Begtin

Про открытый код, роль государства и что не так с этим сейчас в России и не только

Я много лет занимался проектом Open Source Government [1] оценки того как много и как именно открытого кода публикуют органы власти по всему миру. Собственно ещё в прошлом году были планы сделать его не pet-проектом, а полноценным, с веб-сайтом, рейтингом и тд., но он основывался на данных о коде публикуемом органами власти и гражданскими хакерами на Github [2]. Перспективы публикации там российского госкода теперь минимальны. Так что если его делать то только без России.

И вот об этом я хочу в очередной раз сказать, блеск и нищета открытости кода в России в отсутствии не только внятной госполитики его поддержки, но и применения открытого кода в целом.

Ключевое тут в том как открытый государственный код становился госполитикой в мире и как он продолжает развиваться. Поскольку это жанр текста в телеграм, я не буду тут приводить много ссылок на законы и публикации, только тезисами:
1. Политика открытого кода в фактическом регулировании начиналась в областях создания общественного блага на деньги налогоплательщиков. А то есть - это научные работы, исследования и иные продукты создаваемые за счёт государственных грантов. Большая часть открытого кода и, кстати, открытых данных в США созданы государственными научными учреждениями. Аналогично во многих других странах.
2. Открытый код публикуемый органами власти - это то же самое что открытый код крупный корпораций и компаний. Сильным трендом это стало за последние 15 лет и, причины этого в:
а) Появлении больших платформ открытой разработки таких как Github, Gitlab и др.
б) Появлении большого числа гражданских хакеров (civic hackers), людей заинтересованных в улучшении сервисов государства и готовых помогать в этом
в) Стремлении экономить средства налогоплательщиков
г) Необходимости интеграции в существующие экосистемы открытых проектов, когда чтобы улучшить их под себя необходимо и самому публиковать открытый код.
3. В России отсутствуют и отсутствовали требования РНФ, РГНФ, РНЦИ и других каналов госфинансирования науки по обязательному раскрытию кода. Научные организации если и публикуют открытый код, то это единичные случаи, часто не подкреплённые даже локальными нормативными документами.
4. В России у государственных органов опыта ведения открытой разработки нет. Подчеркну, не раскрытия кода, а именно ведения открытой разработки. Публикация кода - это процесс связанный с прозрачностью гос-ва. Оно необходимо для технического аудита и важно, но открытая разработка - это публичность команды разработки, готовность этой команды вести технологический евангелизм, взаимодействовать с другими и вовлекать других разработчиков в улучшение продуктов.
5. В мире таких людей много, но не фантастически много, чаще всего к разработке кода на государство привлекались/нанимались люди, либо из сообществ гражданских хакеров, либо с хорошим личным опытом в работе над открытым кодом. Многие известные мне команды и отдельные разработчики имели опыт с работой над открытым кодом государственных научных учреждений.
6. Отдельная и важная категория гражданских хакеров, кто-то из них прагматично уходил работать на государство, потом возвращался или оставался, а кто-то продолжают развивать продукты на открытом коде не вступая с госорганами в трудовые отношения, получая гранты от частных или госфондов на развитие открытого кода.
7. В России большая часть таких гражданских хакеров господдержки не получало, а в течение последнего десятилетия ещё и были под нарастающим прессингом с признанием инагентами ряда НКО где они были.
8. Поэтому, в качестве тезиса, в России за эти годы государство не накопило ни компетенций, ни внятной госполитики, ни кадрового потенциала для создания репутации в открытости кода.

Читать полностью…

Ivan Begtin

Для тех кто любит программировать на Python и не любит Javascript не могу не рассказать о таком проекте как PyScript [1], код для исполнения кода Python'а на стороне браузера. Включает как простые, так и сложные примеры [2], а также по нему есть огромное руководство с кучей подробностей [3].

Признаюсь, я лично, никогда не любил разработку фронтэнда именно из-за Javascript'а, какое-то сильное чувство отторжение у меня вызывало его использование, так что не только Javascript'у проникать на сервер, но и Python'у в браузер.

А их свежего и любопытного - руководство по написанию расширений для Google Chrome с помощью PyScript [4].

Почему это важно? Многие продукты по обработке и визуализации данных не сервере написаны на Python. Если PyScript будет работать с хорошей производительностью, то часть задач обработки можно будет перенести в браузер и поддерживать единую кодовую базу.

Пока единственное ограничение в том что PyScript более-менее оттестирован в Chrome, но даже в Firefox'е его активно не проверяли.

Тем не менее, экспериментировать можно уже сейчас.

Ссылки:
[1] https://pyscript.net
[2] https://pyscript.net/examples/
[3] https://realpython.com/pyscript-python-in-browser/#modules-missing-from-the-python-standard-library
[4] petefison/write-chrome-extensions-in-python-6c6b0e2e1573" rel="nofollow">https://medium.com/@petefison/write-chrome-extensions-in-python-6c6b0e2e1573

#opensource #python #programming

Читать полностью…

Ivan Begtin

Я регулярно рассказываю про работу над выявлением смысловых типов данных, это моя любимая тема в работе с данными - семантические типы данных. Я писал об этом большой текст на английском языке [1] и про проекты metacrafter [2] по идентификации типов данных и metacrafter-registry [3] реестр семантических типов данных.

В них пока небольшие, но обновления.
1. В реестр добавлены много типов персональных данных в реестр, например, идентификаторы паспортов [4] и водительских удостоверений. Везде где возможно приведены регулярные выражения для проверки этих типов данных.
2. Добавлены новые правила идентификации смысловых полей для русского и французского языка. Теперь можно использовать metacrafter на русскоязычных и франкоязычных наборах данных.

И, конечно, всё это расширяемые проекты и если какие-то данные ещё не идентифицируются, то их можно добавить.

А я напомню что metacrafter сейчас используется в другом нашем проекте Datacrafter для идентификации типов данных в каталоге [7].

Ссылки:
[1] ibegtin/semantic-data-types-systematic-approach-and-types-registry-a2c2a60a467b" rel="nofollow">https://medium.com/@ibegtin/semantic-data-types-systematic-approach-and-types-registry-a2c2a60a467b
[2] https://github.com/apicrafter/metacrafter
[3] https://github.com/apicrafter/metacrafter-registry
[4] https://registry.apicrafter.io/datatype/aupassport
[5] https://registry.apicrafter.io/datatype/cadriverlic
[6] https://github.com/apicrafter/metacrafter/tree/main/rules
[7] https://datacrafter.ru/class

#opensource #datatools #data #dataengineering

Читать полностью…

Ivan Begtin

В рубрике больших открытых наборов данных The Stack [1] 3.1 терабайта 300 миллионов файлов исходного кода на 30 языках программирования с разрешающими лицензиями (permissive licenses) на его повторное использование. Опубликован на Hugging Face, кроме программных языков, охватывает около 20 естественных языков (английский, китайский, испанский, русский и др.)

Является результатом проекта BigCode [2], совместных усилий команд ServiceNow и Hugging Face․

Можно сказать что это большой шаг вперед к развитию языковых моделей для программного кода и появлению новых продуктов похожих на Github Copilot и аналоги, но, на сей раз, с соблюдением лицензионной чистоты.

А также большой тред в твиттере с рассказом об этом наборе данных [3]

Ссылки:
[1] https://huggingface.co/datasets/bigcode/the-stack
[2] https://www.bigcode-project.org/
[3] https://twitter.com/BigCodeProject/status/1585631176353796097

#opendata #opensource #datasets

Читать полностью…

Ivan Begtin

DuckDuckGo добавили в своё приложение для Android возможность отслеживать отслеживающих, перехватывать и блокировать отправку данных о пользователе трекерами в мобильных приложениях. Об этом в заметке в The Verge [1]․

У меня после обновления приложение активировалось только на одном Андроид устройстве, на втором пока говорит что надо присоединиться к листу ожидания.

На этом устройстве у меня сейчас нет госприложений, поэтому не могу ничего сказать про них, но обязательно проверю позже. Зато есть такие приложения как Яндекс Такси, Тинькофф банк и Discord. Их всех успешно DuckDuckGo перехватывает.

Думаю что скоро у DuckDuckGo будет потрясающая по масштабам база результатов мониторинга слежки и возможность рейтинговать приложения по её масштабам.

Обратите внимание - это не статический анализ и проверка на "принциальную возможность утечки", это отслеженные факты передачи данных о пользователе.

Само приложение DuckDuckGo можно поставить здесь [2]

P.S. Если у Вас стоят госприложения на телефоне из списка [3] не поленитесь потратить немного времени и замерить куда и какую информацию они сливают․ Присылайте скриншоты или ссылки на Ваши телеграм каналы если Вы запостите эти скриншоты туда.

Ссылки:
[1] https://www.theverge.com/2022/11/16/23462053/duckduckgo-app-tracking-tool-beta-android-users
[2] https://play.google.com/store/apps/details?id=com.duckduckgo.mobile.android
[3] https://apps.rustore.ru/state

#privacy #government #tracking

Читать полностью…

Ivan Begtin

Недавно я написал про то какое открытое API есть на сайте органов власти Казахстана [1], такой подход к доступу к контенту имеет свои плюсы и минусы. Да, минус в сложности архивации, но плюсы в скорости отображения, в работе на мобильных устройствах и тд. В целом можно обсуждать и дискутировать насколько он оправдан и что задачи архивации можно решать, например, публикацией наборов данных.

Но, изначально, к мыслям о проблемах доступа к материалам меня натолкнул последний сайт российского Росстата где с недавних пор почти весь контент подгружается через Javascript.

Возьмём любую произвольную страницу со списком публикаций [2]. Внутри страницы нет HTML контента, только обрамление, а реальный контент подгружается через Ajax запрос который возвращает JSON объект внутри которого HTML веб страница [3].

Такой подход применяют когда есть цель целенаправленно ограничить доступ поисковых систем и краулеров к контенту. Или по большому недомыслию.

Всегда хочется надеяться на второе, но приходится учитывать и первое.

Это не означает что контент на сайте Росстата не индексируется, если даётся ссылка на прямую публикацию, вроде такой [4] то там есть контент и она будет проиндексирована. Но это уже не заслуга сотрудников Росстата, а скорее если кто-то на эти публикации где-то ещё ссылается. Иначе говоря глобальные поисковики индексируют сайт и документы Росстата потому что другие сайты ссылаются на отдельные документы, но сам сайт организован так чтобы индексирование было ограничено.

Ссылки:
[1] /channel/begtin/4380
[2] https://rosstat.gov.ru/compendium
[3] https://rosstat.gov.ru/compendium/getPage?page=1&order=
[4] https://rosstat.gov.ru/compendium/document/50801

#data #statistics #government #opendata

Читать полностью…

Ivan Begtin

Сейчас многие активно обсуждают решение Сената Франции с рекомендацией Правительству Франции о признании Нагорно-Карабахской республики и призывом к выводу азербайджанских войск с территории Республики Армения [1], а я как раз давно планировал написать о том как Сенат Франции публикует данные о своей деятельности.

На сайте Сената есть баннер со ссылкой на их портал открытых данных [2] где не только собраны сведения о выборах, принятых законопроектах, сенаторах, полученных ими грантах и всё это в форматах CSV, JSON и XML, но там также есть такое редкое явление как полные дампы базы данных публикуемые в формате SQL дампов для СУБД Postgres.

Например, база поправок в законодательство, Ameli [3] и в 100 мегабайтном ZIP файле содержит 500 мегабайтный SQL файл. Для полной радости не хватает только чтобы они вообще всю базу целиком публиковали для выгрузки, а не несколькими SQL файлами и чтобы к данным и к дампам баз данных была бы более полная документация.


Ссылки:
[1] http://www.senat.fr/dossier-legislatif/ppr22-003.html
[2] https://data.senat.fr/
[3] https://data.senat.fr/ameli/

#opendata #datasets #france #parliaments #opengov

Читать полностью…

Ivan Begtin

Такое чувство что всех дата продуктами интересуется, пользуется и развивается как аналитик данных и дата инженер не обошла тема modern data stack. Я регулярно писал о том как эта концепция набирала обороты последние 2-3 года и сейчас превратилась в какой-то непрерывный хайп. Вот и автор текста Is It Time To Rebrand (or Rethink) the Modern Data Stack? [1] соучредитель стартапа Validio задаётся тем же вопросом.

Не пора переосмыслить само это понятие?

А с другой стороны интервью с основателем dbt по поводу партнерств в Modern data stack [2].

Лично я бы сказал так, что для применения в гос продуктах modern data stack пока, практически, невозможен или крайне ограничен, поскольку все танцы с бубном тут вокруг облачных хранилищ и их экосистемы.

А для стартапов и корпоративных продуктов и дата инфраструктуры это актуально, но надо делить на 10 все обещания "серебрянных пуль". И отдавать себе отчет в рисках и моделировании инфраструктуры из десятков компонентов вне своего прямого контроля.

Ссылки:
[1] https://betterprogramming.pub/is-it-time-to-rebrand-or-rethink-the-modern-data-stack-5d76366e3c95
[2] https://www.madrona.com/dbt-labs-founder-tristan-handy-on-the-modern-data-stack-partnerships-and-creating-community/

#moderndatastack #data #readings

Читать полностью…

Ivan Begtin

В рубрике полезного регулярного чтения

Tragedy of the Digital Commons [1] свежая научная статья об открытом исходном коде и роли государства в контексте уязвимости Log4Shell. Суть статьи в размышлении вокруг проблемы того что сообщество открытого кода само не всегда может оперативно и с достаточными ресурсами реагировать на zero-day уязвимости и о том какова роль государства в этом всём. Автор приходит к мысли что государство выступает как орган стандартизации, клиент, регулятор и контрибьютор кода, а также как потенциальная ресурсная база для сообществ открытого кода. При этом то что саморегулирование в открытом коде распространено повсеместно и попытки прямого регулирования могут повредить.

GDP is getting a makeover — what it means for economies, health and the planet [2] статья в Nature о том том что GDP (ВВП) теперь является плохой метрикой экономики и что эта метрика должна быть заменена, приводятся несколько подходов к такой замене в том числе через Gross Ecosystem Product (GEP) [3]. Помимо всего прочего это может изменить подход к макроэкономической статистике и её расчетам.

Ethics, Integrity and Policymaking [4] книга об этичном регулировании и доказательной политике, в открытом доступе. Она вся построена из примеров в Хорватии, Великобритании, Индии, Эфиопии и не только. Плюс затрагивает тему регулирования и применения в регулировании искусственного интеллекта.

Data Structures the Fun Way [5] книга рассказывающая о структурах данных смешным образом. С сайта можно скачать одну главу, а целиком только если заказать онлайн. По сути книга о том как устроена организация разного типа данных, но в слегка юмористическом стиле в части примеров и диалогов. Полезно для всех кто разрабатывает базы данных и работает с данными в задачах требующих высокой производительности.

Ссылки:
[1] https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4245266
[2] https://www.nature.com/articles/d41586-022-03576-w
[3] https://www.nature.com/articles/d41586-020-01390-w
[4] https://link.springer.com/book/10.1007/978-3-031-15746-2#about-this-book
[5] https://nostarch.com/data-structures-fun-way

#opensource #opengov #security #opendata #data #policymaking #readings

Читать полностью…

Ivan Begtin

Mage.ai свежий инструмент по организации пайплайнов для обработки данных [1]. Его команда позиционирует продукт как замену Airflow. За продуктом команда поднявшая $6.3M инвестиций в октябре 2021 года на ИИ инструмент для разаботчиков продукта.

Если честно, ИИ там не видно, но есть аналог Airflow со смазливым интерфейсом и неполной документацией. Тем не менее продукт любопытный, последить за ним стоит.

Ссылки:
[1] https://www.mage.ai/
[2] https://www.crunchbase.com/organization/mage-38af/company_financials

#data #startups #datatools

Читать полностью…

Ivan Begtin

Подробности по делу за использование VPN, на самом деле там оказался не VPN, а мессенжер Vipole

что ничуть не лучше, поскольку формулировки дела таковы:
...осуществил поиск вредоносной компьютерной программы «Vipole», выражающейся в невозможности однозначной идентификации пользователя сети «Интернет» и его сетевой активности...
и
...осознавая, что использование данной программы приведет к нейтрализации средств защиты компьютерной информации провайдеров, регулярно осуществлял запуск вредоносной компьютерной программы «Vipole» со своего персонального компьютера, тем самым используя ее...

Под эти формулировки попадают, и VPN, и мессенжеры вроде Signal и ещё много что.

#privacy #security #vpn #messengers

Читать полностью…

Ivan Begtin

Полезное чтение про данные и не только:
- No, you don’t need MLOps [1] текст о том что MLOps это маркетинговый термин на который не надо покупаться и есть много инструментов настолько упростивших создание моделей для data science что покупаться на MLOps не нужно.
- Raster4ML [2] программная библиотека для Python по извлечению данных для машинного обучения из спутниковых снимков. По сути превращает растр в данные
- Command-line data analytics made easy [3] заметка про spysql, утилиту командной строки на Python позволяющей делать SQL подобные запросы к файлам CSV или JSON.
- Process Large Dataset with DataTable, Replacement for Pandas Library? [4] потенциальная альтернатива Pandas, библиотека datatables. Довольно давняя, но и Pandas интегрировано много с чем что сильно его ускоряет.

Ссылки:
[1] https://lakshmanok.medium.com/no-you-dont-need-mlops-5e1ce9fdaa4b
[2] https://raster4ml.readthedocs.io/index.html
[3] https://danielcmoura.com/blog/2022/spyql-cell-towers/
[4] https://towardsdev.com/process-large-dataset-with-datatable-replacement-for-pandas-library-31414cbba549

#readings #data #datatools #opensource

Читать полностью…

Ivan Begtin

В рубрике полезных инструментов по работе с данными, инструменты по документированию баз данных.
- schemaspy [1] довольно древний популярный инструмент по генерации документации к базам данных. На входе настройки подключения, на выходе папка с HTML файлами. Сам движок написан на Java, поддерживает только SQL базы данных, но не все.
- dbdocs.io [2] онлайн сервис/продукт по генерации документации к базам данных․ Кусочек в открытом
коде, но сам сервис онлайн. Self hosted версии пока нет․ Эта же команда разработчики стандарта DBML [3] по описанию баз данных
- tbls [4] движок по генерации документации написанный на Go. В том числе поддерживает NoSQL и генерацию документации в разных форматах и с очень гибкими настройками.
- SchemaCrawler [5] открытый код на Java и поддержка любой СУБД через JDBC, очень много возможностей и опций.

А также есть много узкоспециализированных инструментов и коммерческих продуктов.

В средних и крупных компаниях сейчас такими инструментами пользуются редко поскольку мигрируют на каталоги данных и системы управления метаданными, поскольку важнее становится не только то где данные хранятся, а все объекты дата-инженерии, взаимосвязи, data lineage (нет нормального перевода этого термина) и так далее.

Тем не менее инструменты документирования данных имеют своё применение. Лично я предполагаю их будущее в направлении загрузки данных в каталоги данных.

Ссылки:
[1] https://github.com/schemaspy/schemaspy
[2] https://dbdocs.io
[3] https://www.dbml.org
[4] https://github.com/k1LoW/tbls
[5] https://github.com/schemacrawler/SchemaCrawler

#data #datatools #opensource #datadocumentation #datacatalogs

Читать полностью…

Ivan Begtin

Интересные стартапы про данные и их свежие раунды финансирования:
- Galileo [1] MLOps платформа для интеграции машинного обучения на Python с подключением отладки и мониторинга. Подняли раунд А на $18M.
- Dataloop [2] стартап по разметке данных с фокусом на качество данных. Получили $33M в рамках раунда B
- Alation [3] стартап за одноимённым продуктом каталогов данных. Подняли $123M в рамках раунда E. У них много продуктов, непонятно на какой именно пойдут инвестиции.

Ссылки:
[1] https://techcrunch.com/2022/11/01/mlops-platform-galileo-lands-18m-to-launch-a-free-service/
[2] https://dataloop.ai/blog/dataloop-raises-33-million-to-help-companies-build-data-engines-for-ai/
[3] https://www.alation.com/press-releases/alation-raises-series-e-funding/

#data #startups

Читать полностью…

Ivan Begtin

9. Одна из наиболее внятных и разумных инициатив - конкурсы Код-ЦТ и Код-ИИ организуемые Фондом содействия инноваций - это реальные попытки хоть что-то изменить и попытаться опереться на те ИТ компании и ИТ команды которые готовы и умеют развивать продукты с открытым кодом. ФСИ даёт гранты даже большие чем германский Prototype Fund, но это капля в море по сравнением с субсидиями академическим институтам и университетам на научную деятельность результат которой не виден, не известен и закрыт.
10. Аналогично с инициативами связанными с Национальным репозиторием кода, Гостехом и ещё много чем. Для понимания, в основе Гостех в Сингапуре или в Эстонии открытый код. Все лучшие примеры цифровизации госухи в мире на которые сотрудники РосГосТеха могут ссылаться тоже будут открытыми, а вот их платформа даже намеков на открытость не имеет
11. В случае с национальным репозиторием кода, то что он заменит ФАП не означает что код там будет открыт. Скорее он будет открыт для технического аудита, но даже не факт что разработка будет вестись в нём, а не использоваться только для публикации кода в момент сдачи контрактной отчетности. Это уже прогресс, но медленный.
12. Но, я повторюсь, что всё начинается с открытости результатов научных исследований. Почему он не публикуется? Спросите Минобрнауки, но там даже отвечать некому;)

Тут надо бы добавить что всё это было справедливо в мирные времена, а сейчас многие из тех кто понимает что и как можно было бы исправить и изменить, не будут работать с российскими госорганами ни на каких условиях, даже если госполитика цифровизации была бы иной.

Ссылки:
[1] https://data.world/ibegtin/open-source-government-project
[2] https://government.github.com/

#government #opensource #it #opendata #openaccess #research

Читать полностью…

Ivan Begtin

В рубрике полезного чтения про данные, технологии и не только:
- Coding for economists [1] руководство по программированию для экономистов, автор пишет книгу которая уже частично доступна. В книге о том как обрабатывать экономические данные, статистику, много примеров в Jupyter Notebook, эконометрии и визуализации данных. Напоминает похожие книги по программированию для историков и многих гуманитарных профессий.
- Dashboard Design Patterns [2] шаблоны проектирования дашбордов собранные группой специалистов по визуализации. Полезно, но оторвано от шаблонов потребления значений в дашбордах, это ощущается и по команде тех кто делает ресурс, почти все они из академического сообщества.
- Where are the Datasets? A case study on the German Academic Web Archive. [3] автор научной статьи попытался поискать наборы данных на сайтах академических учреждений Германии используя веб архив GAW (German Academic Web) с архивом сайтов основных научных институтов Германии. Автор пишет что мало что удалось найти и многое ещё можно сделать.


Ссылки:
[1] https://aeturrell.github.io/coding-for-economists/intro.html
[2] https://dashboarddesignpatterns.github.io/
[3] https://amor.cms.hu-berlin.de/~jaeschkr/pdf/younes2022where.pdf
[4] https://german-academic-web.de/

#opendata #data #dataviz #opensource

Читать полностью…
Подписаться на канал