4471
Перлы из жизни аналитиков и ds — от безобидных заблуждений до откровенного надувательства. Посвящается AI-евангелистам (любителям интеграций формул в экселе и LLM). Для связи @NikitaZelinskiy
Уже в пятый (юбилейный) раз мы открываем набор в ШАД МТС 🥳 (а в сл пятницу буду вручать дипломы выпускникам)
В этом году по следам фидбека студентов мы немного поменяем программу (сделаем еще плотнее) и процесс вступительных (ровно сейчас делаю сами задания — велком с предложениями)
Для тех кто не знаком — учим год, базово два занятия в неделю по 3 часа, не считая факультативных, много домашек, практики — для студентов и слушателей разворачиваем инфру с iceberg и прочими модными вещами.
Летом проекты с продуктовыми командами со всей группы команий — от КМОН до рекламы, в процессе обучения можно попасть на стажировку или даже сразу в штат.
Если зачислили слушателем — тоже не беда, при должном усердии переведем в студенты.
Заявки принимаются с 1 по 25 октября. До 1 ноября нужно будет пройти входное тестирование.
⚫️Подать заявку⚫️
#оффтоп #корпжиза
У медузы Chironex fleckeri — 24 глаза. Они расположены в четырёх сенсорных структурах — ропалиях, по 6 глаз на каждом. Глаза разные — 2 на каждом ропалии имеют линзы и способны формировать изображение, а остальные 4 проще и в основном воспринимают свет и движение.
24 глаза, обзор 360 градусов, а мозга нет.
Ничего не напоминает?
Как устроена отчетность в корпорациях?
Сотни отчетов с десятками параметров и разрезов, пользуется ими постольку-поскольку, какие управленческие решения на их основе принимаются — вообще загадка.
Кто-то пошел дальше и внедрил BI — часть отчетов стандартные, а часть юзеры под себя кастомизируют (поделать группировки, подобавлять показатели, пофильтровать, поуправлять временным окном).
Как отвечает чуть-чуть опытный аналитик на любой вопрос?
«А это смотря как посчитать!» чем доводит до белого каления любого менеджера.
С тем большим интересом послушал в записи доклад про BI в эпоху агентов, который был на субботней конфе (спасибо тем конференциям кто выкладывает записи в свободный доступ).
Точно я вынес одно — когда пользователям в руки дали еще и агентов, то нагрузка на инфру самого BI быстро и сильно (по словам спикера — на порядок, то есть раз в 10) выросла.
Стал ли бизнес больше зарабатывать — как всегда в случае BI вопрос риторический.
PS другие доклады тоже доступны в записи https://events.yandex.ru/events/data-driven-2026
#ML
Есть у меня искренняя убежденность что Knowledge Graphs все же не самый плохой подход к хранению агентской памяти: тут и трассировка фактов и связь их между собой, в тч противоречивость и много другого хорошего, писал об этом в журнале
Тогда обратил внимание на Stardog как систему агентской памяти
Но они не одни такие, и вот копался на днях в SurrealDB — они тоже про Knowledge Graphs и агентскую память, все такие модные.
Но не попробуешь — не узнаешь, надо устанавливать, установка предлагается по-модному, копирование в буфер промыта к LLM
Fetch and execute the appropriate instructions to set me up for SurrealDB from https://surrealdb.com/docs/agents/instructions.md
make fetch install clean
make fetch install clean
Из серии «подслушано у кулера»
— У нас в проектном офисе уже больше 50 человек!
— А почему из них только 3 проектных менеджера?
кстати, про IFы
Есть у меня знакомый, очень талантливый парень из Ростова/Москвы, 10 лет работает лидом в большой и уважаемой ИТ-компании, отвечает за антифрод.
Раз в пару лет где-то как-то пересекаемся, спрашиваю что нового в науке антифрода.
Каждый раз он честно и серьезно отвечает что пишет SQL-запросы и логику на IF/CASE WHEN.
Но сейчас чуть другой сюжет.
Представьте задачу определения вероятности дефолта юрлиц (часто называют банковским скорингом, хотя владельцы облигаций знают эту задачу чуть в других терминах).
Юр лицо, особенно крупное, это достаточно сложная сущность с единым исполнительным органом — например:
хозяином в ООО УРК (ИНН 6670534016)
, верховным атаманом (ИНН 7708364030, 7702376889 и 5036056729)
, предводителем (ИНН 3906081950 и ООО СИМПЛИМЭДЖИН ИНН 7714908584)
, верховным шаманом (ИНН 1701062776) — все ссылки на сайт ФНС, ищите должность на второй странице выписки ЕГРЮЛ.
Еще юр лица часто живут в группах (не только для дробления бизнеса по выручке для налоговой оптимизации), имеют сложные схемы владения (иногда вообще кольцевые), неочевидных бенефициаров, сложные аффилированности и экономические отношения, через некоторые идут миллионы транзакции в месяц, а по другим наоборот, никаких данных нет (а около 600 ЮЛ даже ИНН не имеют, как и код иностранного ЮЛ).
Как поступают в таких случаях?
Делают отдельные модели по каждому домену данных:
— модель по данным арбитражей
— модель по данным транзакций
— модель по данным финансовой отчетности
— графовая модель, работающая на связях (юридических, экономических и каких только не придумается) — и назначающая финальный скор.
Вопрос только в том какой скор подавать на вход графовой модели и вообще как объединять предикты моделей для конкретного ЮЛ в зависимости от того какие данные были доступны.
Итак, лет 10 назад, когда нейронки только переживали очередной расцвет после зимы, самое высокое начальство потребовало чтобы DS не городили огород а сделали уже одну большую нейронyю сеть, которая все данные скушает и откалиброванный скор выплюнет (заодно и резервы сама посчитает, что уж).
Естественно, переубеждать высокое начальство смерти подобно, но в банках куча проверяющих органов, которые и сами не работают и другим не дают.
Как быть в ситуации когда:
⁃ нужна обязательно нейронка и это проверят
⁃ Которая пройдет строгую валидацию и статтесты в отдельном департаменте
⁃ Времени на разработку нет — сами витрины данных еще толком не появились в хадупе, про GPU и среды обучения нейронок инфраструктурщики даже по радио не слышали
?
Мы все учились понемногу, чему-нибудь и как-нибудь.
Как выглядит самая простая нейронная сеть с одним нейроном?
Правильно, это логистическая регрессия!
Итого, мы объединили скоры логрегом, на слайде для начальства гордо написали что модель выполнена в нейросетевой архитектуре — и все были довольны:
— риски получили хорошую понятную стабильную модель
— валидаторы дали зеленый свет и подтвердили архитектуру
— начальство уверенно вещало на страну про нейронную сеть
Так что часто в самых сложных и современных системах куча логики в портянках с IF / case when и это вполне нормально.
глаз задергался от этой рекламы агентов, а мб клин клином ? 🤔
Читать полностью…
На фоне новостей про супер-модель Astra и достижение AGI хотите доказательство что эта картинка про AI более чем точная?
Легко, ниже служебный шаблон системного промпта последнего Qwen3.8-Flash-Next:
{%- set image_count = namespace(value=0) %}
{%- set video_count = namespace(value=0) %}
{%- macro render_content(content, do_vision_count, is_system_content=false) %}
{%- if content is string %}
{{- content }}
{%- elif content is iterable and content is not mapping %}
{%- for item in content %}
{%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
{%- if is_system_content %}
{{- raise_exception('System message cannot contain images.') }}
{%- endif %}
{%- if do_vision_count %}
{%- set image_count.value = image_count.value + 1 %}
{%- endif %}
{%- if add_vision_id %}
{{- 'Picture ' ~ image_count.value ~ ': ' }}
{%- endif %}
{{- '<|vision_start|><|image_pad|><|vision_end|>' }}
{%- elif 'video' in item or item.type == 'video' %}
{%- if is_system_content %}
{{- raise_exception('System message cannot contain videos.') }}
{%- endif %}
{%- if do_vision_count %}
{%- set video_count.value = video_count.value + 1 %}
{%- endif %}
{%- if add_vision_id %}
{{- 'Video ' ~ video_count.value ~ ': ' }}
{%- endif %}
{{- '<|vision_start|><|video_pad|><|vision_end|>' }}
{%- elif 'text' in item %}
{{- item.text }}
{%- else %}
{{- raise_exception('Unexpected item type in content.') }}
{%- endif %}
{%- endfor %}
{%- elif content is none or content is undefined %}
{{- '' }}
{%- else %}
{{- raise_exception('Unexpected content type.') }}
{%- endif %}
{%- endmacro %}
Всегда было интересно как проверить что с аукционом второй цены не кинули. Как оказалось — никак
Читать полностью…
#корпжиза
В «Охотниках за привидениями» Рэй (который в кадре держит ловушку с Лизуном) произносит замечательный монолог джуна:
Лично мне нравился университет — нам давали деньги и аппаратуру, а производить ничего не надо. Мы были под крылышком. А каково в другом мире? Я работал в частных компаниях — там нужен результат.
Иду по eval поупулярной (3.4k звезд) готовой библиотеки с агентами для анализа эффективности рекламы и не покидает ощущение что читаю книгу заклинаний:
{
"id": 3,
"prompt": "I have these keywords and want to optimize bids: <...>",
"expected_output": "Bid optimization recommendations grounded in heuristics: 'roof repair austin' is a star performer (CPA $35 vs $85 avg, QS 9) — increase bid by 15-25% to capture more impression share (currently 45%). 'roofing contractor' has CPA 65% above average — decrease bid or fix QS. 'metal roof installation' is healthy. 'roof inspection free' has $180 spend with 0 conversions and QS 4 — pause or significantly reduce bid.",
"files": [],
"expectations": [
"Recommends increasing bid for 'roof repair austin' — references its CPA being well below account average",
"Recommends decreasing bid or pausing 'roofing contractor' — references its CPA being above account average",
"Identifies 'roof inspection free' as waste — $180 spend, 0 conversions, QS 4",
"Bid change recommendations stay within the 25% maximum guardrail",
"References impression share data in the analysis"
]
},
📉МЛ, который тихо вредит бизнесу
Давно не было постов — надо исправляться. Начну с истории, которая повторилась у меня уже в 3 компаниях)
После одного из реоргов моей команде в наследство досталась куча ML-проектов — один из них price recommender (модель, рекомендующая среднюю «правильную» цену за ночь при регистрации апартаментов для их сдачи). Всё считалось рабочим, трогать не предполагалось.
Но оказалось — мл-модель должным образом не обновлялась больше года, и никто за это время не перемерял её эффект на ключевую метрику.
📐Что сделали - построили распределения цены, спроса, от времени, и заметили подозрительную корреляцию между тем, как применяется/меняется цена, и целевой метрикой. Чтобы проверить более чисто, собрали offline-симуляцию и после запустили пару blackout экспериментов — выключили фичу для контрольной группы и в другой группе построили простой бейзлайн.
Что вышло. МЛ-модель оказалась не нейтральной, а сильно негативной.📉 «Умная» мл-модель тихо делала хуже, чем её отсутствие. Мы её выключили — и, по словам комитета DS-ов, такого сильного движения в A/B давно не было ) Это и был импакт, без единой новой строчки кода.😀
Забавно, что в предыдущей и в следующей компании были очень похожие истории. Правда в последней —рекомендательная система прожила в проде всего 3–4 месяца с негативным эффектом. Но там дело было в другом: постоянно «менялись» инженеры-владельцы, и мониторинг постоянно перенастраивался.
🚀 Мораль: иногда самый большой импакт от унаследованного устоявшегося ML-решения в компании приносит кнопка «выключить это МЛ решение», построить честный baseline и уже от него отталкиваться к чему-то сложному, ну и настривать весь мл-опс пайплайн, устойчивым к изменениям)
утро началось с significant increase, а у вас? 😃
Читать полностью…
А вот и фоточки с конференции подъехали!
Спасибо оргам 😍 и фотографу Андрею за классные кадры и оперативность в их выкладке!
#оффтоп
РБК пишет что пару часов назад в воздух подняли истребители, а самолет пришлось сажать не в пункте назначения из-за того что на борту подрались два пилота, и один вырубил другого.
Я лично считаю что конфликты нужно решать не драками, а любители (и профи) помахать кулаками должны это делать на ринге.
В следующую субботу, 10 октября, мой 3 года как тренер, Давид Николаев, боксирует по профи на Ленинградке, собираюсь придти его поддержать.
Если хотите тоже придти — вот его личка, он поможет с билетами, а может и на тренировки с ним договоритесь )
Всем мира и способности решить все словами!
#ML #корпжиза
В комментах к посту про транзакции отметились ребята кто делал очень похожие задачи в той же организации.
Не секрет, что в большой корпорации часто копают параллельные тоннели и горе тому кому в KPI поставили что-то централизовать не дав абсолютного мандата.
Вместо перечисления очевидных причин расскажу историю, канал же про ML
Итак, в момент когда модель разметки транзакций была всячески провалидирована кучей подразделений, встала в прод, потом была улучшена и еще раз встала в прод — в недрах AI-комитета возникло поручение модель централизовать — то есть всех-всех на нее перевести.
Как водится в пластмассовых мирах, предполагалось что произойдет это силой убеждения и открытием невероятных возможностей перед бизнес-юнитами.
В этот момент очень вспоминается любимое с собеседований «HR сейчас софты проверит» — я бы дорого отдал посмотреть на такой мастер-класс по навыку убеждения, в лучшем случае эти сотрудники софты принимают дружелюбие, а обычно — свои симпатии к кандидату (так и пишут — «приятный», «лапуся нормис» и пр).
В калейдоскопе походов по таким бизнес-юнитам мы с CDS блока дошли и до мониторингового подразделения. Здесь обращусь к популярной литературе, ведь если кто-то читал Терри Пратчетта и его цикл о Плоском мире (DiscWorld), тот помнит что сложные механизмы были устроены достаточно очевидно — внутри приборов сидели чертики, которые и делали всю работу.
Нас представители подразделения впрямую спросили — у нас есть 300 (триста!) человек которые в специальном интерфейсе размечают транзакции и создают правила (как в решающем дереве), отдельные люди определяют их приоритетность и постоянно тестируют как они интерферерируют и что дают на выходе, для этого за много миллионов создана система с интерфейсом по созданию правил и разметке, сейчас в системе уже 10_000+ правил, еще десяток айтишников ее сопровождает и поддерживает. Такой вот бусины, обучаемый чертиками с больничными и выходными. Внимание, вопрос — куда пойдут все эти люди при внедрении модели? И самое главное — что делать с их высокогрейдовым руководителем ?? Да и внутри этих 300 + 10 уже какая-то иерархия есть, люди семьи кормят, в отпуск летают, карьерный рост, планы и пр.
Среди всех похожих разговоров этот выделялся своим сюрреализмом и в то же время здравостью — и правда, попробуйте убедить любого менеджера внедрить у себя ваше решение чтобы у него штата стала в 2-3 раза меньше и надежды на карьерный рост обнулились, ведь выше не к ночи упомянутые HRы на собесах первым делом спрашивают "какого размера у вас команда?" — они это называют "управленческой силой".
Прошло много лет и сейчас на волне ИИ-хайпа стали появляться хорошо оплачиваемые вакансии по лидированию оптимизации всего-вся — в некоторых прямо пишут что надо так внедрить ИИ чтобы сократить численность большой организации вдвое. Прежде чем идти на такое стоит задуматься — какие у вас будут полномочия внедрять что-то такое отчего все менеджеры по цепочке потеряют ФОТ — и как следствие, свои премии и карьерные перспективы.
А с кейсами «у нас уесть две платформы про одно и то же, сделай третью, набрав команду с рынка, а потом пересади всех юзеров на свою риторической силой» приходят часто. Но это для смелых.
И позор всем тем кто сомневался в том что бустинг можно обучить вручную — вопрос желания и наличия 300 человек, пары лет и специальной системы, но для канальи, хотящей в карьеру — нет ничего невозможного!
#ML #корпшиза
Про регэкспы
В комментах к посту про IFы в проде вспомнили про регэкспы.
Есть у меня история и про них
Итак, задача разметки транзакций бухгалтерских полупроводок (движений между балансами) почти десять лет назад.
Миллиард-два полупроводок в месяц, у каждой 100+ важных полей (не только же назначения платежа, десяток текстовых полей и еще больше категорийных и численных)
Опечатки, технические ошибки и 12 методистов рисков размечали 2 недели в эксельки на классы (которые потом несколько раз пришлось поменять).
Мне досталась уже готовая модель (с очень негативным фидбеком от заказчиков) + разметка в файлах s3.xls и s4.xls (искренне благодарен людям что они хотя бы .csv не использовали — таким посылаю лучи поноса, ибо встретить перенос строки или спецсимвол в назначении платежа — проще простого).
Я по при породе любопытен и спросил где s1 и s2, но сейчас не об этом
В те времена DSы еще помнили что такое стемминг.
И модель радостно использовала pymystem3. Который при попытке запустить его в закрытом контуре (где собственно модели и нужно было разрабатывать) радостно лез в интернет (cdn.yandex.net) и умирал, получая отказ. SnowballStemmer этих недостатков был лишен и тут же мною использован — и тогда я впервые понял что корпоративный арбитраж может быть не только злом (модель попала ко мне потому как шеф в результате агрессивных поступательных действий добился роспуска целого центра в соседнем блоке за профнепригодность).
Но, к сожалению, стеммер не лечит опечатки.
И вот автор той модели лечил их регулярками.
Тысячи строк вида:
r'\b\w\b' : 'xyz'
for через re.sub()
Когда думаешь, что в продакте всё закатали в идеальные пайплайны и автоматизировали, жизнь (она же жиза) приносит утренний алерт: «А почему у нас вчерашний A/B-тест упал, потому что прод не выдержал нагрузки от двух дополнительных пользователей?» Или классика: «Заказчик утверждает, что хотел кнопку, но на ревью говорит, что всегда имел в виду слайдер».
Короче, Т-Банк собрал эту самую жизу на карточках. Всё то, о чём молчат в резюме, но ржут в курилках (или в созвонах с выключенной камерой).
А если хотите обсудить эти истории уже не в ленте, а вживую (и заодно понять, как не попадать в такие ситуации), добро пожаловать на конференцию «Продукты 24×ffdd2d». Будет больно, весело и полезно — обещают кучу пользователей, которые знают, чего хотят.
Регистрация тут (не потеряйте ссылку): https://producty24-ffdd2d.ru
И да, будет круто, если в комментах накидаете любимые мемы, которые идеально ложатся на надписи на карточках, — устроим баттл гифок и пикчей.
An Alien Mind
Это бьет тревогу Jakub Pachocki, Chief Scientist at OpenAI
Верим 🤔
или маркетинг 😄 ?
Вспомнил тут сколько эмоций вызвала у поступающих в ШАД МТС отсылка к кодированию цвета. Хотя ту задачу и решали более успешно чем другие три.
Мы кстати потихоньку начинаем готовить новые вступительные — если у кого есть крутые идеи — велком в комменты
Вообще, знание популярных IT-пасхалок может принести дополнительные $300k
UPD
Перепроверил публикации из каналов, нашел оригинальный ответ кофаундера и CEO Hugging Face
#корпжиза
Про вред грейдов — подтверждение с другого конца света
На днях известный в узких кругах частный инвестор рассказал мне байку про Новую Зеландию: якобы там 9 грейдов на всю страну (в тч коммерческие компании), привязанных к образованию. Бакалавр — один грейд, магистр — другой, и работодатель пляшет внутри государственной рамки.
Помню что вопрос грейдов волновал подписчиков (один из последних постов на тему)
Фактчекинг:
Единой сетки нет даже у государства — ведомства, университеты, больницы живут на своих salary bands. Но совсем из воздуха история не взялась: у школьных учителей реально есть общая шкала (правда, 10 ступеней, а не 9), и образование влияет на старт и потолок.
Но public sector Новой Зеландии — 477 тысяч человек, почти 20% рабочей силы: школы, больницы, crown entities. Если каждый пятый работает в формализованной системе, это должно аффектить остальной рынок.
Получилось немного наоборот. Motu в 2026 сравнили public и частный сектор. Средняя зарплата в public выше на 25%, но там другая структура — больше квалифицированных специалистов. После поправок разница скукожилась до 5-8%. А при сравнении похожих позиций public платит даже на 4% меньше.
Зато в итоге нашли инерцию.
Частник быстро понимает, что за 100 не нанять, и поднимает до 120. В public sector — salary bands / steps, согласования, коллективные договоры, повышения на годы вперед. Рынок уже уехал, табличка догоняет. А когда догнала — рынок поехал обратно.
То есть система грейдов просто вставляет между рынком и зарплатой комитеты, HR разных видов и повадок, бюджетные циклы и эксель.
Отсюда корпоративный парадокс: вчера HR говорит, что мидла выше 110 нанимать нельзя — выйдет за грейд. Сегодня он увольняется. Завтра нового мидла дешевле 140 рынок не дает. Послезавтра на 140 нанимают синьора, потому что иначе система не позволяет.
Про лаг вот еще исследование 2025 года
Итого: единой сетки грейдов по стране нет, есть публичные коллективные договора внутри отраслей в госсекторе.
И выше исследования, доказывающее, что грейды очень быстро начинают вредить если не уметь быстро пересматривать зп на них (как и любая ригидная по построению система в условиях рынка).
☁️☁️☁️☁️☁️☁️☁️
24 сентября Yandex Cloud проведёт ежегодную флагманскую технологическую конференцию Yandex Scale 2026.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
В программе четыре продуктовых трека — AI, Data, Security и Hybrid Infrastructure & DevOps, — и отдельный углублённый технологический трек DeepTech, который пройдёт только онлайн.
В треке Data расскажем, как Yandex Cloud развивает аналитику от отдельных сервисов к единой бесшовной среде: от загрузки данных до готовых бизнес-инсайтов, где ИИ помогает на каждом этапе. Разберём, как YDB помогает строить рекомендательные и поисковые системы и ИИ‑ассистентов. «Додо Пицца» представит честную историю миграции десятков терабайт данных в Yandex Cloud, а также расскажет о сравнении с западным облаком и совместном преодолении ограничений. Расскажем, как Yandex Cloud движется к самоуправляемым базам данных на основе опыта эксплуатации тысяч баз в Яндексе. «Азбука вкуса» разберёт миграцию Oracle Exadata на Lakehouse в Yandex Cloud без единого аврала. И покажем, как Yandex Managed Service for Valkey научили растягиваться под нагрузку — и вширь, и вглубь.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
Отдельно пройдут воркшопы по Data: разберём ключевые сценарии использования ИИ‑агента Нейроаналитика в Yandex DataLens. На практике посмотрим, как PGHouse позволяет OLTP‑базе PostgreSQL прозрачно выполнять OLAP‑запросы в ClickHouse без переписывания SQL. И соберём поисковую систему на Serverless YDB с настройкой полнотекстовых и векторных индексов.
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
И это ещё не всё: демозоны, питчинг решений, IT-квест и мерч — офлайн, а розыгрыши призов и секретный гость — в онлайн-студии.
#оффтоп
Как-то ко мне пришел свежеповышенный лид и спросил советов "как управялть проектами".
Удивительный вопрос — о чем я незамедлительно ему и сказал — ведь он же как-то летает в отпуск, где-то ночует и кушает, денег и эмоций хватает, потом успешно возвращается (однажды правда вернулся женатым чем всех и удивил) — чем не проект с бюджетом, сроками и зависимостями.
Только сказал — и вспомнил про другого, который остался в разгар своего отпуска где-то на краю света (намеренно не рскрываю страны, у парня масса других замечательных качеств, не будем расстраивать) без денег и его кто-то из общих знакомых с соседнего города ездил выручать. Вот и в проектах у него все печально.
Продолжаю наблюдения, мб нелишним окажется спрашивать на собеседованиях как вы запланировали сложный отпуск?
PS А на картинке цель моего отпуска — это я готовлю вас к тому что пару недель постов будет поменьше 😃
Всегда гадал как люди так смело выходят на менеджеров в бигтехи — реально страшно же комититься на рост выручки / прибыли там где до тебя годами куча умных людей уже пробовали все что только можно — самые сложные модели, самые хитрые фичи, все уже засунули в пайплайны и автоматизировали — модели постоянно переобучаются и деплоятся, сильнейшие инженеры за ними следят — ведь успехи там хорошо монетизируются.
Гадал ровно до тех пор пока друг не поделился своей каналья-историей — правда он в своем канале больше фокусируется на позитиве и полезном, вот и история вышла позитивная и полезная
Lakehouse для аналитиков и инженеров данных
Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino.
В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino.
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой.
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем.
• Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия.
Кто мы: R&D-центр Devhands, наш канал.
Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B),
ex: VK Tech, М.Видео, Эльдорадо
🗓 Старт курса: 27 августа
datarascals">Изучить программу и записаться можно здесь.
Ждём вас!
Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
Вот и закончился наш ежегодный митап 🥹
Искренне благодарю 547 гостей которые не поленились в воскресенье приехать к нам и максимально вовлечься в программу — никогда раньше не видел на конференциях столько вопросов после каждого (!) доклада.
На мастер-классах по рекомендашккам и кейсам яблоку негде было упасть, исписали буквально все поверхности в зале 😅 — подготовим больше бумаги в сл году
Огромное спасибо нашим спикерам за их доклады и умение вовлечь аудиторию — уточняем у них можно ли публиковать материалы — а там точно есть на что посмотреть: делились своими наработками ребята из Звука, WB, MWS, Google, ВТБ, Сбера, ВШЭ, Яндекс.
И отдельное спасибо организаторам — в тч за смелость в придумывании новых форматов! Потому что никто из спикеров не верил что формат ЧБД (что было дальше) понравится гостям, мы очень стеснялись — а получилось очень душевно, мы делились корпжизой (чего только стоит история Ивана как они собирали разметку для распознавания Ъ в речи) — и это нашло отклик — даже когда мы сообщили залу что ужин уже их ждет — никто, решительно никто не ушел до конца баек.
До баек я жадный — половина канала об этом (если кто недавно подключился, то вот подборка с байками, и вот с более ML байками, вот уже серьезный ML — а рыбов и так видно)
PS Модератором все же немного обидно быть — не успел ни в настолки ни в пинг-понг ни в баскетбол (а был целиковый тренер) да и шахматному роботу на 1700 продул дважды — ну ничего, будем тренироваться (на lichess).