not_boring_ds | Unsorted

Telegram-канал not_boring_ds - Нескучный Data Science

12047

Рассказываю как применять AI на практике ex. Managing AI Director at Sber, 👨‍💻ex. Head of ML LAB at Alfa https://www.linkedin.com/in/smirnov-evgeny/ По вопросам сотрудничества @datascience_assist Регистрации в Роскомнадзор № 5278866657

Subscribe to a channel

Нескучный Data Science

🔥 Как прошёл офлайн-бранч ODS Moscow × Нескучный Data Science

🧠 Начали с доклада Альберта про то, как в Avito обучают собственную LLM.

Это не история про «взяли открытую модель и немного дообучили», а полноценный процесс: выбор базовой модели, собственный токенизатор, адаптация на данных Avito, SFT и дальнейшее обучение с помощью RL.

Для SFT собрали больше 800 тысяч примеров: открытые датасеты, синтетические данные, олимпиадные задачи, внутренние бизнес-кейсы и диалоги пользователей с большими моделями.

На этапе RL отдельно развивают несколько навыков модели: решение математических задач, следование сложным инструкциям и корректный вызов инструментов. Причём для каждого навыка нужен свой автоматически проверяемый reward.

В математике система извлекает финальный ответ и проверяет его эквивалентность правильному. В instruction following — смотрит, выполнила ли модель все заданные ограничения. В function calling — проверяет название инструмента, аргументы и их значения.

Отдельно поговорили про инфраструктуру. Для моделей на 8B параметров можно относительно быстро запускать эксперименты и проверять гипотезы. Но при переходе к большим MoE-моделям главным вызовом становятся масштабирование, распределение модели по GPU, батчинг, инференс и offloading.

👨‍🔬 После продуктовых LLM резко переключились на химию.

Константин начал с важной мысли: химическая информация — это не один универсальный тип данных. Одну и ту же молекулу можно представить текстом, строкой SMILES, двумерным графом, трёхмерной структурой или структурой, которая изменяется во времени. И под каждое представление нужны свои методы и модели.

Поговорили о том, почему даже на фоне сложных нейросетевых архитектур связка Morgan fingerprints + XGBoost всё ещё остаётся очень сильным базовым решением для многих задач с химическими данными.

Затем перешли к геометрическим графовым нейронным сетям. Они учитывают расположение атомов и позволяют предсказывать свойства молекул в десятки раз быстрее традиционных DFT-расчётов.

Отдельно разобрали нейронные потенциалы и delta-ML. Идея в том, чтобы не выполнять каждый раз дорогой квантово-химический расчёт полностью: часть свойства можно посчитать более дешёвым методом, а нейросети поручить предсказать необходимую поправку.

Дошли и до LLM с агентами. Здесь пока всё не так магически, как иногда выглядит в заголовках: модели могут по-разному отвечать на один и тот же вопрос в зависимости от того, передали им обычное название соединения, IUPAC или SMILES. А некоторые агенты, которые должны самостоятельно запускать вычислительные эксперименты, пока скорее напоминают roadmap, чем полностью автономного исследователя.

Зато роботизация лабораторий уже вполне реальна: специализированные платформы, роборуки, автоматическое проведение серий экспериментов и превращение обычного оборудования в high-throughput-системы.

🎬 После двух технических докладов разговор с Денисом про ИИ в кино оказался очень кстати 😅

Обсудили, где новые инструменты уже помогают при работе с контентом, какие процессы способны ускорить, где вызывают сопротивление и в каких задачах пока остаются скорее экспериментом.

Но, как обычно, самое ценное происходило не только во время выступлений. После докладов продолжили обсуждать услышанное за завтраком, задавать вопросы, спорить, знакомиться и делиться своими кейсами.

Спасибо Альберту, Константину и Денису за содержательные выступления, ODS Moscow — за очередную совместную встречу, МИРА бистро — за пространство, а всем, кто пришёл, — за вопросы и атмосферу.

Формат «бранч + несколько докладов» точно будем повторять.

Поэтому уже начинаем собирать темы для следующего бранч-митапа. Если вам есть о чём рассказать — про рабочий кейс, исследование, неожиданный эксперимент, применение ИИ в своей индустрии или даже неудачу, из которой можно сделать полезные выводы, — присылайте тему доклада и пару предложений о себе в комментарии или личные сообщения.

P.S. Будем учиться фотографироваться до того, как все разошлись 😅

Читать полностью…

Нескучный Data Science

Оффер на Senior Data Science роль за 1 неделю — реально? 🚀

Да. Авито запускает Fast Track — ускоренный отбор для Senior и Senior+ Data Science специалистов. Одна неделя на все технические этапы и финал → оффер в классифайд №1 в мире по количеству пользователей.

📅 Основные этапы — 20–26 июля. Регистрация по ссылке открыта до 15 июля, 23:59 МСК.

Как проходит:
🟣 До 15 июля — заявка + HR-скрининг
🟣 До 24 июля — техническая секция (ML-теория + Python)
🟣 25 июля — ML System Design
🟣 26 июля — финал
🟣 До 28 июля — оффер

Преимущества фаст-трека:
🟣 Быстрый отбор и совмещённые этапы
🟣 Все даты известны заранее
🟣 Возможность оценить свои скилы — результат закрепляется на год

Кого ждут:
🟣 От 4 лет опыта в крупных российских и международных IT, BigTech и FinTech компаниях
🟣 Полный цикл разработки моделей — от ресёрча до выкатки в прод
🟣 От 1 года самостоятельного лидирования проекта, автономность и инициативность

Команды на выбор: антифрод и модерация, монетизация и реклама, поиск и рекомендации, вертикальные DS-команды.

⏳ Регистрация — до 15 июля. Успей оставить заявку. Рекрутеры проведут тебя через все этапы за рекордно быстрые сроки!

Читать полностью…

Нескучный Data Science

Всем привет!

🌇 В эту субботу дата бранч!

📆 Когда: Суббота (27 июня)
🕖 Время: 12:00
📍Место: Mira Bistro (Тверская ул., 16, стр. 1) Вход со стороны м. Тверская/Пушкинская

Бронь на имя Александр ODS

Ставь 👍 если придешь

ODS Moscow

Читать полностью…

Нескучный Data Science

Как таксист пытался присвоить часы жены — и спалился на собственных данных ⌚️📊

Эта история произошла больше года назад. Дату я восстановил, найдя в канале пост о награждении Alfa Awards — после него всё и случилось.

🚕 Мы с женой возвращались домой на «Бизнесе» от Яндекса. Водитель встретил нас у машины и закрыл дверь — всё соответствовало тарифу.

Во время поездки жена сняла Garmin. Вспомнили об этом только дома, когда перед сном понадобилось поставить будильник.

🔍 После двадцати минут поисков я проверил квартиру, подъезд, дорогу от машины до дома и даже заглянул под скамейку.

Часов нигде не было. Оставался один вариант — такси.

📞 Я нашёл номер водителя, позвонил и включил режим сбора данных.

Сначала он сказал, что часов не находил. Затем сообщил, что после нас у него было два заказа: в одном ехали двое пассажиров, в другом — девушка.

Круг подозреваемых получался небольшим: водитель и трое пассажиров.

🧩 Я перезвонил и поделился этой мыслью: все поездки зафиксированы, поэтому полиции будет несложно восстановить события и понять, кто присвоил часы.

И тут версии начали расходиться.

Во втором разговоре изменилось количество пассажиров, а последовательность заказов стала другой. Либо человек плохо помнил события последних часов, либо сознательно менял показания.

Мы ещё несколько раз связались с водителем, дособрали факты и повысили вероятность гипотезы о том, что он нас обманывает.

В какой-то момент модель, видимо, стала очевидной не только для нас.

Водитель сказал, что ещё раз поищет, а затем перезвонил:

— Нашёл! Часы лежали в кармане сиденья. Видимо, вы сами их туда положили.

🚘 Через полчаса он приехал и вернул Garmin.

Часы почему-то были выключены.

Я включил их и увидел другой циферблат и новые настройки. В профиле были указаны дата рождения, пол, рост и вес нового владельца.

То есть часы успели сбросить, настроить под другого человека и надеть на руку.

И здесь история стала особенно интересной для человека, который занимается данными.

❤️‍🔥 Garmin записывал пульс, вариабельность сердечного ритма и уровень стресса.

По данным можно было увидеть не только примерное время сброса настроек, но и всплески стресса во время наших звонков.

Корреляция получилась выразительной.

Без пароля от нового аккаунта выгрузить данные не удалось. Поэтому график на карточке — реконструкция событий, а не сохранённый экспорт из Garmin.

Но главным разочарованием оказался даже не водитель.

💬 После первого обращения поддержка Яндекса фактически ответила:

— Водитель сказал, что ничего не находил. Мы ничем не можем помочь.

Когда часы вернулись и я рассказал, что их сбросили, настроили под другого человека и носили на руке, позиция почти не изменилась:

— Хотите — обращайтесь в полицию.

То есть сервис получил историю о попытке присвоить имущество стоимостью около тысячи долларов и не увидел повода разобраться.

Никакой проверки водителя.
Никакого внутреннего расследования.

Отдельный апсет: всё это произошло в «Бизнесе». Выбирая этот тариф, рассчитываешь не только на дорогую машину и открытые двери, но и на другой уровень сервиса и ответственности.

При этом я понимаю, насколько сложна работа таксиста: длинные смены, пробки, высокая нагрузка и постоянный стресс. Но это не оправдывает попытку присвоить чужую вещь.

В полицию я не обратился.

Надеюсь, для водителя эта история стала шансом остановиться и исправиться. Судя по уровню стресса во время наших разговоров, вечер и без полиции оказался для него поучительным.

Хочется верить, что он воспринял произошедшее как урок, а не как сигнал о том, что подобное можно повторять без последствий.

💡 Практический вывод

Используйте методы анализа данных не только в работе, но и в повседневной жизни.

Когда мы строим модели, то собираем факты, сравниваем версии, проверяем гипотезы и восстанавливаем причинно-следственные связи.

Практически как детективы 🕵️‍♂️📊

Иногда эти навыки помогают не только продавать кредиты, повышать конверсию и оптимизировать бизнес-процессы, но и проводить вполне реальные расслед

Читать полностью…

Нескучный Data Science

Открыта регистрация на главную конференцию этой весны по технологиям ИИ и анализу данных — Data Fusion* 2026! 💙

Шестая ежегодная конференция Data Fusion пройдет 8–9 апреля в Москве в инновационном кластере «Ломоносов».

60+ актуальных сессий, докладов, примеров, дискуссий по теме анализа данных/ науки о данных/ машинного обучения. Среди тем – ИИ-агенты, «обучение с подкреплением», компьютерное зрение, обработка естественного языка, открытый исходный код, воплощенный ИИ и робототехника, рекомендательные системы, применение ИИ в кибербезопасности, ИИ+ естественные науки, AgentOps и многое другое! Всю программу ищите на сайте.

Конференция объединит лидеров команд по машинному обучению, специалистов по обработке данных, молодых ученых, инженеров, аналитиков и руководителей, принимающих решения о внедрении технологий в бизнес и государственные сервисы.

Среди спикеров конференции: Суржко Денис (ВТБ), Оселедец Иван (AIRI), Райгородский Андрей (МФТИ), Бурнаев Евгений (Сколтех,AIRI), Саркисов Тигран (Х5), Крайнов Александр (Яндекс), Зима Андрей (Ростелеком) и другие эксперты из науки и индустрии.

Все мы любим конференции не только ради знаний, но и, конечно, ради живого общения и новых знакомств, а это важная часть Data Fusion!

➡ Не пропустите, регистрируйтесь.

*Интеграция данных
Информация о рекламодателе

Читать полностью…

Нескучный Data Science

Как перестать залипать в социальных сетях?

Многие знают, что фастфуд вреден, но не могут от него отказаться — дофаминовая зависимость сильнее, и вес продолжает расти.

С социальными сетями всё то же самое.
Только вместо лишних килограммов вы набираете потерянные часы.

Полностью отказаться не получается — там друзья, общение, иногда действительно полезный контент. Да и мы живём в эпоху рекомендательных систем, а не бумажных газет.

Но как настроить баланс?

Можно прокачивать осознанность и включать «вторую систему» мышления по Даниэлю Канеману — более медленную и рациональную.

Проблема в том, что соцсети чаще всего захватывают нас в момент усталости. Когда мы уже выгорели, не хотим думать и подменяем ими сон. Жертвуем долгосрочными целями ради короткого дофаминового укола. Тем самым временем, которое потом «не хватило» на спорт, книгу, проект или запуск собственной идеи.

Что с этим делать?

Нужно дать рекомендательной системе достаточное количество явного негативного фидбэка, который только возможен. Недостаточно нажать «не интересно». Нужно заблокировать аккаунт, который поставляет бесполезный, но залипательный контент.

Из моего опыта — несколько десятков жёстких блокировок и жалоб существенно меняют ленту.

Осталось собраться и применить два навыка:
1️⃣ Распознавать залипательный контент.
2️⃣ Найти силы его заблокировать.

Лучше всего делать это утром, когда у вас есть ресурс и работает рациональная часть мозга.

Поэтому рекомендация простая:
👉сделайте это прямо сейчас, пока вы проснулись и полны сил.

Надеюсь, никто не залипает в «Нескучном Data Science».

Читать полностью…

Нескучный Data Science

30 ноября участвую как эксперт на карьерном митапе от self, сообщества для поддержки айтишников.

Будет доклад от CEO self о том, как выжить на рынке труда в нынешних условиях.

А я, вместе с остальными экспертами, буду в качестве ментора отвечать на вопросы участников о том, как строить карьеру.

Можно спрашивать и про харды, про софты. И в целом задавать вопросы на любую карьерную тему.

Помимо
доклада и общения с менторами вас ждет организованный нетворкинг, где вы сможете познакомиться с интересными людьми.

Время и место
🔴30 ноября, с 15:00 до 21:00
🔴Poklonka Place, корпус Е1 Поклонная ул. 3

Подробности и билеты на лендинге!

Читать полностью…

Нескучный Data Science

Про корпоративные конфликты

Жили-были два соседних и близких по функционалу департамента. Назовем их А и Б.
Был у департаментов курирующий топ, назовем его «ПетрПетрович».
В департаменте Б есть управления Ба и Бб
И тут начальника департамента Б увольняют.

Кем заменить? Три кандидата:
◦ Зам начальника департамента А
◦ Начальник управления Ба
◦ Начальник управления Бб

Вы в камень-ножницы-бумага играли? 🙌
Вот также и эта троица — каждый против двух других и никто не может одержать верх. 🦢🦞🦈 (кэп: акула изображает щуку)

В такой ситуации «ПетрПетрович» принимает решение нанять кого-то, кто вроде бы немного со всеми тремя по чуть-чуть работал и ни с кем не поругался 😅. Назовем нового руководителя Новорук.

В итоге департамент Б «пропал с радаров» — амбициозных инициатив, которые бы дисраптили бизнес-модель или хотя бы были достойны обсуждения на борде — нет, зато со всеми смежниками мир 🕊

С этими словами Новорука и уволили спустя пару лет.

Итого, случилась корпоративная классика: наняли за бесконфликтность — уволили за бесхребетность🤷‍♂️

PS: В личку пришло несколько знакомых из разных организаций с вопросом "не их ли конторы я описал?" -- значит, ситуация не такая уж и редкая

Читать полностью…

Нескучный Data Science

Как связаны продуктовая, HR и PR стратегии?

Стратегия отвечает на вопросы — что мы делаем и что не делаем. Если её элементы противоречат друг другу, стратегия, скорее всего, не работает: становится непонятно, как двигаться и к чему стремиться.
В Лаборатории стратегия строилась на культурном базисе, поэтому все её элементы были взаимосвязаны. Посмотрим на это на примерах.

Продукт ↔ HR
1. Когда вы нанимаете сильную команду, ориентированную на исследования и научный интерес, — фокус только на бизнес-вэлью приводит к внутреннему конфликту.
2. Если в команде не развиты софт-скиллы и навык презентации, то продвигать бизнес-задачи и «продавать» правильные решения становится затруднительно.
3. Когда вы нанимаете людей с сильными софтами, но без хардов, — использовать продвинутые методы моделирования не получится.
4. Если команда не видит личной выгоды и карьерного роста, бизнес-ориентация воспринимается формально и не закрепляется в поведении.
5. Быстрый карьерный рост в коммерческой компании возможен только тогда, когда продвинутые решения из теоретических рассуждений доезжают в прод.

HR ↔ PR
1. Слабый HR-бренд ведёт к трудностям с наймом топ-команды, особенно если вы не можете конкурировать зарплатами.
2. Если профессиональное сообщество не уважает хард-скиллы вашей команды, то и сильный HR-бренд построить не выйдет.

PR ↔ Продукт
1. Внутренние выступления теряют смысл, если команда не участвует в развитии продукта.
2. Курсы, конференции и другие активности вызывают интерес у аудитории лишь тогда, когда за ними стоят реальные выдающиеся достижения — научные или бизнесовые.

Продукт ↔ HR ↔ PR
С возрастом у специалистов становится меньше времени и энергии для прорывных проектов и публичных выступлений, тогда как у студентов и стажёров, стремящихся к карьере, эти ресурсы есть. Поэтому именно они становятся естественным драйвером развития продукта, бренда и культуры компании.

🔜 В следующем посте поговорим про личные стратегии

Читать полностью…

Нескучный Data Science

HR-стратегия Лаборатории

Ключевая проблема найма опытного топ-специалиста заключается в том, что он уже нашёл себе отличное место работы, и вы вряд ли сможете его перекупить. В таком случае отличная стратегия — растить мат. ожидание за счёт числа попыток, надеясь на то, что вы сможете заинтересовать его задачей или его ровно сейчас отпугнули на текущем месте работы.

1️⃣ Нанимаем по хардам — софты растим внутри. Применение софтов на линейных позициях необходимо на порядок в меньший промежуток времени, и поэтому их недостаток проще закрыть руководителю, чем отсутствие хардов. Как показала практика моей команды, софты можно успешно развивать у любого технаря. Именно по этой причине я всегда отдам предпочтение джуну с прокаченным хардам, а не «синьору» с умением складно оправдываться за отсутствие результата.

2️⃣ Найм — задача руководителя, а не HR. Ответственность за качество и укомплектованность команды нужно брать на себя. Любая ошибка найма перекроет время, потраченное на проактивный поиск с необходимым CIR.

3️⃣Нанимаем только тех, кто хочет приносить пользу компании, а не удовлетворять свой научный интерес. Наша профессия содержит много пространства для исследований, но большая часть из них не приносит практического результата и оптимизирует сотые доли процента на синтетических датасетах. Многие эксперименты не нужно проводить, если у вас есть теоретическая база, которая может оценить масштаб ожидаемого эффекта. Нередко желание проводить такие эскперименты, говорит о недостаточном количестве практики на этапе обучения и для этого являения у меня даже есть целый термин.
Нейросетевой недотрах — огромное желание обучить нейроночку, которая не нужна или избыточна для решения бизнес-задачи.

4️⃣ Не ограничиваем скорость роста формальными временными рамками. Если вы вкладываетесь в рост софт-навыков, то ваша команда становится очень конкурентной на открытом рынке, и джун сможет продать себя за синьора и даже CDSа (знаю такой случай). В таком случае важно вовремя проводить апгрейд грейда согласно скорости достижения определённого уровня, а не за выслугу лет. В противном случае вы повысите мат. ожидание поиска топ-специалиста у конкурентов.

5️⃣Привлекаем таланты за счет HR-бренда и сарафанного радио. Время потраченное на выступления на конференциях, запущенные курсы, ведение личного блога и другие публичные активности существенно окупается скоростью найма за счет улучшения релевантности входного потока. Повышенная удовлетворенность команды включает сарафанное радио и приводит к аналогичному результату.

6️⃣ Работаем со студентами и стажерами. Большинство топ-специалистов, которых вы хотите сейчас нанять были когда-то студентами технических вузов. Сейчас вы смотрите на них и мечтаете чтобы они стали членами вашей команды, но вы упускаете большой поток студентов, которые еще не стали звездами и вам не поздно вырастить их внутри, если вы сами когда-то были настоящими синьорами.

📸 Глава Лаборатории машинного обучения в окружении джунов и миддлов, май 2022.

Читать полностью…

Нескучный Data Science

Когда я приходил в Альфу шесть лет назад, у меня была простая цель — делать крутые вещи с топ-технологиями в реальной, прагматичной среде. В итоге, мы внедрили кучу фундаментальных изменений, их признали не только внутри компании, но и за её пределами (часть из них вы уже видели в этом канале). Однако, этот пост не про самолюбование.

Подобные истории без описания трудностей не только скучные, но и неправдоподобные, поэтому расскажу с чего мы начинали и какие трудности встречали на пути:
– слабый HR-бренд;
– нет бюджета на перекупку «звёздной» команды;
– политика «берём только синьоров по стажу»;
– купленные у вендоров решения мешают растить компетенции;
– инфраструктура для внедрения нейронок отсутствует;
– формальные процессы, которые замедляют работу;
- саботаж на протяжении нескольких лет к внедрению эффективных решений;
- карьерный рост за лакейство, вместо результатов.

К сожалению, не все удалось решить, но разруливание и существование в режиме ограничений стало значимым фактором роста всех членов команды.
С козырями все могут играть, а вы попробуйте играть теми картами, что на руках.
Выплыть помогли правильный майндсет и культура, впитанная на заре становления Тинькофф. С их помощью родилась и была реализована стратегия из трёх частей: продукт, HR и PR — все они связаны.

В следующих постах я расскажу, как это работало и что из этого может пригодиться вам.

Читать полностью…

Нескучный Data Science

🇰🇿 Сделано в Казахстане — для всего мира

BigData Team — это международная команда экспертов, работавших в Amazon AWS, Samsung, Yandex, Ebay.

Мы создаём IT-образование мирового уровня здесь, в Казахстане, с грантовой поддержкой Tech Orda и Astana Hub. История началась шесть лет назад, когда мы начали обучать в Казахстане ведущих специалистов в сфере Big Data и Machine Learning.

🔥А сегодня открываем набор на 36 международных грантов с поддержкой наших партнеров, чтобы к нашим слушателям из Казахстана присоединились коллеги со всего мира.

🇰🇿 Если вы из Казахстана
— гранты Tech Orda покрывают более 50% обучения
— подробности и инструкции, успейте до конца августа!

🌍 Если вы из другой страны
— 32 международных гранта с покрытием 50% (950 $)
— 4 гранта с покрытием 100% (1 900 $)

📚 8 месяцев обучения:
— общая база по Python, промышленной разработке, Big Data и ML
— в конце — твой выбор трека: Big Data Engineer или Machine Learning Engineer
— 10–20 часов в неделю, онлайн, с менторами и проектами

📅 Дедлайны международных грантов:
— I волна — до 24 августа, 23:59
— II волна — до 31 августа, 23:59
— III волна — до 7 сентября, 23:59

🤝 И да, мы ждём участников минимум из 5 стран — так что зовите друзей, коллег и бывших однокурсников.

📌 Как подать заявку на международный грант
1️⃣ Зарегистрируйтесь и пройдите тестирование на платформе Learn BDT💻:
— откройте разделы grant, grant extended, grant profile и CV
 — выполните все тесты и загрузите резюме
2️⃣ Ждите результаты на почту — и подпишитесь на наш Telegram, чтобы не пропустить новости

Заполняйте заявку на грант и подавайтесь до ближайшего дедлайна (вот тут объяснили почему раньше — лучше).
Удачи! 🍀

BigData Team: the way you learn best
Py4BDA | Python | Machine Learning | Big Data | BD/ML Engineer

#study #BDMLE #BigDataTeam

Читать полностью…

Нескучный Data Science

D >< Vision — митап по Computer Vision

🤔 Чувствуете, что крутые разработки в Computer Vision остаются в тени других популярных тем в ИИ? Что на многих конференциях CV-секции зачастую не соответствуют вашим интересам и возникающим на работе задачам? Мы — тоже.

💪 MWS AI (МТС) и VisionLabs проведут митап, цель которого – объединить и поддержать сообщество, глубоко увлечённое Computer Vision. Мы сознательно делаем фокус на CV, чтобы подчеркнуть его непреходящую важность и уникальные исследовательские задачи. И рассматриваем Computer Vision во всей его широте — и discriminative, и generative, и multimodal подходы.

👉 Регистрируйтесь на митап и участвуйте очно или подключайтесь в формате онлайн.

Читать полностью…

Нескучный Data Science

Senior DL Engineer в 🏦, Лаборатория Машинного обучения, Москва

Отзывов из интересных мест в отечественных компаниях на канале пока мало. Пополняем копилку рассказом про Лабораторию Машинного обучения. В 2020 году я сам приходил сюда работать, в тот момент нас всего было 5 человек. Но мы успели сделать очень-очень много, поэтому воспоминания самые теплые. Свои впечатления расскажу в отдельном посте.

Авторская орфография сохранена

➡Ник автора в тг - @maksimallist
➡ Название компании - Alfabank

➡Расскажите про свой бэкграунд - Senior DL researcher/engineer. Основная область экспертизы - NLP. Но есть опыт так же и в CV, в основном в области генерации изображений. Старт карьеры пришелся на научную сферу, работал в лаборатории глубокого обучения и нейронных сетей на физтехе. Есть статьи в рецензируемых научных журналах, и победы в соревнованиях. После чего ушел в бизнес, большую часть карьеры провел в Сбере и AIRI. Пытался замутить свой стартап, но безуспешно.
➡Как подались на вакансию - Нашел объявление в сингулярисе, отправил на почту свое резюме.

🔥 Субъективно Сложность процесса по 10 бальной шкале - 5

➡Когда начали процесс - январь 2025
➡Когда закончили процесс - Прошел весь процесс за неделю, может чуть больше

➡ Позиция, на которую собеседовались - Senior NLP engineer
➡Грейд на который собеседовались (если известно) - Старший разработчик нейронных сетей. Численного грейда нет.
➡Локация вакансии - Москва

🔥 Расскажите про этапы собеседований

- Техническое собеседование
1) Первое знакомство + техническое собеседование
2) При знакомстве спрашивали про образование и профессиональный опыт. Далее шло техническое собеседование где, для начала предложили в блонкноте написать по тз простенькую нейронную сеть (подразумевалось что можно использовать pytorch), а потом был ряд вопросов на понимание механизмов обработки текста, устройства больших языковых моделей (разумеется глубже чем устройство attention mechanism). После еще немного поговорили про историю развития NLP.
3) Интервью проводил непосредственно мой потенциальный начальник. Длилось оно полтора часа, может чуть больше.

- Собеседование с руководителем подразделения
1) Собеседование с руководителем.
2) Снова быстро прошлись по профессиональному опыту. После был ряд вопросов, касающихся в основном личных качеств. Например: "Что раздражает в работе?", "Что мотивирует.", "Как снимаешь стресс?", "Чем больше нравится заниматься: разработкой или руководством". Просили назвать минусы предыдущих мест работы, а потом плюсы. Озвучить амбиции, и описать как я вижу свою работу у них в команде. Ну и после я задал интересующие меня вопросы. Там же обсудили мои ожидания по зп и режиме работы.
3) Отдельных наблюдений я наверное не выделю.

⏺ Что понравилось:

Полный ответ автора слишком длинный, чтобы влезть в пост, поэтому в тексте отзыва используется саммари от o3, а оригинальный текст в комментариях 💬:

1. Нашёл вакансию сам, резюме кинул прямо будущему руководителю ― никаких HR, анкет и «этапов для галочки».

2. Техсобес проводил тот же руководитель: кто, если не он, знает, какие навыки нужны. Никаких посторонних интервьюеров и алгоритмических секций.

3. Вопросы ― в основном на способность рассуждать в NLP и чуть-чуть system design. Созвон затянулся, но мы оба чётко поняли: он — мой уровень, я — свои задачи.

4. Второй звонок с главой подразделения: логичные вопросы, сверка ожиданий и вайба, без корпоративной мишуры.

5. Вся история — два созвона за неделю, потом быстрая проверка СБ и сразу договор. Соискатель счастлив, начальник тоже: Win-Win.

6. Нет «пяти этапов на полтора месяца», нет бессмысленных звонков с людьми, которых больше не увижу. Такой процесс редок, но окупается для всех.

Итог простой: лучший найм, через который я проходил.

⏺Что не понравилось:
Все понравилось


➡Итоги собеседования: Принял оффер.

💸Информация про Total Compensation: Не обидели)
От автора канала: Вилки в команду хорошие, на сеньор грейд 400-570K + 15% ежеквартальная премия. Инфу взял из Нескучный Data Science Jobs, тут.

#интервью

@max_dot_sh

Читать полностью…

Нескучный Data Science

🔋 Бесплатный курс "Ресурс" для подписчиков "Нескучный Data Science"

Вам нужна энергия. Чтобы принимать повседневные качественные решения. Чтобы поддерживать себя в форме. Даже чтобы проявить эмпатию — да, да — вам всё равно нужна энергия. Токсичность? Часто это просто следствие перегруза.

🤔 А теперь внимание: чем выше ваш менеджерский грейд, тем больше энергии вам будет нужно. Потому что придётся чаще говорить «нет», быстрее приоритизировать, быть гибким, дипломатичным и при этом не выгорать.

Я уже писал, что текущий уровень энергии — это главная метрика, за которой стоит следить. Но задумывались ли вы, что у всех людей он разный?
Что делать, если у вас энергии — вагон, а вы попали в команду, где у большинства ее представителей низкий заряд батареи?

Сможете ли вы ужиться с начальником, которому ничего не надо, кроме пледа и сна? А наоборот — если вы на нуле, а вокруг вас команда из бодрых стартаперов?

Я бы с удовольствием продолжил писать посты на эту тему (и, наверное, еще буду), но всё-таки у нас канал про Data Science.

К счастью, нашёлся отдельный курс именно об этом — про энергию, ресурс и внутреннее топливо. И честно, вряд ли я смогу рассказать вам этот материал лучше. Я его посмотрел, словил катарсис и договорился с авторами: для подписчиков канала он стал бесплатным. Вот что внутри:
1️⃣ Что такое ресурс и как он влияет на вашу жизнь и окружение?
2️⃣ Что именно снижает уровень энергии и что с этим делать?
3️⃣ Как поднять свою энергию (и не только с помощью сна)?
4️⃣ Как подойти к управлению ресурсом системно?

🎁 Бонус: вы узнаете, как трекать уровень своей энергии, не покупая Garmin за $1000.

После курса я понял, почему в моей команде средний возраст — 24 года. Но об этом — в отдельной серии постов. Он будет про построение дизрапт-команды в консервативном банковском секторе.

Курс вам особенно подойдет если вы не знаете что делать с активными **********, которые мешают жить приличным людям.

P.S. если не открывается ссылка на курс, воспользуетесь VPN.

Читать полностью…

Нескучный Data Science

🔥 ODS Moscow × Нескучный Data Science: офлайн-бранч в эту субботу

В эту субботу снова собираемся на офлайн-бранч вместе с ODS Moscow.

Раньше наши бранчи проходили совсем без программы: просто встречались, ели и разговаривали про ИИ, data science и рабочие истории. В этот раз хотим сохранить этот живой формат, но добавить несколько докладов — чтобы было от чего оттолкнуться в обсуждении и куда глубже копнуть.

На позапрошлом бранче мы обсуждали, зачем Avito вообще обучать свою LLM. Тогда тема вызвала много вопросов, и я предложил Альберту рассказать об этом подробнее — уже не на уровне «а зачем», а на уровне технических деталей.

Альберт Акопян
LLM research engineer Avito | ex. Alfa Bank | MIPT & YSDA alumni

«Как мы в Avito делаем RL для нашей LLM»

Поговорим про то, как выглядит RL для LLM внутри большого продукта: какие задачи этим решают, как это связано с качеством модели и что вообще приходится учитывать, когда LLM живёт не в демке, а в реальном сервисе.

На прошлом бранче у нас была очень живая дискуссия про применение ИИ в медицине. В этот раз продолжим смотреть на ИИ в науке, но уже со стороны химии.

Ушенин Константин
ведущий научный сотрудник AIRI | кандидат физ-мат наук | препод в УрФУ и ТГУ | ex. Академия наук РФ | автор канала «эйай фор сайенс» — @not_only_llm

«Применение ИИ в химии»

Константин расскажет, как ИИ применяется в химии: где он действительно помогает исследователям, какие задачи уже можно решать с помощью моделей и как это выглядит не в хайповых заголовках, а ближе к реальной научной практике.

А ещё мне не хочется, чтобы наши бранчи превращались исключительно в разговоры про работу, метрики и продакшен. Это полезно, но иногда получается слишком душно 😅

Поэтому я позвал Дениса рассказать про ИИ в кино. Если вы давно читаете канал, возможно, помните, что он помогал вытаскивать книжный сериал «Дата Сапиенс», а сейчас сам активно начинает применять ИИ в жизни и творческих проектах.

Ну и, конечно, у нас будет шанс разведать, что произойдёт в следующем сезоне одного из сериалов с его участием. Скажу честно: у меня пока не получилось 😅

Денис Бузин
актёр театра и кино | выпускник ВГИК | основатель бренда одежды CNSTRCTR | снимался в «Универ. 15 лет спустя», «Кузя. Путь к успеху», «Полицейский с YouTube», «Солдаты», «Полярный»

«Как использует ИИ индустрия кино в РФ»

Обсудим, как ИИ уже используется в киноиндустрии: где он помогает, где вызывает сопротивление, какие задачи действительно закрывает, а где пока остаётся игрушкой.

📆 Когда: суббота, 11 июля
🕛 Время: 12:00
📍 Место: МИРА бистро, Тверская ул., 16, стр. 1
Вход со стороны метро «Тверская» / «Пушкинская»

Бронь на имя Александр ODS.

Ставьте 👍, если планируете прийти — будет полезно понимать примерное количество людей. Буду рад увидеться!

Читать полностью…

Нескучный Data Science

🧠 Что интересного было в AI/DS за неделю

Сделал обзор топ постов, которые сам прочитал за эту неделю. Буду выпускать такой обзор раз в неделю.

На этой неделе лучше всего зацепили темы про AI-инструменты для разработки, роль AI-инженера, ML в реальном бизнесе и выход IT-продуктов на внешние рынки.

🛠 AI coding tools: контекст важнее красивой демки [1], [2]

В обсуждении Cursor, Codex и Claude Code главная мысль такая: в длинных задачах решает не только модель, а то, как инструмент держит контекст, переживает сжатие истории и не теряет цель в автономной работе.

Это хороший сдвиг в разговоре про AI coding. Уже недостаточно спросить “какая модель умнее”. Нужно смотреть, какая среда лучше помогает довести задачу до конца.

🧑‍💻 Хороший AI-инженер: не тот, кто просто сделал модель [1]

Сильный тезис про роль AI-инженера: разработка моделей постепенно становится commodity. Готовых LLM, пайплайнов и туториалов уже много.

Настоящая ценность всё чаще в другом: сформулировать гипотезу, выбрать метрики, поставить эксперимент, довести до деплоя и потом следить за качеством.

Короче, хороший AI-инженер всё больше похож на владельца результата, а не на человека, который “прикрутил нейронку”.

🏢 ML в бизнесе ломается не только об accuracy [1]

Отличный кейс про recommendation/search bias из корпоративной жизни.

Самый интересный тип bias там не из учебника, а из реальности: “уважаемый человек попросил”. Даже хорошая модель может начать вредить продукту, если поверх неё начинают вручную проталкивать внутренние приоритеты.

Это напоминание, что ML-система в бизнесе живёт не в вакууме. Ей нужны продуктовые границы, доверие пользователей и защита от организационного шума.

🌍 Российские IT-продукты всё активнее смотрят наружу [1], [2], [3]

Заметная линия недели: как IT-проектам выходить за пределы локального рынка.

Темы очень практичные: платежи, язык, поддержка, SEO, органический трафик, упаковка продукта. Общий вывод простой: иногда следующий рост даёт не новая фича, а способность продать уже работающий продукт на другом рынке.

💭 Мой вывод недели:

AI-инструменты становятся мощнее, но выигрывает не тот, кто просто подключил модель. Выигрывает тот, кто умеет держать контекст, формулировать задачу, измерять эффект и доводить систему до результата.

🎯 Теперь хочу расширить список источников.

Если читаете адекватные каналы про AI, DS, ML, разработку, продукты или IT-бизнес — скиньте их в комментарии.

Читать полностью…

Нескучный Data Science

❗️Айтишники испортили клиентский опыт курьера

🤔 Этот заказ во ВкусВилле оказался очень поучительным.

🖍 Первое: секрет успеха ВкусВилла прост — сделай довольными сотрудников, и они уже сделают довольными клиентов.

🖍 Второе: неважно, где именно проблема: в программисте, который зафродил интеграцию, в дата-сайентисте, который специально агрессивно отрезал хвосты распределения, или в дизайнере, который прикинулся, что знает, как выглядит белый цвет, но не знает, как выглядит Bugatti Chiron.

Важно другое: один из них, а возможно, все сразу, испортили клиентский опыт что привело к потере клиента, который сам очень успешен в том, чтобы делать клиентов счастливыми, поэтому к такому отношению точно не привык.

🙏 Но, возможно, курьер читал мой предыдущий пост и простит их так же, как я простил таксиста.

🙏А банк, надеюсь, читал комментарии к предыдущему посту и не будет списывать комиссию за возвращение реального изображения в приложении.

Читать полностью…

Нескучный Data Science

ODS Moscow × Нескучный Data Science: офлайн-бранч в эту субботу

☹️ Последний год посты в «Нескучном Data Science» выходили редко, а последний квартал канал и вовсе провёл в тишине. Всё это время я набирался нового практического опыта, и теперь у меня накопилось достаточно уникального контента, которым действительно хочется с вами поделиться.

Впрочем, и старый контент я передал ещё далеко не весь — один незавершённый зарплатный опрос чего стоит 😅

Старые темы останутся, но теперь на некоторые из них я смогу взглянуть под совершенно неожиданным углом: практическое применение AI в бизнесе, подготовка бизнес-процессов к внедрению AI и построение data-driven культуры.

🤖 Отдельный фокус будет на том, как применять этот самый ИИ для себя лично, а не только на работе для других.

Обязательно поговорим про ваши любимые игры в стиле @datarascals: как они устроены в data-направлениях и как влияют на работу команд и развитие проектов.

Из неожиданного — расскажу, как и зачем совмещать психологию и AI. Мне понадобилось около полугода, чтобы найти в этом практическое зерно. Постараюсь помочь вам сэкономить это время.

Кому уже не терпится, смогут получить часть спойлеров на живой встрече. Уже в эту субботу вместе с ODS Moscow собираемся на офлайн-бранч.

📆 Когда: суббота, 13 июня
🕛 Время: 12:00
📍 Место: МИРА бистро, Тверская ул., 16, стр. 1
Вход со стороны метро «Тверская» / «Пушкинская»

Бронь на имя Александр ODS.

Ставьте 👍, если планируете прийти. Буду рад увидеться!

Читать полностью…

Нескучный Data Science

Результаты карьерного опроса

🐌 На этой неделе исполнился год с запуска нашего карьерного опроса — время подвести итоги. За это время абсолютные значения, скорее всего, уже изменились. Но опрос проводился не ради них — актуальные вилки можно итак посмотреть в канале @not_boring_ds_jobs.

Гораздо интереснее было разобраться глубже и попробовать ответить на следующие вопросы:

1. Как связан возраст и опыт с грейдом? Как он меняется в зависимости от отрасли?
2. Платят ли мужчинам больше, чем женщинам и получают они ли выше грейды?
3. Как образование влияет на карьеру?
4. Как хард скиллы влияют на доход?
5. Как отличается уровень дохода в регионах и Москве?
6. Как уровень дохода зависит от компании и сферы?
7. Как уровень дохода зависит от того, с какими данным работаешь?
8. Как долго задерживаются в одной компании в зависимости от грейда?
9. Как зависит число встреч от дохода и грейда?
10. Как меняется премиальная часть с ростом дохода?
11. Как переработки влиют на доход и скорость карьерного роста? правда ли что с ростом грейда нужно перерабатыать больше?
12. Как влияет тех бэкграунд вашего руководителя на удовлетворенность работой и доходом?
13. Какие факторы влияют на удовлетворенность работой?
14. Как влияет развитие ценных навыков на удовлетворенность? а как сюда примешивается уровень дохода? правда ли что можно доход в момент можно заменить развитием скиллов?
15. Как связаны удовлетворенность и уровень дохода с желанием сменить работу?
16. Сколько нужно доплатить в процентом соотношении чтобы перекупить дата сайнтиста? Какая этот процент зависит от удовлетворенности?
17. Кто готов терять в доходе при смене работы на более интересную?
18. Как связаны планы на смену работы с продолжительностью работы на текущем месте?
19. Как относятся к head of ds: Позитивно, негативно, конструктивно?
20. Как ** связана с уровнем дохода и удовлетворенностью?
21. Интересные но не стат значимые результаты по head of ds и выше

Сегодня мы посмотрели на EDA и ответили на первый вопрос.

🔜 продолжение в следующих постах

🙏 @Aleksandr_Vav1 за аналитику

Читать полностью…

Нескучный Data Science

Почему специалисту по ИИ нужно понимать, как работает мозг?

👼 В «Нескучном Data Science» стало тихо. Это не потому, что закончились идеи — закончилось свободное время с появлением долгосрочного R&D-проекта. У меня родился сын.

Теперь я занимаюсь не только обучением искусственного интеллекта, но и обучением естественного. Если раньше я строил иссключительно ML-системы, которые оптимизируют бизнес-метрики, то теперь строю систему, которая учится держать голову, различать эмоции и смотреть на мир с интересом.

📙 Чтобы делать это не только «по наитию», взялся за книгу Мозг и его потребности автора — Вячеслав Дубынин. С Вячеславом мы раньше пересекались на двух воркшопах: я рассказывал бизнесу, как внедрять искусственный интеллект, он — как работает естественный интеллект. Как раз после них появилось желание разобраться как работает естественный интеллект.

Чем мне была полезна книга?
– Расширила понимание, как обучается человек и как на это влияет страх;
– Подсказала как развивать любопытство у детей;
– Восполнила часть пробелов по биологии школьной программы;
– Позволила расширить представление о том с каким сложностями люди сталкиваются на различных этапах своей жизни;
– Подарила кучу аналогий из животного мира, я стал их чаще видеть в поведении людей и использовать в принятии решений.
Как бы нам это не нравилось, но у нас очень много общего с крысами, на которыхученые ставят эксперименты
Но зачем это нужно дата сайентистам?

1️⃣ Ваши модели взаимодействуют не с абстрактными ID, а с людьми.
Людьми, которые: переживают кризисы, становятся родителями, боятся перемен, ищут признание, хотят принадлежности. Понимание жизненных этапов и когнитивных паттернов позволяет генерировать лучшие признаки на основе имеющухся у вас поведенческих данных, глубже сегментировать аудиторию и строить более человечные взаимодействия.

2️⃣ Большие языковые модели учатся размышлять и принимать решения за счет анализа естесетвенного языка и анализа принятых решений естественным интеллектом. Неплохо бы разобраться в том, как учитель ИИ принимает решения.

Если вы еще не вписались в R&D-проект, то рекомендую начать с теоретической базы 👇
✈️ Дубынин о мозге 🧠

И да, буду по-тихоньку возвращаться, теперь с двумя направлениями исследований 🙂

Читать полностью…

Нескучный Data Science

Мы опубликовали стабильный, быстрый, качественный и доступный синтез для 20 языков России и СНГ

0️⃣ Популярные языки из 🇷🇺🇺🇦🇺🇿🇰🇿🇦🇿🇹🇯🇧🇾🇬🇪🇰🇬🇦🇲;
1️⃣ Всего 20 языков России и стран СНГ, всего 95 голосов;
2️⃣ Модели компактные и быстрые, как наши прошлые релизы;
3️⃣ Поддержка SSML, генерация аудио с SR 8000, 24000, 48000;
4️⃣ Два типа моделей - base под лицензией MIT на наших данных и ext на данных сообщества;
5️⃣ Остались непокрытыми языки Дагестана и ЧР, если хотите помочь с добавлением этих языков пишите на @silero_job.

⭐️Репозиторий - github.com/snakers4/silero-models
⬆️Статья на Хабре - habr.com/ru/articles/968988/

Читать полностью…

Нескучный Data Science

Farewell, Альфа-Банк ❤️

Настало время поговорить о личных стратегиях — теперь это гораздо проще, ведь вы уже немного лучше понимаете стратегию и культуру, на основе которых строилась Лаборатория. Я убеждён, что в профессиональном плане важно всегда находиться там, где твои сильные стороны используются на максимум. Как вы, наверное, уже поняли, настал момент и для меня двигаться к новым вызовам — о которых расскажу в следующих постах. А пока — время подвести итоги и искренне пожелать удачи Альфа-Банку.

Начну с последнего. Альфа-Банк за последние 6 лет достиг весомых результатов, закрыл многие гэпы — и, как бывшему фанату Тинькофф, мне приходится это признавать даже в личных разговорах с близкими. Я искренне рад за Альфу и желаю не сбавлять оборотов.

Мы прошли с Альфой долгий путь. За это время удалось многое изменить и заложить крепкий фундамент для будущих поколений.
Лаборатория выросла — от одного дата-сайентиста до управления порядка сорока талантливых специалистов. Каждый появился не случайно: мы находили точки роста бизнеса, убеждали стейкхолдеров и успешно защищали ресурсы. Можно с уверенностью сказать, что все амбициозные и успешные внутренние проекты по применению нейронных сетей были придуманы внутри Лаборатории.

Особенно приятно, что наши достижения отмечены пятью внутренними «Оскарами» — и каждый из них стал возможен благодаря нейронным сетям и нашей проактивной позиции. Сегодня Лаборатория машинного обучения — это бренд в сообществе дата-сайентистов, сопоставимый с Яндексом, Тинькофф и другими компаниями, куда стремятся попасть специалисты. Молодые таланты идут туда за культурой и ценностями, которые мы транслируем внутри и вовне.

И всё это получилось, потому что мы любой ценой отстаивали интересы Акционеров, Клиентов и Команды. Вот этим я по-настоящему буду гордиться.

Хочу сказать огромное спасибо каждому члену нашей команды — за ваш выбор и вклад. Ведь перед каждым из вас открыты двери практически любой компании. Отдельное спасибо маркетингу, рискам, финансам и всем, кто был с нами первопроходцем на пути внедрения прорывных решений.

Закончу этот блок следующим напоминанием:
Тяжёлые времена рождают сильных людей, сильные люди создают лёгкие времена. Лёгкие времена рождают слабых людей. Слабые люди создают тяжёлые времена.

Мой последний рабочий день в Альфе был чуть больше двух месяцев назад.
👉 Я уже освоился на новом месте, и начинаю активный найм в новую команду - налетайте на вакансию.

P.S. Элементы стратегии и культуры на новом месте практически не изменятся 😉

Читать полностью…

Нескучный Data Science

PR-стратегия Лаборатории

В этом посте расскажу о ключевых элементах стратегии, которые помогли построить бренд команды — как внутри компании, так и за ее пределами.

1️⃣ Каждый член команды может стать ее амбассадором. Замыкание публичных активностей на руководителе приводит, во-первых, к неэффективному использованию его времени, а во-вторых, к потере качества — вряд ли кто-то расскажет лучше ключевого разработчика.
Отдельно горжусь тем, что удалось сменить парадигму, по которой выступать на внутренних и внешних мероприятиях могли только сотрудники нужного грейда. Самый яркий пример — выступление стажера перед коллегой на девять грейдов выше, которое стало пререквизитом для появления новой функции.
2️⃣ Подготовка к выступлениям нативно встроена в процесс работы команды. Очень сложно заставить себя и команду подготовить презентацию на двадцать слайдов на конференцию по неизвестной теме. Сильно проще — взять рабочие презентации, вычистить из них конфиденциальную информацию и обкатать на внутренней аудитории.
Эти сценарии отделяет регулярная работа: регулярные презентации бизнес-заказчикам, питчинг на внутренних синках и доработка материалов по обратной связи.
На самом деле выступление на внешней конференции не сильно отличается от внутренней презентации, и работа над обоими направлениями усиливает каждое из них.
3️⃣ Мотивируем и помогаем развивать скиллы у каждого члена команды. Чтобы из «нулевого рассказчика» сделать «опытного спикера», нужно просто вместе с ним прогнать презентацию пять раз. Побеждать в соревнованиях вдвойне приятно, если компания при этом платит премию в размере месячного оклада.

4️⃣ Распространяем контент во всех каналах коммуникации. Бизнес работает с клиентами через все возможные каналы, чтобы увеличить число касаний и охватить разные сегменты аудитории. В развитии HR-бренда нужно использовать те же принципы: адаптировать контент под конференции, статьи, подкасты, обучающие курсы и посты в телеграме.
Один директор по маркетингу сказал, что хорошая реклама должна заебать. В этом есть доля правды — ведь вы выберете известный бренд, если не разбираетесь в качестве товара.
📖 Хотите прокачаться в написании ёмких и понятных текстов?
Рекомендую книгу «Пиши, сокращай 2025: как создавать сильный текст» — Максим Ильяхов и Людмила Сарычева.

Читать полностью…

Нескучный Data Science

Продуктовая стратегия Лаборатории

1️⃣ Решаем только те задачи, которые приносят реальный профит компании.
У коммерческой компании, в отличие от исследовательского института, есть акционеры. И эти акционеры ждут возврата инвестиций — в том числе на твою зарплату — в кратном размере. Если ROI нет, ресурсы уходят в другие направления, а в сложные времена — просто сокращаются. Поэтому команда должна решать не те задачи, которые “интересные” или “хочет компания”, а те, которые максимизируют матожидание измеримого результата. И уметь отбиваться от идей, которые точно не дадут эффекта — это тоже часть профессионализма.

2️⃣ Находим и продаём бизнесу задачи, а потом быстро внедряем их в прод.
Если менеджеры не знают, как монетизировать данные — ничего страшного, это нормально. Нужно идти к ним самим: изучать процессы, искать, где ML реально может помочь. Дальше — быстрый пилот, простая метрика, и объяснение результата в понятных терминах, чаще всего — через финансовый эффект. После этого важно не терять момент и как можно скорее внедриться в прод. Если инфраструктура не готова — поддерживать процесс на своей стороне, пока не появится возможность перенести. Иногда внедрение приходится буквально продавить — но если есть измеримый эффект, у бизнеса просто не останется аргументов.

3️⃣ Масштабируем решения и переиспользуем накопленную экспертизу.
Каждый бизнес-сегмент уникален, но типовые задачи везде примерно одни и те же. Большинство монетизируемых кейсов — это просто классификация: бинарная или многоклассовая. Решил задачу для одной бизнес-линии — почти наверняка сможешь применить решение в другой. Сделал PD-модель — построишь и склонность, и отток. Научился классифицировать тексты трансформером — сможешь классифицировать и транзакции. Главное — не начинать каждый проект с нуля, а превращать опыт в масштабируемую экспертизу.

4️⃣ Используем новые подходы для работы с моделями и данными.
Когда ML уже встроен в ключевые процессы, ценность приносит не “ещё одна модель”, а новые подходы:новые источники данных, более продвинутые методы, автоматизация пайплайнов. С таким подходом рост идёт за счёт эффективности — быстрее, дешевле, надёжнее.

В итоге 95% моделей, которые мы разрабатывали, были внедрены в бизнес-процессы. Почти все задачи — сгенерированы внутри команды и “проданы” бизнесу, что отображало нашу функцию лидера, а не сервиса. Иногда приходилось ждать по два года, иногда — буквально заставлять внедрять. Нейронные сети в кредитном скоринге мы вывели в прод первыми в России, потом перенесли на другие бизнес-линии, а позже автоматизировали их разработку в сервисе ANNA. Из этого опыта вырос центр компетенций по NLP.

🤔 Каждый пункт стратегии — это ответ на три простых вопроса: что мы делаем, чего не делаем сейчас, как и куда двигаемся дальше.

Читать полностью…

Нескучный Data Science

Где искать настоящий аплифт от ИИ?

С появлением генеративного ИИ многие испугались: «Всё, он заберёт нашу работу».
И да, это действительно похоже на промышленную революцию — только не на заводах, а в сфере услуг и творческих профессиях. Однако не все так плохо, если вы знакомы с термином - блендинг.

Когда вы используете ИИ, на самом деле вы блендите: 🧠 ваш естественный интеллект и 🤖 искусственный интеллект. Размер аплифта зависит от того, насколько они «ортогональны». Если вы уже пишете отличный код и подключаете ИИ для подсказок — получите прирост скорости и качества. Но это будет скорее «чуть-чуть лучше». ИИ здесь просто закрывает последнюю милю оптимизации — вы пройдете последнюю милю по повышению эффективности подобно тому, как Лаборатория внедрила нейронные сети в кредитный скоринг.

Прорывные продукты появляются тогда, когда удаётся объединить экспертизу из двух (или более) довольно ортогональных сфер. Ваша задача — взять область, где вы сами эксперт, и добавить к ней одну или несколько областей, где роль эксперта может взять на себя ИИ. Такой бленд и даёт дизрапт аплифт, а не косметический апгрейд.

Кажется, мысль простая. Так почему же мы не видим вокруг сплошных сверхрезультатов?
Потому что ЕИ нужно взять на себя роль продакта: решить, как собрать ансамбль, как запустить А/Б-тесты и настроить мониторинг качество. В такой схеме всегда есть риск «переобучения», особенно учитывая сверхожидания у ЕИ относительно возможностей ИИ и незнание ЖЦМ.

Но у меня для вас хорошие новости: у дата-сайентистов самые высокие шансы строить такие ансамбли. Просто потому что у нас уже есть экспертиза в блендинге моделей.

Так что жду от подписчиков не просто pet-проекты, а дизрапт продукты с ИИ 🚀

Читать полностью…

Нескучный Data Science

📊 Датасеты для студентов и исследователей

🤓 Скоро начнётся новый учебный год. Это значит, что всё больше студентов будут осваивать анализ данных.
Одна из самых частых проблем на старте — банально нет данных для практики. Об этом мне не раз жаловались преподаватели курсов по Data Science.

Помню, как в студенчестве я анализировал гигабайты данных одной крупной компании с помощью BigARTM, а мой однокурсник — коллекцию из десятка русских сказок. Как думаете, чей опыт оказался более релевантным для работы в бигтехе? 😉


Мы решили помочь студентам и преподавателям: собрали в одном месте наши открытые анонимизированные датасеты из соревнований по анализу данных.
Их можно использовать в курсовых, дипломах, научных статьях или просто для оттачивания навыков, например, после курса DL in Finance.

💪 Уверен, что умение работать с реальными (пусть и обфусцированными) гигабайтами данных во время учёбы — это конкурентное преимущество, которое оценят работодатели в вашем резюме.

Читать полностью…

Нескучный Data Science

Как выделить свое cv среди остальных?

⚠️ Attention is all you need, чтобы попасть на желанный собес. Но как его получить у перегруженного HR или нанимающего менеджера?

Ранее я уже писал про «гигиенический минимум» при оформлении резюме — открывающийся pdf-файл с четкой структурой и релевантным опытом. Но надо помнить: нанимающая сторона тоже оптимизирует процесс найма.

Если этого мало, можно пойти по пути Олега Седухина — добавить креатив в оформление. Но есть ещё один способ, которым со мной поделился коллега в 2018-м. Он устроился в Тинькофф… без лютых достижений в бэкграунде.

💡 Вам нужно помнить, что вы являетесь объектом в задаче матчинга. Следовательно, вам нужно дать максимум признаков «человеку-фильтру» говорящих, что именно вы — ответ на запрос вакансии.

Что делает большинство?
— Рассылает всем одно и то же резюме.
Что делал мой коллега?
— Под каждую вакансию точечно менял резюме, делая акцент на тех навыках и проектах, которые важны были конкретному работодателю.

Да, это требовало больше времени. Но результат? Его звали практически на каждую вакансию, на которую он откликался.

🧠 Personalization is all you need.

😁 Надеюсь, что этот пост повысит количество желанных офферов у @olegs9.

Читать полностью…

Нескучный Data Science

🆒 Как не стать победителем Forbes 30 under 30?

Сегодня расчехлим ещё одну неудачу из моей коллекции. Уверен, она стоила мне части медийного охвата — сейчас бы я выбрал другую стратегию. Но история не терпит сослагательного наклонения.

Зачем я вообще туда решил попасть?
Одна из причин, по которой я завёл этот канал — мне не нравилось, что видимость даёт преимущества. Это казалось несправедливым. Но раз отменить это невозможно — я решил попробовать возглавить.

С другой стороны, прокачка видимости - это ответ на устоявшиеся традиции кумовства.

В 2020-м победителем стал @kantor_ai — слушал его допкурс Data Mining in Action на Физтехе еще в 2017-м году. В 2021 году я увидел состав списка номинантов, сильно удивилился и слегка расстроился одновременно, так как забыл подать заявку. Решил, что упустить второй раз — будет ошибкой. Поставил себе напоминание через год.

Прошёл год — напоминание сработало. Еле нашёл форму для подачи (она не гуглилась, пришлось искать в одной из соцсетей). Заполнил заявку в свободной форме за 5 минут. Сделал акцент на фин. эффект — благо уже тогда был 1 млрд+.

Как я узнал что попал в рейтинг?
🎬 Ответ пришёл в абсолютно перегруженный день. Функции дипломатии и эмпатии на тот момент были недоступны. Мы снимали Deep Learning in Finance — 5 часов в офисе. Репетировали и готовились несколько выходных. Параллельно штурмовали мир чат-ботов — в день было по 10 встреч. После съёмок планировался слёт амбассадоров HR-бренда.

Еду в метро. Звонок с неизвестного номера. Мне говорят, что я стал номинантом этого самого рейтинга.

🙅‍♂️ Пару слов про контекст моего отношение к медиа на тот момент
Да, я решил «возглавить», но это не значит, что мне вдруг понравился сверхпиар невеликих достижений. Особенно если эти достижения описываются журналистами без техбэкграунда. Тогда ещё не было инфошума с нейросеточками и «секретными промптами» от инфоцыган — снобствовать было проще.
Я как-то выступал на форуме ФРАНКЕНШТЕЙН в 2020 году. Получил статуэтку за лучший доклад. После него ведущий сказал, что мой доклад был «слишком техническим». На что я ответил в микрофон примерно следующее — «мне пришлось слушать ваши фантазии, как устроен анализ данных, так что зря вы не проявили вежливость и внимание к единственному техническому докладу».


🤬 Теперь зная контекст, вы лучше поймете что было дальше. Помимо «поздравляю», меня пригласили на торжественное мероприятие, которое планировалось на завтрашний день. Я отказался и довольно в резкой форме, потому что о таких вещах необходимо предупреждать заранее. Дело в том, что мы уже забронировали на эту дату и время зал для игры в волейбол. В тот момент состав команды численно стал достаточным чтобы можно было сыграть шесть на шесть и я уже предвкушал этот формат тимбилдинга. Более того, @Aleksey_Firstov прилетел из Питера на съемки DL in Finance и было непонятно, когда представится следующий такой удачный шанс.

👩‍🍳 Дальше был слёт амбассадоров Альфы. Кулинарный мастер-класс, который высосал оставшийся запас энергии. На обратном пути в такси в 11 вечера мне написали — «пришли краткое описание себя». Накидал черновик за пару минут и отправил, надеясь на редакторов рейтинга. Ровно его, без редактуры, опубликовали на сайте. Да ещё и с фото другого Евгения Смирнова (их, к счастью, много).
Эта фотография до сих пор используется в качестве логотипа внутренних чатов команды.

Поменять текст я потом пытался, но, судя по всему, организаторы ушли в глубокую обиду.

Как вы уже знаете я победителем рейтинга не стал, а теперь знаете две ошибки, которые к этому привели.
«Может, просто не хватило голосов?» — вряд ли. CEO Альфы призвал голосовать за меня, плюс у курирующего нас члена правления банка была в подчинении целая сеть отделений. Так что голосов точно хватило.

👉 Безусловно из-за этих ошибок я проиграл в плане медийного охвата, но остался в консистентности со своими приоритетами, где команда стоит выше личных интересов.

Сейчас я бы, конечно, действовал более дипломатично и менее резко благодаря этому семплу в моем датасете из неудач, но история не терпит сослагательного наклонения.

Читать полностью…

Нескучный Data Science

Вы когда-нибудь задумывались, зачем вообще читать все эти книги про «успешный успех»?

Кажется, что там сплошь очевидные истины, которые и так всем понятны. Вот, например, популярная книга «7 навыков высокоэффективных людей» на целых 500 страниц пытается донести до вас, как несложно догадаться, всего 7 довольно простых мыслей:

1️⃣ Будьте проактивны. Если возникла проблема — ищите узкие места процессов и думайте, как избежать таких же проблем в будущем.
2️⃣ Думайте о конечной цели. Планируйте на годы вперёд и оценивайте задачи: приближают ли они вас к большой цели?
3️⃣ Сначала делайте важное. Учитесь правильно расставлять приоритеты.
4️⃣ Ищите взаимовыгодные решения. Находите компромиссы, которые выгодны всем сторонам.
5️⃣ Старайтесь понять других. Смотрите на задачи и проблемы глазами сотрудников, клиентов или партнёров.
6️⃣ Стремитесь к синергии. Ищите людей, которые разделяют миссию вашего дела.
7️⃣ «Затачивайте пилу». Критически оценивайте свою работу и инструменты, чтобы находить более эффективные подходы.

Я знаю людей, которые откровенно высмеивают книгу, мол, воды море, автор просто разводит аудиторию. Но вот незадача, я сам прочитал её после третьего курса — и она мне реально помогла. Есть, правда, один важный нюанс. Эту книгу нужно медленно смаковать, заниматься саморефлексией и буквально проживать ситуации, о которых там идёт речь. Иначе толку не будет.

Рома Васильев из Яндекса в своём блоге описывает эту особенность «встраивания софтов» в жизнь. У себя в посте он объяснил, как их нужно прокачивать (кстати, тоже привел в пример пару интересных книг), а я хочу поговорить о том, какие софты нужно развивать дата-сайентисту.

1️⃣ Умение слушать и понимать потребности бизнеса. Аналитик, которые не проводит интервью бизнеса — просто человек, который копает таблички и строит модели непонятно зачем. Нужно уметь спрашивать, что именно болит у заказчика, и решать реальные проблемы бизнеса.
2️⃣ Навык объяснять сложное простым языком. Чтобы результаты твоей работы кто-то вообще понял и начал применять. И да, это реально тяжело. Часто приходится придумывать понятные аналогии для тех, кто не является специалистом в нашей профессии, без них сложно
3️⃣ Управление приоритетами на основе практической ценности моделей. Постоянно будут срочные задачи, «горящие» запросы, внезапные исследования. Нужно уметь не зарываться в мелочах и помнить, какие гипотезы приносят ценность.
4️⃣ Умение спорить и отстаивать позицию, чтобы потом тебя не назвали токсиком. Иногда бизнес говорит: «Дайте нам эти цифры, потому что мы хотим вот так». А ты видишь, что запрос кривой или данных нет. Надо мягко, но твёрдо объяснять, почему нельзя.

Как всё это качать?

Соглашусь с Ромой — только через практику и саморефлексию. Можно читать книги и блоги (тот же Кови), но без прожитых кейсов это не врастёт. Ставьте себе микроцели: например, в следующем созвоне четко проговорить гипотезу, или не бояться уточнить, что именно важно бизнесу. После встреч анализируйте: где получилось, а где можно лучше.

А ещё учитесь давать и получать обратную связь. Это прямой путь к росту — без этого почти невозможно увидеть, где ты реально факапишь.

Читать полностью…
Subscribe to a channel