3017
AutoML, Competitions, AI Lab news. Github: https://github.com/sb-ai-lab/LightAutoML Practicioners chat: https://t.me/joinchat/sp8P7sdAqaU0YmRi Docs: https://lightautoml.readthedocs.io/en/latest/ Contacts: @rinchin, @DmitrySimakov, @RyzhkovAlex
🔥Присоединяйся к Sber AI Lab: новые проекты в EdTech, HR, агентах для бизнеса и LLM-инференсе
Работай над продуктами и исследованиями в области LLM и агентных систем.
Что делать:
🔘разрабатывать LLM‑агентов и RAG для учебных сценариев; решать OCR и document understanding (структура учебников, обработка PDF/изображений);
🔘настраивать multi‑agent оркестрацию (LangGraph, LangChain, schema‑guided pipelines);
🔘экспериментировать с GigaChat, Gemini, Qwen и др.;
🔘проводить fine‑tuning (instruction‑tuning, adapters, LoRA, SFT);
🔘строить метрики и evaluation pipeline.
🔘Нужен: практический опыт от 3 лет в NLP/LLM/агентах.
🔘Обучать LLM на GPU-кластерах, доводить модель до продакшена, выжимать максимум из инференса.
🔘Нужен: практический опыт обучения LLM, Python от 3 лет, distributed training.
🔘Строить прикладных AI-агентов для HR-направления.
🔘Нужен: практический опыт вывода в прод агентов или LLM-решений.
🔘Придумывать новые алгоритмы, проверять гипотезы, писать статьи A*/Q1.
🔘Нужен: сильный Python, PyTorch, опыт с LLM и агентами.
Проект: разработка ассистента руководителя для автономного решения рутинных задач.
Разрабатывать NLP и мультимодальные пайплайны, RAG-системы, создавать ИИ-агентов и мультиагентные системы.
Нужен: сильный Python, опыт в разработке агентов, понимание всех этапов вывода агентов в промышленную эксплуатацию.
🔥 Карьера в Sber AI Lab!
Открываем новую рубрику и рассказываем о нас и вакансиях 👇
Мы в Sber AI Lab - Центре практического ИИ
🔘Создаём технологии и продукты, решаем сложные задачи для бизнеса (LLM, мультиагентные системы, RAG, open-source)
🔘Публикуемся на AAAI/ICML/NeurIPS/KDD/RecSys и других типовых конференциях
Кого мы ищем прямо сейчас👇
🔆 Senior LLM Researcher
Придумывать новые алгоритмы, проверять гипотезы, писать статьи A*/Q1 и видеть, как идеи превращаются в продукты.
Cтек: Python, PyTorch, глубокий опыт работы с LLM (fine-tuning, RAG, агенты).
Обучать LLM на GPU-кластерах, доводить модель до продакшена, выжимать максимум из инференса в жёстких контурах.
Стек: практический опыт обучения LLM, Python от 3 лет, distributed training.
Строить end-to-end AI-решения для бизнес-задач.
Стек: ML/DL (Tabular/TS или NLP), Python, PyTorch, Docker/K8s
Создавать RAG-системы и мультиагентные решения.
Стек: NLP, опыт RAG и разработки агентов, Python, FastAPI, K8s, CI/CD.
🔄 Обновление LightAutoML v0.4.2 в PyPI 🚀
В новой версии добавили поддержку Numpy 2+, Pandas 2+, добавили модели TabM и TabICL, Piecewise эмбеддинги для числовых признаков и пофиксили разные баги: https://github.com/sb-ai-lab/LightAutoML/releases/v.0.4.2
✉️ Если вы уже использовали LightAutoML, расскажите об этом и получите наши классные толстовки и другой мерч: /channel/lightautoml/211
📣 29 ноября проводим "Sber Conf: Open Source & AI Agents"
Много мероприятий не бывает :) В этот раз фокус на научном и индустриальном ML open source, ну и куда же сегодня без агентов!
В программе:
🔘 Доклады от экспертов Сбера, Sber AI Lab, Яндекс, Т-Банка, МТС AI, ИТМО
🔘 Панельная дискуссия: «Будущее Open Source в эпоху LLM»
🔘 Реальные кейсы и инструменты для создания AI-агентов
Среди спикеров будут сотрудники нашей команды: Ринчин расскажет про наши open source библиотеки, Миле про AutoML агентов, Азиз про открытый код в научных исследованиях.
📆 29 ноября, 11:00
📍Сбер, Кутузовский пр-т, 32
➡️Регистрация и подробности по ссылке
⚡️AI Journey 2025 началась!
Сегодня стартовала международная конференция по искусственному интеллекту AIJ.
Событие пройдёт с 19 по 21 ноября и будет включать три тематических блока: общество, бизнес и наука.
В этом году Sber AI Lab 🧬 представлена во всех активностях:
➡️Выступаем с докладами в основной программе и питч сессии:
20.11.25
🔘16:30-17:00 - Джантемир Киков workshop по теме Advanced Deep Research: превращаем поиск в исследование
🔘17:25-18:45 - Константин Егоров, Липидный профиль в мультимодальном ассиcтенте GigaDoc
21.11.25
🔘11:30-13.00 - Глеб Гусев, директор Sber AI Lab в треке Фундаментальные модели и обучение представлениям
🔘11:35-13:15 - Андрей Савченко, директор по науке в треке Агенты и Глобальная память
🔘12:35-12:44 – Петр Филоненко, ОНКО-МИС: медицинская интеллектуальная система популяционной онкопрофилактики
🔘12:55–13:05 - Иван Свиридов, 3MDBench: мультиагентый бенчмарк для оценки качества диагностики и коммуникации больших языковых моделей в телемедицине
🔘14:50–15:00 - Алексей Шестов, Омар Золоев, LLM4ES: обучение представлений пользователей из последовательностей событий с помощью Больших Языковых Моделей
🔘15:00–15:10 - Юлия Беликова, Рауф Парчиев, Эффективная оценка контекстно-зависимых ответов в больших языковых моделях с использованием мета-моделей
🔘17:50–18:00 - Алина Костромина, Tsururu: библиотека на основе Python, посвященная стратегиям прогнозирования временных рядов
Big tech night в Сбере!
📆 Ночь больших технологий все ближе! 12 сентября крупные компании одновременно откроют двери офисов и расскажут как строят будущее.
🤖 Главные события big tech night в Сбере сфокусированы на LLM и агентах, но кроме докладов будет много активностей, будет интересно! Подробности здесь.
💻 Присоединиться можно как офлайн, так и онлайн. Мероприятие бесплатное, регистрируйся по ссылке!
В комментах к последним постам про логарифмирование таргета (а в комментах был материал про другие модификации и их свойства) задавались вопросы по прогнозированию временных рядов.
Ок, лучшее, что я могу посоветовать - презентация с наших совместных с ВШЭ ML-тренировок by Дмитрий Симаков, Kaggle competitions master, тимлид Sber AI Lab
Прежде чем покупать и листать большие книги -- а по рядам их написано много -- макроэкномисты и биржевые спекулянты продолжают искать философский камень -- я бы начал с этой презентации -- максимум практики и опыта в одном месте.
Наука + бизнес = идеальный мэтч в ИИ ❤️
Наука помогает понять, как всё работает, и находит новые решения. А бизнес даёт ресурсы, чтобы эти решения стали реальностью.
Но это если кратко и в теории. Реальные кейсы такой синергии и возможности для молодых исследователей обсудим на паблик-толке 17 июля в нашем офисе на Лесной и онлайн.
Вместе с Иваном Оселедцем, генеральным директором Института ИИ AIRI и Андреем Рыбинцевым, старшим директором по ИИ Авито разберём:
☑️что такое RnD в компании, и как это работает;
☑️может ли бизнес без фундаментальных исследований и могут ли они приносить прибыль;
☑️какие новые задачи появятся у учёных в эпоху ИИ;
☑️как не ошибиться в выборе — научной карьере или развитии в бизнесе.
Встреча будет особенно полезна начинающим исследователям и тем, кто хочет развиваться в RnD. Зарегистрироваться можно тут*.
*Количество мест на встречу ограничено, поэтому рекомендуем не откладывать. Также внимательно заполняйте форму: приглашение участникам будем рассылать исходя из темы паблик-толка.
#ds
Кстати, у коллег есть курс по рексистемам и библиотека RePlay для работы с ними. Вперед перенимать опыт! 🚀🚀🚀
Читать полностью…
Наконец-то выложили запись разговора с Сашей Рыжкова -- уникальным 4x Kaggle GM
Мой первый опыт в роли интервьера)
Ниже анонс от коллег:
Что ждет AutoML и как побеждать на Kaggle? 🔥
На недавней конференции MTS True Tech Day состоялось крутое интервью, которое нельзя пропустить! Никита Зелинский (CDS MTS) пообщался с Александром Рыжковым — ex-руководителем LightAutoML, а ныне Avito R&D unit lead.
Обсудили самое мясо:
🏆 Победа на Kaggle AutoML Grand Prix 2024: инсайты и стратегии от победителя.
🚀 Будущее AutoML: куда движется индустрия и какие тренды нас ждут?
🤖 AI-агенты: как они уже меняют нашу работу и жизнь.
Получился концентрированный разговор о передовых технологиях и практическом опыте. Очень рекомендуем к просмотру!
▶️ Смотреть запись интервью: тыц
👋Привет! Выкладываем видеозапись выступления Саши Рыжкова на ФКН ВШЭ про LightAutoML 🦙
https://www.youtube.com/watch?v=-1JL8h-SM50
📆 Также вчера Александр Рыжков выступил на митапе у ОТП банка с рассказом про open-source и развитие LightAutoML -- видеозапись прилагается в комментариях 😉
💔 Увидели пасхалку в посте ОТП? 💔
📺📺📺
Привет! Помимо работы над LightAutoML, мы занимаемся и следим за многими другими темами в области ML.
Завтра сотрудник нашей команды Миле Митрович выступит на научном семинаре с обзорным докладом на тему агентов, ждем вас онлайн!
💸 Сколько ты зарабатываешь на Data Science?
👉 Пройди опрос сейчас, не откладывай на потом❗️
🤔 Вы можете примерно оценить вилку на вашей позиции благодаря вакансиям из каналов, где они публикуются. Тем не менее вилки довольно широкие и одни работодатели недоплачивают или платят строго по низу вилки, другие наоборот переплачивают и выходят за ее пределы. Вам в свою очередь нужно на собеседовании или при повышении назвать одно число, ровно столько вам будет платить довольно продолжительный период времени.
📊 Запускаю опрос, который в будущем поможет подписчикам сопоставить свой набор навыков с рынком труда. Прошу вас ответить на вопросы про ваш опыт, текущую роль в компании, ваш уровень удовлетворенности и планы на будущее. Чем прозрачнее будет рынок труда, тем выгоднее будет обоим сторонам, ведь дата сайентисты не будут смотреть в лес рынка труда.
🔖 Результаты опроса буду порционно публиковать в канале Нескучный Data Science @not_boring_ds.
😉 классические вопросы с популярных интервью тоже включены)
P.S. при публикации статистики дам ссылки на каналы поддержавшие опрос.
📔 Мы внимательно следим за последними статьями в области ML, и сегодня хотим обратить ваше внимание на модель TabPFN v2 из статьи “Accurate predictions on small data with a tabular foundation model”, опубликованную в январе 2025 года в Nature. Модель работает на табличных данных, первая версия TabPFN была опубликована в октябре 2022, во второй версии помимо классификации появилась регрессия.
💡 Идея TabPFN v2:
В классических алгоритмах для решения suprevised задач на табличных данных модель обучается с нуля, в статье используется подход с предобучением:
1. Генерируются 130 миллионов синтетических датасетов с помощью каузальных графов, которые имитируют сложные зависимости в данных, пропуски, выбросы.
2. На сгенерированных данных предобучается трансформер, предсказывая таргет test выборки, получая на вход train как контекст. Для каждой ячейки таблицы используется отдельная репрезентация. Используется механизм внимания как по строкам, так и по столбцам таблицы.
3. Вместо привычных отдельных "fit" и "predict", трансформер за один проход получая и train, и test новой задачи одновременно, делает инференс на test, используя in-context learning. Простыми словами, модель обучена однажды, но подхватывает зависимости в данных из подаваемого в контекст датасета и сразу делает предсказания.
🥇 Результаты авторов:
1. Скорость и качество: в задачах классификации и регрессии на данных до 10к строк и 500 признаков за несколько секунд получает качество лучше, чем ансамбль из базовых алгоритмов (бустинги, лес, линейные), которые тюнились в течение нескольких часов.
2. Минимум работы: алгоритм не нужно тюнить, имеет отбор признаков, нативно работает с числовыми и категориальными признаками, а также с пропусками.
3. Плюсы foundation моделей: возможность получить распределение таргета, генерировать данные итд.
4. Неплохо показывает себя на временных рядах.
🤔 Выводы:
1. Статья показала эффективность foundation моделей в домене табличных данных, теперь у бустингов сильные конкуренты.
2. Пока есть вопросы с точки зрения эффективности инференса, ограниченности контекста, но дальше будут улучшения.
3. Интересно, что TabPFN v2 можно назвать AutoML решением, ведь для решения задачи он не требует ни настройки гиперпараметров, ни предобработки данных.
Тема интересная, у нас имеются наработки по этой теме, и мы работаем над их применением в LightAutoML🦙, stay tuned!
#обзор
Забыли рассказать, что наша команда в лице Дмитрия Симакова, Леонида Федосеева и Ринчина Дамдинова заняла 3 место во внутренней премии Сбера в номинации «R&D-прорыв 2025 года» 🚀🚀🚀
Команда представляла проект «Приоритезатор банковских продуктов». В нем использовалась наша библиотека градиентного бустинга Py-Boost 💡, разработанная для multi-output задач с большим числом выходов. Также над проектом работал наш бывший коллега Александр Рыжков 🤴
✈️ Сегодня на лидерборде табличных алгоритмов доминируют фунд модели, поэтому полезно посмотреть обзор на них от Димы Симакова: https://www.youtube.com/watch?v=n3Th8RThiGE
В обзоре:
🔘️️️️️️ Фундаментальные модели для табличных данных, которые решают задачи в режиме In-Context Learning. Обучение трансформеров на синтетических данных и эволюцию подходов от первых версий TabPFN до современных систем с поддержкой регрессии и расширенным контекстом.
🔘️️️️️️Перспективы использования LLM для табличных задач через сериализацию данных, а также практические аспекты: затраты памяти на инференсе и возможность интеграции этих моделей в качестве «умных» бейзлайнов в промышленную разработку.
🦙💡🔮↗🔍🤖🍃
Конкурс!
Расскажите о своём кейсе использования open-source инструментов Sber AI Lab (LightAutoML, Tsururu, Py-Boost, AutoWoE, RePlay и др) и получите подарки!
Вариант 1:
- Опубликуйте пост на Хабре/Medium или любой другой популярной площадке с рассказом об опыте использования инструментов -- получите мерч Sber AI Lab и другие подарки!
- Заполните короткую форму с описанием вашего кейса. Лучшие кейсы мы будем рады пригласить выступить на наших мероприятиях!
Вариант 2:
Если же вы не можете опубликовать ваш кейс, расскажите о нем в форме с описанием без деталей, мы будем очень благодарны :)
Будем ждать ваши отклики до 1 февраля 2026
➡️ Полный список наших инструментов на GitHub
⚡️AI Driver & RecSys: создаем будущее рекомендательных систем вместе!
Приглашаем на конференцию, где соберутся ведущие эксперты по рекомендательным системам из Sber AI Lab, AmazMe, T-банка, Lamoda , MTS и других команд.
Что ждёт участников:
🔘 Новейшие исследования и открытые датасеты
🔘 Практические кейсы
🔘 Живое общение с профессиональным сообществом
Обсудим вместе:
🔘Современные подходы к персонализации
🔘Актуальные тренды и развитие рекомендательных систем
📆 28 ноября, 10:00
📍Сбер, Кутузовский пр-т, 32
➡️Регистрация по ссылке
Товарищи фанаты и фанатки LightAutoML!
Мы очень извиняемся за вечерне-ночной пост, но тут у нас дело, не требующее отлагательств - наш друг и коллега, админ канала @dealerAI Саша Абрамов участвует в номинации "ИИ Гуру" Всероссийской премии RuCode и ему как никогда нужна поддержка всех нас 🚀
Что нужно сделать - всего 2 простых шага:
1️⃣ Перейти по ссылке https://vk.com/wall-44001716_10214
2️⃣ Найти внизу поста голосование и выбрать Сашу Абрамова среди претендентов
‼️ Голосование продлится до 5 ноября в 23:59 по МСК, так что успейте внести свой вклад в Сашину победу!
Да прибудет с нами сила LAMA-коммьюнити 🌍
Кчау, а у нас новый выпуск!
В этом выпуске разобрались с одной из самых известных платформ для специалистов по анализу данных и машинному обучению — Kaggle. Что это вообще такое и нужно ли оно вам?
Спойлер: Kaggle — это как олимпиада для взрослых, но не столько ради медалей и призов (хотя и они там имеются), сколько ради реального профессионального роста.
– Как стать гранд-мастером Kaggle и почему это работает лучше любого резюме?
– Что Kaggle дает аналитикам и зачем сражаться за тысячные доли после запятой в метриках?
– Что общего Kaggle имеет с реальными бизнес-задачами и как AutoML делает ML-щика даже из тех, кто не умеет в ML?
Обсуждали все это с нашим гостем, который уже 14 лет в Kaggle, единственным в России четырехкратным гранд-мастером Kaggle, победителем Kaggle AutoML Гран-При 2024 и руководителем R&D-юнита в AI-лаборатории Авито — Александром Рыжковым.
Яндекс.Музыка
ВК
Apple Podcasts
Telegram-плеер
остальные платформы
Стартуем через 15 минут 🚀
Ссылка для онлайн просмотра, для подключения рекомендуем Яндекс Браузер
17 июля в 17:00 пройдет обещанный разбор решения 2-го места на RecSys 2025, подключайтесь!
Читать полностью…
🔥 2 место на RecSys Challenge 🔥
Коллеги из группы RecSys нашей Лаборатории (Антон Кленицкий, Артем Фаткулин, Антон Пембек, Дарья Денисова и Леша Васильев) заняли второе место в соревновании конференции RecSys25 - RecSys Challenge.
Задача заключалась в генерации эмбеддингов на основе действий пользователей, далее поверх них обучалась нейронка организаторов, которая решала 6 даунстрим задач, 3 из которых даже не были известны. Кроме этого сложность заключалась в том, что организаторы не очень хорошо подготовили задание, поэтому соревнование регулярно продлевалось, а данные один раз заменили на новые из-за лика. В челендже приняло участие более 100 команд, 4 место заняли коллеги из RecSys группы Яндекса.
Ссылка на лидерборд: тык
Скоро будет решения 😉
💥 Привет! А ведь давно не публиковали про соревнования!
🤴🤴
31 мая на DataFest в гостях у Авито на панельную дискуссию “Мифы и правда о соревновательном ML” собрался звездный состав из мастеров и грандмастеров Kaggle (в числе них наш бывший и текущий сотрудник): Саша Рыжков, Дима Симаков, Саша Гущин, Миша Каменщиков.
Обсудили холиварные и не очень вопросы про соревнования, рассказали разные куллстори. Ссылки на видео:
🎥 YouTube
📺 VKVideo (таймкод: 2:41:47)
🔄 Обновление LightAutoML v0.4.1 в PyPI 🚀
В новой версии внедрили ряд исправлений, улучшающие стабильность и надежность библиотеки. Основные изменения:
🔘Исправление перемешивания колонок после загрузки модели: баг мог возникать при загрузке модели из файлов -- это приводило к снижению качества модели или ошибкам "IndexError: index ... is out of bounds for dimension 0 with size ...".
🔘Исправление падения с ролями NumericRole:
Ошибка "KeyError: Numeric role ...", которая возникала при использовании класса NumericRole, возникала в основном в AutoUplift (строковое задание роли работало штатно).
‼️Важно:
Первая из перечисленных проблем была критической, поэтому версия v0.4.0 будет изъята из PyPI. Настоятельно рекомендуем обновиться до версии v0.4.1. Спасибо за ваше терпение и поддержку!
📆 Последний доклад был очень интересным, и сегодня продолжим обсуждение агентов уже на панельной дискуссии в 17:00, от нашей команды снова выступает Миле. Еще можно успеть присоединиться онлайн!
👋 Кому тема интересна, рекомендуем канал Миле: там он рассказывает про свой опыт, новости ML/агентов/LLM/AutoML, добро пожаловать!
А это твой ансамбль бустингов и неройнок закусился с AutoML’м в топе лидерборда 🦙
Читать полностью…
Хочешь знать, сколько на самом деле зарабатывают специалисты в Data Science? Давайте соберем статистику, пройдя опрос от наших коллег по индустрии, и узнаем 💸💸💸
Читать полностью…
Всем привет, друзья!
Напоминаем, что наш конкурс на 5 Telegram Premium подписок на год заканчивается уже сегодня в 16.00 (проходит он довольно интересно, конечно 🙈).
В качестве интересного интерактива для конца конкурса предлагаю вам послушать подборку сгенерированных треков про LightAutoML, PyTorch-LifeStream и AutoML Grand Prix - есть ощущение что получилось прям неплохо 🔥
Также, если вы по доброте душевной хотите поддержать нас звездой на GitHub - будем только рады ⭐
Please enjoy 🦙