36043
По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo
✔️ Data-Juicer: пайплайн для подготовки данных под foundation models
Alibaba и сообщество Data-Juicer развивают open-source систему для обработки датасетов перед обучением, дообучением и RAG.
Data-Juicer помогает чистить, фильтровать, дедуплицировать, синтезировать и анализировать данные. Работает не только с текстом, но и с мультимодальными датасетами: изображениями, аудио и видео. В версии 2.0 заявлено больше 100 операторов для разных модальностей.
Практический сценарий понятный: есть сырой корпус из разных источников, где много дублей, мусора, слабых примеров и перекоса по доменам. Data-Juicer позволяет собрать воспроизводимый data recipe, прогнать его на локальной машине или в распределённом режиме и потом оценить, как изменения в данных влияют на модель.
Проект смотрит на данные как на отдельный слой оптимизации. Позволяет настроить качество, смесь, фильтры и пайплайн обработки. В ранней работе авторы показывали прирост до 7.45% по среднему score на 16 LLM-бенчмарках и 17.5% win rate в GPT-4 pairwise evaluation за счёт data recipes.
https://github.com/datajuicer/data-juicer
🤖Робозон: хакатон от Ozon Tech с призовым фондом 15 млн рублей
Это один из самых интересных хакатонов лета для специалистов по ML, робототехнике и автоматизации. Участникам предстоит решать задачи на основе реальных данных и кейсов Ozon.
Организатор — Ozon Tech.
Призовой фонд — 15 000 000 рублей.
В программе три трека под разные скиллсеты:
• Имитационное моделирование сортировочного центра
• Конструкция автоматизированного сортировщика товаров
• Интеллектуальная роботизированная система сортировки товаров, которая нам, конечно, наиболее интересна.
Участвовать можно как в одиночку, так и командой до 7 человек.
Регистрация открыта до 11 июля. Подробнее о хакатоне здесь
Для тех, кто хочет вырасти из работы с данными в ML, GenAI и прикладной ИИ.
МТС и факультет компьютерных наук НИУ ВШЭ открыли набор на третий поток магистратуры «Исследования и предпринимательство в искусственном интеллекте». В программе 30 оплачиваемых мест от МТС и обучение на реальных индустриальных кейсах МТС Web Services и MWS AI.
Студентов ждут курсы по машинному обучению, большим языковым моделям, генеративному ИИ, проектированию ML-систем, видеоаналитике, распознаванию и синтезу речи, а также технологическому предпринимательству.
Поступление конкурсное: портфолио, мотивационное письмо, онлайн-экзамен, собеседование. Также можно показать навыки через соревнование на Kaggle.
Лучшие студенты смогут получить стажировку или оффер от МТС Web Services уже в процессе обучения.
Поехали: Sonnet 5 уже вышла. Главное кратко:
• Anthropic называет её самой агентной Sonnet на данный момент
• Производительность почти на уровне Opus 4.8, но дешевле
• Сильный прирост в reasoning, работе с инструментами, кодинге и задачах с текстом/знаниями
• Модель по умолчанию для пользователей Free и Pro
• Уже доступна в Claude Code и API
• Стартовая цена: $2 за 1 млн входных токенов и $10 за 1 млн выходных до 31 августа
• Стандартная цена: $3 за 1 млн входных и $15 за 1 млн выходных токенов
• В целом безопаснее Sonnet 4.6: ниже уровень галлюцинаций и поддакивания пользователю
• Киберзащита включена по умолчанию, но Anthropic говорит, что Opus всё ещё сильнее для серьёзной работы в кибербезопасности
https://www.anthropic.com/news/claude-sonnet-5
🎥 Вебинар: Архитектурные паттерны AI-агентов: как проектировать автономные решения для бизнес-задач
На уроке рассмотрим:
• Как создавать архитектуру автономных AI-агентов, способных принимать решения и выполнять задачи;
• Какие архитектурные паттерны применяются при проектировании агентных решений;
• Как использовать агентные циклы, такие как ReAct и Plan-and-Execute, в прикладных сценариях;
• Как спроектировать AI-архитектуру для автоматизации бизнес-процесса на практическом примере.
После занятия вы будете знать:
• Как проектировать архитектуру AI-агентов под реальные бизнес-задачи;
• Как документировать и проверять архитектурные решения на разных уровнях детализации;
• Как применять профессиональные подходы и инструменты для разработки AI-решений;
⚠ Открытый урок проходит в преддверии старта курса «ИИ-архитектор».
👉 Для участия зарегистрируйтесь: https://otus.pw/zuvm/?erid=2W5zFGXnRLD
Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.
Когда баз много, администрирование превращается в ручное управление хаосом: серверы, кластеры, бэкапы, мониторинг и диагностика.
🐘 Postgres Professional на бесплатном вебинаре покажет, как управлять множеством баз через единый веб-интерфейс Postgres Pro Enterprise Manager.
📊 Это графическая платформа для DBA, DevOps, архитекторов и технических лидеров. Она входит во все редакции Postgres Pro и решает задачи администрирования без ручного написания SQL-команд.
На вебинаре покажут, как с помощью PPEM:
✅ Мониторить инфраструктуру
✅ Управлять экземплярами БД
✅ Работать с бэкапами
✅ Искать проблемы и ускорять диагностику
🤖 Отдельно покажут ИИ-ассистента в новой версии платформы: он обращается к документации и помогает быстрее решать типовые задачи.
📅 30 июня, вторник, 11:00 по Москве, продолжительность — 2 часа с Q&A.
Регистрируйтесь и приходите посмотреть PPEM в деле. Участие бесплатное.
Реклама ООО «ППГ» Инн: 7707083893 Erid: 2VtzqwfUQwK
Глобальный дефицит RAM может начать ослабевать к 2028 году.
Об этом заявил CEO Micron Санджай Мехротра на earnings call за Q3 2026.
Но важная деталь: речь не о том, что цены резко вернутся к прежним уровням.
Micron говорит осторожнее.
Поставки могут улучшиться в 2028 году, но спрос тоже продолжит расти. Особенно со стороны дата-центров, AI-инфраструктуры и серверного рынка.
То есть новая мощность может прийти, но её сразу начнут съедать hyperscalers, облака и AI-кластеры.
Для потребителей это означает простую вещь: облегчение возможно, но дешёвая память не гарантирована.
RAM становится не просто компонентом для ПК, а частью глобальной гонки за compute.
⚡️ SQL-трюк, который редко используют: `IS DISTINCT FROM`
Проблема обычного сравнения:
NULL <> 'new value'
true. В SQL NULL ломает привычную логику сравнений.
UPDATE users
SET email = :new_email
WHERE id = :id
AND email IS DISTINCT FROM :new_email;
NULLupdated_at, triggers и replication events
Мы вообще понимаем, насколько Месси статистически ненормален?
Я наткнулся на цифру: по голам + ассистам за 90 минут он почти на 6 стандартных отклонений выше среднего нападающего из топ-лиг.
Для контекста: это уже не «очень сильный игрок».
Это уровень, который статистика почти не ожидает увидеть при жизни одного поколения.
Вот почему спор про Месси часто ломается: его сравнивают как футболиста, а он по цифрам ближе к аномалии.
Мы реально застали сбой системы.
Или всё ещё есть сомневающиеся?
Вы можете выучить SQL по «Тетради смерти»
О времена, о нравы)
Разберем математику бесконечности Сатору Годжо, которая работает не как обычный щит.
Он не просто останавливает удар в последний момент. Идея в том, что пространство между атакой и Годжо как будто делится на всё более маленькие отрезки.
Сначала объект проходит половину расстояния. Потом половину оставшегося. Потом ещё половину. И так снова и снова.
Математически это похоже на бесконечную сумму: одна вторая, одна четвёртая, одна восьмая, одна шестнадцатая.
Объект всё ближе, но до контакта так и не доходит.
На практике атака как будто замедляется почти до нуля. Чем ближе она к Годжо, тем сильнее падает её эффективная скорость.
Поэтому Бесконечность — это не просто барьер. Это контроль пространства, где противник застревает в бесконечном приближении.
Google Research представила Gemini-SQL2 - новую систему text-to-SQL на базе Gemini 3.1 Pro.
Она превращает вопросы на обычном языке в исполняемые SQL-запросы, позволяя получать данные из баз без ручного написания кода.
На бенчмарке BIRD система показала state-of-the-art результат - 80,04% execution accuracy.
BIRD реально запускает запрос и проверяет, возвращает ли он правильный результат.
https://x.com/GoogleResearch/status/2065475343205740911
OptimizerDuck - open-source утилита, после которой CCleaner уже не нужен
OptimizerDuck собирает в одном приложении 30+ твиков системы: от отключения телеметрии, Copilot, Cortana и рекламного ID до тонкой настройки автозагрузки, служб, питания и задержек ввода.
Укаждой настройки есть рейтинг риска. То есть вы заранее видите, что безопасно применить, а где лучше подумать, вместо классического сценария «нажал всё подряд и потом откатываешь систему».
Что умеет:
* отключать телеметрию Windows, Cortana, Copilot и рекламный ID
* управлять автозагрузкой приложений
* настраивать службы хоста под объём RAM
* включать кастомный план питания для высокой производительности
* снижать задержку клавиатуры для игр
* применять GPU-твики, которые обычно правят вручную через реестр
Все изменения обратимы. Не понравилось, можно откатить назад. можно откатить назад.
https://github.com/itsfatduck/optimizerDuck
Готов к космическому разгону AI‑продукта?
Приходи на One Day Offer для Product Analysts! 🚀
20 июня команда GigaChat планирует найти будущего коллегу — продуктового аналитика, который поможет вывести LLM‑платформу на новую орбиту.
Ты будешь:
✔️ анализировать поведение пользователей;
✔️ проводить A/B‑тесты;
✔️ создавать дашборды;
✔️ работать с метриками.
А ещё ты станешь частью крупнейшего IT‑комьюнити.
Хочешь влиять на продукт для миллионов? Регистрируйся на One Day Offer прямо сейчас!
Сотрудники Авито ведут свой telegram-канал ⭐️
И знаете, получается мегалампово и увлекательно. Всего через несколько постов начинаешь уже чувствовать себя частью их уютного офиса: рядом знакомые весёлые коллеги из постов, и вам точно есть что обсудить.
А вообще, хвалим и одобряем. Во-первых, смело и интересно. Во-вторых, для тех, кто рассматривает работу в компании, это возможность изучить культуру и атмосферу в команде ещё до трудоустройства.
🔥 Однозначно подписка — @TeamAvito
🔥🔥 Если думаешь о работе в Авито, то добавляй сразу — @avito_career
Задача, которую Ньютон решил за один вечер
В июне 1696 года Иоганн Бернулли опубликовал в журнале Лейбница *Acta Eruditorum* математический вызов на 6 месяцев.
Даны две точки на разной высоте.
Какой формы должен быть спуск, чтобы тело съехало из верхней точки в нижнюю за минимальное время?
К январю ответил только Лейбниц и попросил больше времени, поэтому срок продлили до Пасхи.
Ньютон получил письмо с задачей вечером, когда вернулся с работы, и решил её до того, как лёг спать.
Эта задача называется задача брахистохроны.
Самый быстрый путь оказался не прямой линией, а циклоидой.
Пример:
Пусть верхняя точка:A = (0, 0)
нижняя точка:B = (π, 2)
а ось y направлена вниз.
Циклоида задаётся формулами:
Читать полностью…
x = R(θ - sin θ)
y = R(1 - cos θ)
CEO Palo Alto Networks Никеш Арора заявил, что 90% сотрудников в enterprise-сегменте отстают в AI, и это может определить судьбу их карьеры.
Он ожидает, что в течение 12 месяцев 20–25% его сотрудников изменят свои роли или будут заменены.
По исследованию Orgvue за 2025 год, 39% руководителей уже сокращали сотрудников после внедрения AI.
fortune.com/2026/07/01/ceo-of-palo-alto-networks-nikesh-arora-workers-about-to-face-darwinian-moment-thanks-to-ai-evolve-or-get-cut/
Поехали: Sonnet 5 уже вышла. Главное кратко:
• Anthropic называет её самой агентной Sonnet на данный момент
• Производительность почти на уровне Opus 4.8, но дешевле
• Сильный прирост в reasoning, работе с инструментами, кодинге и задачах с текстом/знаниями
• Модель по умолчанию для пользователей Free и Pro
• Уже доступна в Claude Code и API
• Стартовая цена: $2 за 1 млн входных токенов и $10 за 1 млн выходных до 31 августа
• Стандартная цена: $3 за 1 млн входных и $15 за 1 млн выходных токенов
• В целом безопаснее Sonnet 4.6: ниже уровень галлюцинаций и поддакивания пользователю
• Киберзащита включена по умолчанию, но Anthropic говорит, что Opus всё ещё сильнее для серьёзной работы в кибербезопасности
https://www.anthropic.com/news/claude-sonnet-5
Поехали: Sonnet 5 уже вышла. Главное кратко:
• Anthropic называет её самой агентной Sonnet на данный момент
• Производительность почти на уровне Opus 4.8, но дешевле
• Сильный прирост в reasoning, работе с инструментами, кодинге и задачах с текстом/знаниями
• Модель по умолчанию для пользователей Free и Pro
• Уже доступна в Claude Code и API
• Стартовая цена: $2 за 1 млн входных токенов и $10 за 1 млн выходных до 31 августа
• Стандартная цена: $3 за 1 млн входных и $15 за 1 млн выходных токенов
• В целом безопаснее Sonnet 4.6: ниже уровень галлюцинаций и поддакивания пользователю
• Киберзащита включена по умолчанию, но Anthropic говорит, что Opus всё ещё сильнее для серьёзной работы в кибербезопасности
https://www.anthropic.com/news/claude-sonnet-5
Postgres 19 получил хорошие улучшения в управлении I/O.
В Postgres 18 появились три режима: io_uring, worker и sync - поведение как в 17-й версии.
Мне очень понравилась производительность и контроль, которые io_method=worker принёс в Postgres. Вместе с ним можно было задать io_workers=X, то есть количество background workers, выделенных под I/O. Бенчмарки 17 vs 18 - на картинке ниже.
В 19-й версии это расширили: теперь пул может динамически расти через четыре настройки:io_min_workers - минимальный размер пула I/O workersio_max_workers - максимальный размер пулаio_worker_idle_timeout - скорость уменьшения пулаio_worker_launch_interval - скорость увеличения пула
По сути, теперь это больше похоже на I/O connection pool, а не на простую статическую настройку.
Мне нравится это направление. Жду бенчмарки. Скоро?
tracesage добавляет локальный tracing без инфраструктуры для LangChain/LangGraph-агентов всего в две строки.
Он записывает каждый chain, tool call и LLM call в SQLite, а затем показывает запуск в браузере как live graph и timeline.
Open source, установка через pip install, лицензия MIT.
https://github.com/kjgpta/tracesage
SQL-инъекция за 40 секунд: Лайт против L
Разбираем SQL-инъекцию на пальцах в формате Лайт против L. Что это такое, как обычная строка ввода меняет логику запроса, к чему это приводит и какими способами реально закрыть дыру. Коротко, по делу и так, чтобы запомнилось.
Больше таких видео: https://www.youtube.com/shorts/c4gBi094jkU
@sqlhub
🚀XSQUARE 6.6 — большой релиз уже скоро!
🎨 Новая дизайн-система
— три уровня кастомизации, настройки layout и расширенные CSS-переменные и анонс «Менеджера визуальных тем». Обновленный подход к созданию сайтов и личных кабинетов на XSQUARE.
⚙️ Что ещё в релизе
— Обновлённая компонентно-ориентированная архитектура jsAPI
— Kanban-доски в библиотеке UI-компонентов
— Работа с 4 типами СУБД на уровне ядра + дорожная карта до конца 2026
— Объявляем о поддерxжке MS SQL Server/РЕД БД на уровне ядра!
📦 XDAC 6.0
— Database Reverse Proxy Server
— Поддержка DML и выгрузка больших объёмов данных
— Уже 5 типов БД на уровне ядра
☁️ Развёртывание
— VK Cloud, Yandex Cloud, Selectel, TimeWeb, Docker, архитектуры x86/ARM/e2k/LoongArch.
🔥 И главное — идём в массы! Анонсируем тарифы для малого и среднего бизнеса, условия для физлиц и бесплатные тарифы.
25 июня в 11:00 МСК
🎯 Зарегистрироваться на вебинар
Реклама. ООО "ХИ-КВАДРАТ". ИНН 7718990614. erid: 2W5zFH2xHvR
OpenAI выпустила полную версию GPT-5.5-Cyber - своей самой продвинутой модели для авторизованной защитной кибербезопасности.
Новая модель набрала 85,6% на CyberGym и обошла:
• Mythos 5 — 83,8%
• раннюю версию GPT-5.5-Cyber — 81,9%
• GPT-5.5 — 81,8%
• GPT-5.4 — 79,0%
• Claude Opus 4.7 — 73,1%
https://x.com/sama/status/2069121360744550796
QuestDB - это open-source база данных для time-series данных, созданная для высокоскоростной записи и SQL-запросов с низкой задержкой.
Внутри у неё многоуровневый storage engine и SIMD-ускоренное выполнение.
Что важно:
- Колоночное хранение данных
Параллельное векторное выполнение запросов и использование SIMD-инструкций для ускорения обработки.
- Многоуровневое хранение
От WAL до нативного колоночного формата и Parquet в object storage.
- SQL-расширения для time-series
Поддержка ASOF JOIN, SAMPLE BY и LATEST ON.
- Интеграции
Поддерживает Postgres wire protocol и REST API, поэтому её проще подключать к существующей инфраструктуре.
https://github.com/questdb/questdb
Команда Tongyi Lab из Alibaba представила LOGOS, большую модель для всей естественной науки сразу.
Идея простая: если ChatGPT учится предсказывать следующее слово, то LOGOS так же предсказывает следующий кусочек белка, молекулы или реакции.
Разные научные объекты записываются одним общим языком токенов.
Плюс в том, что модель переносит знания между областями: понятое про молекулы помогает в работе с белками.
По словам авторов, на разных задачах LOGOS не уступает моделям, заточенным под конкретную область, а иногда и обходит их. Модель, код и статья уже выложены на HuggingFace, GitHub и arXiv.
🤗 HuggingFace: https://huggingface.co/LOGOS-Hub
💻 GitHub: https://github.com/LOGOS-Hub/LOGOS
📄 Paper: https://arxiv.org/abs/2606.16905
📚 Библиотека для работы с SQLite в C++26 с использованием рефлексии
Reflite — это библиотека на C++26, которая упрощает взаимодействие с SQLite, позволяя использовать обычные структуры как основу для выполнения запросов. Она поддерживает основные операции: вставка, удаление, выборка и обновление, избавляя от лишнего шаблона кода.
🚀 Основные моменты:
- Легковесная библиотека в одном файле
- Поддержка операций INSERT, DELETE, SELECT, UPDATE
- Использует рефлексию для работы с типами структур
- Не требует полной реализации SQL, фокус на простоте
- Совместима с современными компиляторами C++26
📌 GitHub: https://github.com/KaruroChori/reflite
#cpp
✔️ IPO OpenAI произойдет в 2027 году
Сэм Альтман сообщил сотрудникам, что выход на биржу откладывается на год. Поданный проспект эмиссии он назвал маневром для сохранения тактической свободы. В качестве альтернативы сотрудникам предложили выкупить их акции по цене $687,69 за штуку.
Задержка объясняется прогрессом в разработке самообучающегося ИИ. По мнению главы OpenAI, в период непредсказуемого развития технологий компании безопаснее оставаться непубличной.
Дополнительный фактор переноса - размещение акций Anthropic. Конкурент показывает лучшие метрики роста, тогда как OpenAI сжигает капитал.
В июне компания планирует выпустить новую модель с индексом 5.6, которую внутри оценивают как серьезный шаг вперед по сравнению с GPT-5.5.
theinformation.com
✔️ Arcee AI переезжает из AWS на Hugging Face
Данные компании разместят в сервисе Hugging Face Buckets, который оснащен встроенной CDN и оптимизирован для работы с весами моделей.
Главная причина миграции в отсутствии платы за исходящий трафик. Единое хранилище позволит Arcee AI избежать вендор-лока и запускать обучающие кластеры у любых облачных провайдеров без затрат на перенос данных.
На Hugging Face лаборатория поддерживает более 200 проектов. Среди них - файнтюн SuperNova на базе Llama 3.1, семейство моделей Trinity и открытый датасет The-Tome, включающий 1,75 млн образцов для обучения ИИ-агентов.
huggingface.co
✔️ NotebookLM получил среду для запуска кода, агентов и модель Gemini 3.5
Google обновила платформу NotebookLM. Система перешла на Gemini 3.5 и движок Antigravity, получила поддержку автономных агентов и возможность запуска кода.
Каждый блокнот теперь оснащается облачным инстансом, который включает более 100 скиллов для выполнения кода и анализа данных. В тестах новая архитектура превосходит предыдущую в 65% случаев по 5 ключевым метрикам.
В сервисе появилась возможность начинать исследования без загрузки данных через агентный поиск релевантных материалов. Результаты попадают в базу с сохранением атрибуции.
Расширились форматы экспорта: PDF-отчеты с графиками, структурированные данные, таблицы Excel, презентации PowerPoint, а также изображения с помощью Nano Banana.
Обновление доступно пользователям с подпиской AI Ultra и корпоративным клиентам.
blog.google
✔️ Cohere выпустила свою первую открытую кодинг-модель
North Mini Code - open-source модель для программирования и координации агентов, построена на архитектуре MoE с 30 млрд общих и 3 млрд активных параметров. Модель обучена управлять субагентами, проектировать архитектуру систем и проводить код-ревью.
В бенчмарке Artificial Analysis Coding Index новинка набрала 33,4 балла. В сравнении с Devstral Small 2 на аналогичной аппаратной нагрузке пропускная способность генерации текста выше в 2,8 раза. Задержка между токенами ниже на 30% при сопоставимом времени до вывода первого токена.
Веса опубликованы на Hugging Face. Тестовый доступ открыт через API и платформу Model Vault.
cohere.com
✔️ Warner Music Group приобрела разработчика цифровых отпечатков Sureel AI
Технология Sureel AI создает цифровые отпечатки аудиозаписей, декомпозируя их на базовые элементы. Алгоритмы определяют, попал ли контент артиста в тренировочный датасет ИИ-модели или использовался при генерации нового трека.
Дополнительный модуль системы выявляет дипфейки, клонирование голоса и копирование визуального стиля. Архитектура платформы поддерживает работу с видео и изображениями, в базе стартапа проиндексированы миллионы цифровых активов.
Лейбл сохранит проект как независимую платформу, рассчитывая сделать ее стандартом для музыкальной индустрии.
wmg.com
@ai_machinelearning_big_data
#news #ai #ml
SQLModel использует аннотации типов Python, чтобы объединить Pydantic и SQLAlchemy и уменьшить дублирование кода при работе с SQL-базами.
* одна аннотация типа заменяет отдельные модели Pydantic и SQLAlchemy
* хорошо совместим с FastAPI, Pydantic и SQLAlchemy
* внутри работает на базе Pydantic и SQLAlchemy
* разумные настройки по умолчанию уменьшают количество шаблонного кода
https://github.com/fastapi/sqlmodel
PostgreSQL 19 Beta 1 добавляет ON CONFLICT DO SELECT.
Выглядит как незначительно изменение, но для разработки это очень удобная штука: теперь можно атомарно сделать get-or-create.
То есть логика становится простой:
- вставить строку
- если такой ключ уже есть - не обновлять её
- просто вернуть существующую запись
Пример:
INSERT INTO users (email, name)
VALUES ('alice@example.com', 'Alice')
ON CONFLICT (email) DO SELECT
RETURNING *;
DO NOTHING, отдельный SELECT, CTE или искусственный DO UPDATE, который ничего по сути не меняет.