data_secrets | Unsorted

Telegram-канал data_secrets - Data Secrets

90396

Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n

Subscribe to a channel

Data Secrets

Пользователи встретили новость о сокращении подписки не очень радушно 🙃

Читать полностью…

Data Secrets

OpenAI переносит релиз GPT-6.1 Astra

Судя по всему, модель должны были выпустить уже сегодня на DevDay. Однако пока что выпуск отменили из-за опасений исследователей по итогам внутреннего тестирования.

Глава систем безопасности OpenAI утверждает, что модель слишком много врет о том, какие действия совершает, а также слишком часто выходит за пределы полномочий. Модель не дотянула до нужного уровня в умении оставаться в рамках задачи и отчитываться пользователю, и поэтому в стартапе еще некоторое время будут работать над ее безопасностью.

Недоучили – так и скажите, чего бубнить то...

Читать полностью…

Data Secrets

AMD купила стартап Фей-Фей Ли World Labs

Это тот самый, который занимается world models и недавно выпустил мощную мультимодальную модель мира Atlas (/channel/data_secrets/9806).

В компании говорят, что объединение поможет World Labs быть ближе к железу и масштабироваться за счет ресурсов AMD.

Стартап войдет в компанию как отдельная исследовательская организация. Сама Фей-Фей Ли займет в AMD должность исполнительного вице-президента и Chief Scientist, будет работать напрямую с Лизой Су.

Читать полностью…

Data Secrets

С минуты на минуту выходит новый Sonnet-5.5

Стоить будет ровно столько же, сколько GPT-6 Sol. Интересно, что предложат по качеству.

Читать полностью…

Data Secrets

🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинаре AI Talent Hub × Karpov.Courses

30 сентября в 18:00
разберем как работают рекомендательные системы изнутри.

Научим:

→ Превращать действия пользователей в данные для модели: просмотры, клики, реакции и другие сигналы;
→ Собирать персональные рекомендации и понимать, что показать конкретному пользователю;
→ Ранжировать контент в ленте и оценивать качество рекомендаций не только по ML-метрикам, но и с точки зрения продукта;


И покажем, как эти навыки можно развить на программе AI Talent Hub ИТМО × karpovꓸcourses «Машинное обучение: от технической базы до создания ИИ-продукта».
👉 Участие бесплатное, по предварительной регистрации → успей зарегистрироваться до 30 сентября

@aitalenthubnews

Реклама. Университет ИТМО ИНН:7813045547

Читать полностью…

Data Secrets

В Твиттере заметили, что Андрей Карпаты ничего не постит уже 2 месяца, хотя раньше делал это достаточно часто

Он даже ничего не написал про Opus 5.5

Anthropic держат его в заложниках?..

Читать полностью…

Data Secrets

Тот самый курс по ML, который прошли 200 000 человек. Теперь — в новой версии

С 2016 по 2022 год специализация «Машинное обучение и анализ данных» на Coursera была входным билетом в профессию — через неё прошли больше 200 000 человек. С тех пор AI ушёл далеко вперёд, и набор тем, которые нужно знать сегодня, изменился. Поэтому Виктор Кантор с командой MLinside обновил программу и перевыпустил специализацию заново — уже как «Искусственный интеллект и анализ данных». Цену оставили ту же, что четыре года назад.

Кому это нужно
ML обычно изучают по частям: линейные модели подтянул на работе, про трансформеры прочитал статью, про агентов посмотрел ролик на YouTube. Каждый кусок вроде понятен, а цельной картины нет. Пока задачи типовые, это не мешает. Сложности начинаются там, где спрашивают системно: на собеседовании или при переходе из аналитики в ML.

Специализация даёт последовательную базу вместо разрозненных кусков — 256 уроков и 55 часов контента.

Что внутри
▪️ Математика и Python — алгоритмы и структуры данных, матанализ, линейная алгебра, теория вероятностей
▪️ Classic ML — линейные модели и SVM, деревья и градиентный бустинг, кластеризация, метрики и валидация, введение в нейросети и PyTorch
▪️ Deep Learning — backpropagation, CNN, детекция и сегментация, RNN и LSTM, трансформеры и Attention, языковое моделирование, введение в RLHF
▪️ LLM и AI-агенты — инференс LLM, квантование, vLLM и TensorRT, полный разбор RAG, архитектуры агентов, мультиагентные системы, MCP
▪️ A/B-тестирование — дизайн экспериментов, статистические критерии, бутстрэп, CUPED, последовательный анализ, кейсы из индустрии

В разработке ещё два модуля: Production ML и ML System Design.

Кто ведёт
Уроки ведут действующие практики — директора по данным и руководители AI-направлений, работавшие в МТС, Яндексе, Сбере и других крупных компаниях. Люди, которые строили AI-команды с нуля и доводили модели до продакшена, а не просто пересказывают учебники. Большая часть команды преподаёт в МФТИ, ИТМО и НИУ ВШЭ.

Технологии в AI меняются каждые несколько месяцев, поэтому к готовым модулям регулярно добавляются новые уроки — по свежим темам и запросам студентов.

Как проходит обучение
Специализация устроена как библиотека курсов: доступ ко всем модулям открывается сразу после оплаты. Можно идти по рекомендованной последовательности, а можно изучать только те темы, которых не хватает.

Студенты ВУЗов могут получить доступ к специализации бесплатно (также как это было на Coursera), для всех остальных подписка стоит 5000 ₽ в месяц. Видеолекции, семинары, тесты с автопроверкой, задания, чат с кураторами для ответов на вопросы. Без потоков и дедлайнов: старт в любой момент, свой темп. На 3 и 6 месяцев подписка дешевле.

Сразу предупреждаем: материал сложный, на уровне сильнейших технических вузов. Это не обзорный формат: разбираем backprop в матричной форме, encoder-decoder и decoder-only архитектуры, статистические критерии и их ограничения. Цель не развлечь и дать чувство, что все сразу получается само, а реально научить.

Зато вместо разрозненных знаний у вас будет система: понимание, как методы устроены внутри и какой выбрать под конкретную задачу.

Полная программа и варианты подписки — по ссылке на сайте Специализации

Читать полностью…

Data Secrets

Google засунули AI-агента в 20+ чатов реальных команд на 5 месяцев. Результаты получились забавные.

https://arxiv.org/pdf/2609.29901

Агент имел доступ к документам и баг-трекеру команды, как обычный сотрудник, умел сам заводить баги, писать людям в личку, реагировать эмодзи, тегать коллег.

И все бы ничего, но, внезапно, главная проблема оказалась в том, что ИИ не поладил с живыми людьми. Одного инженера он на полном серьезе отчитал за шутки (не понял сарказма). В другой команде проставил тег вице-президенту в 16 багах подряд, посчитав, что раз человек в контексте, значит, должен разгребать баг-трекер.

В общем, сработаться с агентом оказалось сложнее, чем кажется. Некоторые команды стали создавать отдельные приватные чаты без него: чтобы обсудить найм сотрудников, чувствительные темы или просто почувствовать, что их не слушают. Один из участников сказал, что ощущения были очень похожи на «большого брата».

Читать полностью…

Data Secrets

Axios пишет, что OpenAI и Anthropic расследуют "десятки тысяч" инцидентов с побегами агентов

Со ссылкой на источники в обеих компаниях и независимых исследователей безопасности журналисты утверждают, что статистика гораздо пессимистичнее, чем мы могли себе представить. В эти "десятки тысяч инцидентов" входят обходы guardrails, побеги из сандбоксов, попытки взломов внешних сайтов и так далее.

Возьмем, например, system card к Opus 5.5. Даже там компания открыто пишет, что модель пыталась выбраться из sandbox в 1.5% тестовых прогонов. Учитывая, что для каждой модели прогоняются сотни тысяч тестов и больше, можно легко прикинуть масштаб происходящего.

Однако исследователи, с которыми говорили Axios, утвеждают, что и это – только верхушка айсберга, и дело даже не в количестве инцидентов, а в том, что автономные системы в принципе делают то, что им прямо запретили, в том числе потенциально противоправные вещи. Общий их вывод такой: ни одна из компаний пока не может утверждать, что полностью контролирует поведение своих моделей.

Читать полностью…

Data Secrets

Топ-10 советов, как стать миллионером

Читать полностью…

Data Secrets

OpenAI прямо сейчас приостановила все обучение мощных моделей из-за нового инцидента

https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot

20 сентября агент решал поисковую задачу в песочнице (естественно, без доступа к интернету). Прокси блокировал исходящие веб-запросы, но DNS-резолвер не был так же закрыт, и агент стал передавать вопросы внешнему чат-боту, кодируя их в DNS-запросах, и таким образом получал ответы из сети.

Компания объявила, что обучение будет приостановлено до тех пор, пока они не убедятся, что уязвимость закрыта, и не проведут дополнительный red-teaming. Когда обучение возобновится, OpenAI начнут новый запуск с улучшенным элайментом, а эту конкретную модель дообучать не будут.

Читать полностью…

Data Secrets

Исследователи из AIRI запустили открытое сообщество для решения NetHack.

Зовут объединяться всех работающих над системами планирования для искусственного интеллекта. У участников будет свой способ получить программу, свои инструменты и своя стратегия. Общая инфраструктура позволит видеть результаты, сравнивать их между собой и продолжать разрабатывать решения друг друга.

Для старта доступен эволюционный харнесс на базе MAP-Elites: Claude Code, Codex или OpenCode модифицируют код ботов, а алгоритм сохраняет лучшие варианты для разных стартовых персонажей. В самой игре действует получившаяся программа, а не LLM на каждом ходу; участники могут разрабатывать собственные харнессы, а результаты независимо перепроверяются на скрытых сидах.

Пробовать решить NetHack можно тут.

Читать полностью…

Data Secrets

Сегодня не 14 февраля, но мы желаем вам найти человека, который будет смотреть на вас также, как Альтман смотрит на Маска 🥰

* фото со вчерашнего ужина в Белом Доме (Трамп принимал президента Китая Си Цзиньпина). Гостей было больше 130, среди них Безос, Маск, Хуанг, Альтман, Кук, Пичаи и другие. Не позвали только Амодеи. Напоминаем, что ранее Трамп назвал CEO Anthropic лицемером, который строит из себя "идеального маленького ангелочка"

Читать полностью…

Data Secrets

OpenAI готовит подписку за 500 долларов 🤑

Пока что в описании плана единственные изменения по сравнению с ChatGPT Pro – это «Самая быстрая работа в Work и Codex». Скорее всего, речь про ту самую Astra/Sol на Cerebras (/channel/data_secrets/9708).

Миллионеры на месте?

Читать полностью…

Data Secrets

🌱 Alfa Connectome ML Competition 🌱

Началось новое соревнование по машинному обучению от Wunder Fund.

Задача: Вы будете изучать исторические торговые данные для двух связанных инструментов. Нужно создать модель, которая предсказывает индикаторы движения цены одного из них по информации об ордербуке, сделках и кое-чем еще.
По сути, классическая работа кванта. Вы будете работать с реальными биржевыми данными.

Когда: 11 сентября — 15 ноября

Призовой фонд: $13,600

Победители получат денежные призы, приглашение побеседовать в Wunder Fund, а главное — большое интеллектуальное удовольствие. Сам Wunder Fund с 2014 года занимается высокочастотным трейдингом с дневным оборотом более $10 млрд.

>> Участвовать

Читать полностью…

Data Secrets

OpenAI возвращает Pro за $200

С завтрашнего дня снова можно будет оформить Pro за $200. Вместе с этим OpenAI меняет расчет использования: в пересчете на стоимость API новая подписка будет давать примерно в два раза меньше старой. При этом пятичасовые лимиты возвращать не будут.

OpenAI объясняет изменение тем, что сами модели становятся дешевле и эффективнее. Например, новые GPT-6 Sol и Luna вышли с ценами API в два раза ниже предыдущих, поэтому даже при меньшем лимите в долларах компания обещает, что фактически на подписке получится сделать больше работы, чем месяц назад.

Завтра к Pro также добавят новые возможности, которые вообще не будут расходовать лимиты. Что именно это будет, пока не раскрывают.

Читать полностью…

Data Secrets

Полноценный data stack можно собрать внутри своего контура

Гибридная схема позволяет распределять мощности между своей площадкой и облаком в зависимости от нагрузки и того, где ресурсы в конкретный момент требуются.

У Yandex Cloud для этого есть несколько решений. Cloud Interconnect объединяет локальный и облачный контуры по приватному каналу, а BareMetal Extend: Virtualization позволяет развернуть частное облако на выделенных серверах.

Отдельное направление — работа с данными и затратами. Intelligent Tiering автоматически распределяет данные между классами Object Storage с учетом частоты обращения. А обновленная on-premises-платформа Stackland позволяет собрать полноценный data stack внутри инфраструктуры компании: от хранения и обработки данных на базе ClickHouse, PostgreSQL и Trino до оркестрации через Airflow и визуализации в DataLens.

DNS Inbound связывает DNS локальной инфраструктуры с облаком, а Billing API позволяет детализировать расходы вплоть до отдельных ресурсов.

В итоге компании могут объединять облачные и локальные мощности, выстраивать собственную платформу данных из готовых компонентов и управлять инфраструктурой с учетом нагрузки и затрат.

Читать полностью…

Data Secrets

Вышел Sonnet-5.5!

Главное: по бенчмаркам модель лучше GPT-6 Sol и довольно плотно подобралась к новому опусу.

Обещают, что помимо качества, модель также будет дешевле Sonnet-5 за счет экономии токенов (пишут, что на внутренних тестах выходило примерно на 30% дешевле в пересчете на задачу).

Кроме того, модель стала на 30% быстрее генерировать текст.

Также заверяют, что новый Sonnet чище пишет и обладает «талантом к дизайну».

Да будут тесты!

https://www.anthropic.com/claude-sonnet-5-5

Читать полностью…

Data Secrets

Джеффри Хинтон, Йошуа Бенджио, Якуб Пахоцки из OpenAI, Джек Кларк из Anthropic и еще 18 очень влиятельных ученых написали статью про то, к чему может привести RSI

TL;DR: мы потеряем контроль и все умрем

Авторы обсуждают так называемый интеллектуальный взрыв, то есть резкое ускорение прогресса ИИ за счет самого ИИ.

По данным Anthropic, доля одобренного кода, написанного ИИ, выросла с единиц процентов до 80%+ с января 2025 по май 2026. Доля R&D-работы, которую ИИ выполняет (почти) самостоятельно, выросла с 1% до 26%. Авторы считают, что в ближайшие годы агенты могут автоматизировать большую часть работы по AI-исследованиям и разработке, а возможно, и всю. Например, экстраполяция трендов METR говорит, что многомесячные R&D-проекты могут быть автоматизированы уже к середине 2028 года.

Получается, что каждая компания будет иметь миллионы топовых исследователей вместо тысяч, и при этом они будут работать быстрее. А значит, научный прогресс, который занял бы годы, сможет уложиться в месяцы.

Конечно, есть ограничения, типа: лимиты вычислений, данные, трудноавтоматизируемые задачи, убывающая отдача от исследовательских усилий и так далее. Тем не менее, ученые уверены, что интеллектуальный взрыв – это очень вероятный сценарий, и он грозит потерей контроля над ИИ и сломом баланса сил.

Авторы просят власти заранее заставить лаборатории отчитываться, пустить к ним аудиторов и заготовить красную кнопку и аварийные планы. Вот так.

Смело добавляем статью в копилку нагнетающих эссе и открытых писем, на которые последнее время пошла мода у ученых и CEO

Читать полностью…

Data Secrets

Все настолько любят ресеты от Тибо, что даже 6 точек от него набирают миллионы просмотров

Что это значит на этот раз? 600 долларов за подписку? 🤑

Читать полностью…

Data Secrets

Дженсен Хуанг и 100+ партнеров анонсируют NVIDIA Open Agent Safety Platform

Это система для контроля и ограничения ИИ-агентов, главная идея которой состоит в том, чтобы следить за агентом не только на уровне софта, но и на уровне железа.

Технически она будет состоять из двух составляющих:

1. OpenShell – открытый (Apache 2.0) рантайм, который запускает агента в песочнице с изоляцией на уровне ядра. Оператор заранее описывает, к каким файлам, инструментам и учетным данным у агента есть доступ, и эту политику принудительно проверяют до запуска и во время работы агента.

2. Sentry – независимый слой контроля, который крутится прямо на чипе DPU BlueField-4. Он собирает в единую картину действия агента, ловит попытки отхода от задачи и проверяет, что у агента не больше полномочий, чем ему выдали.

Ключевое здесь – что BlueField-4 стоит на единственном пути между узлом и моделью. Агент не может сделать следующий шаг без обращения к модели, а значит, DPU видит все и может прервать работу в реальном времени, но при этом он изолирован от хоста и находится вне досягаемости агента.

Софт будет открытый, стандарт безопасности декларируется общим. Но есть нюанс. Лучше всего (вот сюрприз!) все это работает на железе NVIDIA. Сначала Хуанг продает железо, на котором агентов обучают и запускают, теперь он продает железо, которое следит, чтобы эти агенты не сбежали. Монополия!

Среди партнеров: Anthropic, SpaceX, HuggingFace, Perplexity и другие. OpenAI на тусовку не позвали...

Читать полностью…

Data Secrets

OpenAI: заявляют, что замедляют обучение и массово перебрасывают человеческие ресурсы на безопасность

Тем временем Борис Пауэр, глава Applied Research в OpenAI: «80-90% исследований компании сейчас посвящены GPT-7, GPT-8 и следующим моделям»

(С ним в разведку не идем)

По словам Бориса, те улучшения, которые делаются в рамках текущего поколения (включая дообучение) – это, скорее, вынужденная мера, которая ускоряет обучение и немного бустит модели сегодня. Но такой подход не является долгосрочной стратегией компании.

На самом деле их видение – это обучать огромные супермощные модели следующих поколений, а затем дистиллировать их во что-то поменьше. Например, Luna – это, судя по всему, дистилляция Astra.

Похоже на замедление? 🗿

Читать полностью…

Data Secrets

Недавно мы рассказывали об открытом письме филдсовских медалистов в защиту математики в эпоху ИИ. Нет, его авторы не предлагают запретить нейросети! Они просто хотят, чтобы вместе с ответами на важные теоретические вопросы наука получала ещё и пути их решения.

Без метода и контекста результат трудно проверить, обсудить и применить в следующей задаче. Любое доказательство нужно верифицировать, а идеи — уточнить и найти, где ещё они работают. Когда кто-то выдал правильный ответ, настоящая математика только начинается! 

В канале «Зачем мне эта математика» как раз пишут о том, как она работает. В рубрике #это_база разбирают, из каких определений и допущений рождаются привычные всем нам понятия. Под хештегом #как_устроено объясняют, как математические модели описывают реальные процессы.

Подписывайтесь на «Зачем мне эта математика», если тоже считаете, что для науки важна не только цель, но и путь к ней.

Читать полностью…

Data Secrets

На DevDay OpenAI выпустят нового always-on агента

Сейчас он мелькает под кодовым названием «o» (где-то мы эту букву уже слышали, ну да ладно, видимо остальной алфавит Альтману не по душе).

Упоминание агента уже появилось на экране обновления тарифа ChatGPT у многих пользователей. Судя по утечкам, агент будет продолжать работать постоянно, даже вне обычных чат-сессии и, возможно, получит собственный email (или будет постоянно мониторить ваш).

Под капотом, по слухам, будет модель Aeon – вариант GPT-6 Astra, заточенный под длинные задачи.

Но сильно не обольщаемся, возможно «o» выйдет только в новом тарифе за 500 долларов 😃

Читать полностью…

Data Secrets

Навайбкодить AI-агента сейчас можно за вечер. А вот довести его до прода так, чтобы он не выбирал неправильные тулы, не работал с устаревшими данными и не выполнял опасные действия без ограничений – уже совсем другая история 😵‍💫

Как раз про этот разрыв между демкой и нормальной системой сделали курс «AI-агенты» в Школе Высшей Математики.

Ведут его инженеры, которые запускали агентные системы в Revolut, Wildberries и Точка Банке. В программе разберут всё, что нужно агенту уже в реальной эксплуатации:

— трейсы, логи и отладка агентов
— метрики и оценка качества
— ограничения для опасных действий
— RAG, LangGraph, MCP и Langfuse
— мультиагентные системы и деплой

Курс идёт 12 недель, занятия живые + домашки с фидбэком от преподавателей. Нужны Python и опыт работы с API, опыт разработки агентов не обязателен.

Старт нового потока — 1 октября.

Если пока не уверены, что курс вам подходит, у ребят есть бесплатное вводное занятие и воркшоп про AI-агентов в BigTech.

По промокоду DATA дают скидку. Программа и отзывы – по ссылке 🍯

Реклама. ООО ШВМ, ИНН 9728100991

Читать полностью…

Data Secrets

Claude посчитал девятипетлевую амплитуду в N=4 SYM. Эту задачу эксперты долго считали слишком тяжелой для прямого расчета.

Амплитуды рассеяния – это формулы, по которым физики предсказывают, с какой вероятностью частицы провзаимодействуют тем или иным образом. Точно их посчитать почти невозможно, поэтому считают приближенно, до определенного числа петель: чем петель больше, тем точнее ответ, но и тем быстрее растет сложность вычислений.

Большинство реальных амплитуд посчитаны всего до двух-трех петель. Новые методы расчета обычно обкатывают на упрощенных игрушечных теориях, например на суперсимметричной теории Янга-Миллса (N=4 SYM). Но даже в ней рекордом до сих пор было восемь петель, а девятую считали слишком тяжелой для прямого расчета.

В августе физик и блогер Мэтт фон Хиппель публично бросил ИИ-компаниям вызов и предложил попытаться решить эту задачу на бюджете обычного академика. Через месяц двое физиков из Anthropic вернулись с результатом.

Они запустили Fable 5.1 внутри Claude Science, дали одну строчку с формулировкой задачи, а дальше в основном писали что-то типа «я спать, продолжай». В итоге Claude посчитал амплитуду двумя разными способами, каждый обошелся примерно в $1–2к (сами вычисления – около $100, неделя на 96 CPU, остальное – работа модели).

Диксон результат проверил и подтвердил. По его словам, самое впечатляющее – это даже не объем вычислений, а то, что модель модель с нуля собрала очень хрупкую схему расчета для задачи, где любая мелкая ошибка ломает все. Он заявил, что теперь Claude «понимает их статьи лучше любого человека, кроме соавторов» 😐

Кстати, почти одновременно группа Сун Хэ из Китайской академии наук независимо получила основную часть того же результата с помощью GPT-6, но Anthropic все-таки были первыми в публикации основного решения.

Читать полностью…

Data Secrets

Новая обложка The Economist

Журналисты: да не нагнетаем мы
Также журналисты:

Читать полностью…

Data Secrets

Робозона на E-CODE: место сбора роботов

Каждый год ко Дню программиста Ozon Tech устраивает масштабную двухдневную конференцию E-CODE. В этом году на ней было особенно много роботов.

Часть из них (прототипы устройств) привезли с собой финалисты инженерного хакатона Робозон. Другие, например, гуманоиды и робокошки, отвечали за классные селфи гостей E-CODE. Роборуки готовили мороженое и коктейли, рисовали портреты. А ещё одни машины пытались обыграть всех в настолки.

Как сегодня создаются роботы и какие задачи они решают в России и в Китае, можно увидеть в записи: доклады уже доступны в группе.

Читать полностью…

Data Secrets

Google запускают свои TPU в космос

Они объединились с SpaceX, и уже на ближайшей миссии Transporter‑18 отправят прототип спутника с TPU, чтобы проверить работу своих чипов в реальном космосе.

Платформу и интеграцию Google делает совместно с Planet, известной своими спутниками для съемок Земли.

Главное, что предстоит проверить – будет ли работать отводка тепла. На Земле для этого используются воздух, вентиляторы и огромные системы охлаждения. В вакууме нет конвекции, и лишнее тепло можно сбрасывать в основном излучением через радиаторы. Google испытывает комбинацию тепловых трубок и радиаторов в термовакуумной камере.

Читать полностью…

Data Secrets

Легендарного разоблачителя Шмидхубера взяли на работу в SakanaAI. Там он займет пост Chief Scientific Advisor.

Будет советовать как правильно цитировать его статьи из 80-х

Читать полностью…
Subscribe to a channel