90396
Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n
А вы заметили, что с появлением агентов зазор между демо и продом достиг своего максимума?
Сейчас это почти что два разных продукта. Демо соберет каждый второй: подключил тулы, обвязал промптом, показал на созвоне и все. На проде – совершенно другое дело. Логи могут быть чистые, все метрики зеленые, а агент при этом выбирает не тот тул, тащит устаревшие данные и тд. Если обычная ошибка LLM хотя бы видна, то ошибка агента – часто нет. И если материалов по промптингу и базовым фреймворкам достаточно, то вот про мониторинг, guardrails и все то, что отделяет пилот от инцидента, информации в разы меньше.
Наши друзья из Школы Высшей Математики тоже обратили внимание на эту пропасть, и решили перекинуть мост. Они создали курс по AI-агентам, который ведут три инженера, запускавшие агентов в огромных системах. Один строил в Revolut AI ассистента с доступом к транзакциям – сейчас продукт работает по всей Британии. Другой держит в Wildberries агентов-кодеров и ревьюеров. Третий в Точка Банке собрал систему оценки качества на 5000 звонков в день.
Программа разбита на 12 недель и три логичных блока:
— Сначала разработка агента: работа с LLM через API, structured outputs и tool calling, ReAct-агент с памятью, RAG, разбор реальных архитектур.
— Дальше самое недообъясненное в индустрии: качество и оценка. Как отладить агента по трейсам и логам, собрать говорящие метрики и поймать ответы, которые выглядят правильными, но неверны (до того, как это увидит пользователь!).
— Финальный блок – фреймворки и деплой: LangChain, LangGraph, Telegram-бот через MCP, observability в Langfuse, мультиагентные системы через протокол A2A.
Формат – живые занятия раз в неделю, на которых преподаватель поэтапно собирает код на ваших глазах. Домашние задания проверяют лично и дают глубокую ОС. От вас требуется знание Python и опыт работы с API, опыта создания агентов не требуется.
Старт второго потока – 24 сентября. Курс для вас, если вы уже наигрались с демо, и хотите научиться строить то, что действительно заработает.
Реклама. ООО "ШВМ", ИНН 9728100991
OpenAI украли еще одно доказательство?
На фоне скандала с Тристаном Бакмастером и Левентом Альпеге внезапно вспыла еще одна история. Помните, в начале августа OpenAI объявили, что Astra решила 10 открытых математических задач? В числе прочего там было построение первой несофической группы, один из самых мощных результатов из того анонса: /channel/data_secrets/9645.
Так вот немецкий математик Андреас Том рассказал, что ключевой технический шаг в доказательстве OpenAI напрямую опирался на те идеи, которые он и его коллега обсуждали в чатах с ChatGPT на протяжении нескольких месяцев.
С 2016 года Том и Габор Кун занимались софичностью групп и добились определенных результатов (в частности, было опубликовано несколько работ). В последние месяцы они обсуждали конкретные идеи по расширению их метода на новые случаи. Неопубликованные черновики и методы они также загружали для обсуждения в ChatGPT.
После того, как OpenAI опубликовали свои результаты, Том начал подозревать, что модель могла получить доступ к этим данным. Он утверждает, что путь, который выбрала модель, был далеко не самым очевидным. Большинство исследователей скорее пробовали бы другой подход (через квантовые игры), и то, что модель "случайно" выбрала именно тот непопулярный подход, который Том именно в это время обсуждал в чатах с ChatGPT, кажется статистически подозрительным совпадением.
После анонса ученый даже написал в OpenAI и напрямую спросил, не обучали ли модель на его чатах и не было ли у нее к ним доступа, на что получил холодное "that did not happen". Только после истории с Бакмастером ученый решил рассказать о своем опыте публично, потому что эти истории "подтверждают потерю морального компаса у исследователей OpenAI".
Вопрос знатокам: сколько уже лет подряд Apple обещает на презентации, что Siri станет умнее, будет вашим личным ассистентом, начнет выполнять за вас ВСЕ задачи и рожать детей?
Читать полностью…
Кстати, знаете же группу Muse?
Так вот Цукерберг видимо выкупил у них ник @muse в X и Instagram*. Теперь у рокеров, у которых почти 3 миллиона подписчиков, ник стал museband, а muse принадлежит новому агенту Meta* 🤷♂️
Внимание, реакция на этот утренний тред лида по элайменту из Anthropic
Джейкоб здесь прав - мы действительно искренне верим, что ИИ может убить всех людей! Лично я считаю, что вероятность того, что это случится в течение следующего десятилетия – >10%. Я считаю, что Anthropic старается изо всех сил, но у нас еще нет плана по решению проблемы суперинтеллекта, и мы явно не на пути к этому.
Заряд оптимизма с утра заказывали? 🗿
Исследователь, специализировавшийся на предобучении LLM и обработке данных, ушел из Anthropic, обвинив ИИ-компании в безответственности
Джейкоб Коксон последние три года занимался претрейном в OpenAI и Anthropic (у них он значился как core researcher). Сегодня ночью он объявил об увольнении и написал в X целый тред о том, что компании, по его мнению, безответственно гонятся за самосовершенствующимся сверхинтеллектом, забывая про безопасность. Он назвал это «игрой с человеческими жизнями».
По мнению Коксона, скоро появятся сверхчеловеческие системы, способные взламывать что угодно, мгновенно совершать революции в любой области и накапливать реальную власть и ресурсы.
При этом он утверждает, что люди, разрабатывающие ИИ, тоже искренне в это верят. Как и в то, что технология может убить всех к концу десятилетия. По его словам, такие разгоны – не маркетинговый трюк, а наоборот. Якобы руководители смягчают публичные формулировки, но в частных разговорах выражают настоящий страх.
На вопрос "Но почему же тогда они продолжают?" Коксон отвечает, что в OpenAI многие не осознали масштаб цивилизационных ставок, а в Anthropic ставки понимают хорошо, но компания заперта в гонке: там героически считают, что раз другие не будут действовать ответственно, придется делать это самим, несмотря на риск. В итоге прогресс продолжается – из-за гордыни и авантюризма.
Джейкоб также обратился к другим исследователям и призвал их подумать, готовы ли они и дальше молча запускать сверхразумные модели без строгого понимания того, к чему это приведет.
Сегодня во всех блогах мира:
P.S. Вообще решение еще не прошло формального рецензирования, так что, вполне возможно, во всем мире еще нет НИ ОДНОГО человека, который понимал бы его до конца. Думайте.
Подробности по решению Навье-Стокса внутренней моделью OpenAI:
– Есть аналитическое доказательство и формализация Lean.
– Доказано, что гладкое течение несжимаемой жидкости в 3D может за конечное время развить сингулярность. То есть скорость в какой-то точке жидкости неограниченно растет, хотя движение начинается гладко и энергия конечна на всем пути.
– Решение – это вихрь, который закручивается вовнутрь и вытягивается типа спагетти. Центральная область сжимается и ускоряется так, что энергия остается конечной. Это доказывает варианты С и D из официальной формулировки Clay Institute.
По поводу скандала с кражей решений интерпретация компании такая:
– С 28 августа OpenAI обучали новую внутреннюю модель, заметно превосходящую GPT-6 Astra. Услышав 1 сентября слухи о том, что решены две проблемы тысячелетия, они запустили мультиагентную систему (до ~10 000 параллельных агентов) для проверки модели на всех открытых проблемах тысячелетия. Агентам давали разные варианты формулировки задачи и доступ к кэшированному интернету и коду.
– По пути агенты разрешили более простой вопрос – регулярность для уравнений Эйлера (практически та же задача, над которой работали Бакмастер и Альпеге, но без условия на forced). Это заняло около 50 часов силами почти 100 агентов.
– После этого ресурсы перебросили на Навье-Стокса; решение нашли через 88 часов после запуска 5 сентября. Еще 17 часов ушло формализацию в Lean.
В общей сложности вышло ~130 млрд токенов.
OpenAI выложили решение задачи тысячелетия
Мы делимся решением проблемы Навье-Стокса, одной из задач тысячелетия, одной из самых глубоких задач математики.
Доказательство было подготовлено группой агентов, использующих модель OpenAI следующего поколения, значительно более мощную, чем GPT-6 Astra.
Вышел первый трейлер Artificial – фильма про OpenAI и увольнение Сэма Альтмана
Сэма играет Эндрю Гарфилд, а Юра Борисов выступает в роли Ильи Суцкевера. В прокат фильм выходит уже в декабре.
Смотрим! https://youtu.be/FyPJhzJ_aE8
Astra успешно проходит все 48 уровней игры «I’m Not a Robot» 🗿
От этом твитнул разработчик из OpenAI
I’m Not a Robot – это браузерная капча, в которой сложность увеличивается от уровня к уровню: сначала нужно просто тыкнуть на галочку, потом отличить чихуахуа от кексов, решить кроссворд, нарисовать почти идеальный круг, припарковаться, решить математический пример и держать ритм нажатиями на клавиатуре.
Попробуйте пройти сами (спойлер: возможно, у вас не получится) -> https://neal.fun/not-a-robot/
Пошел слух, что OpenAI решили одну из задач тысячелетия
Речь про Навье-Стокса, и с этой историей разразился настоящий скандал.
Два математика – Тристан Бакмастер из NYU и Левент Алпеге из Anthropic – год работали над этой задачей, и обнаружили доказательство коллапса решений для уравнений Эйлера – это родственная, но более простая задача, чем сам миллениум. Тем не менее, это очень большой результат и ощутимая подвижка в прогрессе по Навье-Стоксу.
В частности, Теренс Тао назвал работу Бакмастера и Алпеге выдающимся достижением и сказал, что не видит препятствий для распространения метода на самого Навье-Стокса.
В сообществе почти сразу пополз слух, что кто-то близок к прорыву по Навье-Стоксу. Многие приписывали это Anthropic, и Бакмастер решил лично написать в OpenAI знакомому математику и прояснить ситуацию, сообщив, что это его личный, а не корпоративный проект. Мотивом было сохранение академической прозрачности, но этот жест доброй воли стал переломным моментом.
Как говорит сам Бакмастер, после этого OpenAI начали работу над своей (более сильной) версией результата. Через несколько дней ему сообщили о том, что их внутренняя модель нашла контрпример для Навье-Стокса (потенциально миллениум), используя тот же метод, который выбрали Бакмастер и Алпеге.
Доказательство ему не показали, а когда математик спросил, когда был отправлен первый промпт по этой задаче, выяснилось, что это произошло уже после того, как информация об их с Алпеге работе дошла до OpenAI.
Кроме того, Бакмастер подозревает, что OpenAI могли воспользоваться данными из его переписки с Codex, куда он загружал все файлы проекта. Когда он спросил об этом в переписке, то прямого ответа так и не получил.
Затем Бакмастеру, по его словам, предложили два варианта: либо скоординированное совместное объявление, либо он один пишет результат, указывая модель OpenAI в качестве источника. При этом Себастьян Бубек из OpenAI дважды настаивал на исключении Алпеге из авторов, ссылаясь на «раздражающий» факт его работы в Anthropic.
Бакмастер отклонил оба предложения, и в итоге из-за давления они с Алпеге опубликовали свои результаты по уравнениям Эйлера раньше срока, чтобы точно зафиксировать авторство: tristanbuckmaster/117233413705701198" rel="nofollow">https://mastodon.social/@tristanbuckmaster/117233413705701198
Бубек публично назвал обвинения ложными и провокационными и сказал, что действовал по академическим нормам, пообещав дать более полный ответ позже. За него также вступился Ноам Браун, заявив, что все лабы должны жить дружно 🥰
Прямо сейчас в X идут многочисленные перепалки по этому поводу, в том числе между сотрудниками OpenAI и Anthropic.
🍿
Компании платят авторам контента, чтобы те рассказывали об опасностях ИИ
Немецкая исследовательница Сабина Хоссенфельдер, которая занимается теоретической физикой и снимает научно-популярные видео на ютуб, рассказала (youtu.be/lPdmYMHrWKg), что к ней обратилась некая организация с предложением оплатить видео, предупреждающее об экзистенциальных рисках ИИ.
Предложение пришло вместе со сценарием, конкретными фразами и цитатами, которые нужно было включить. Хоссенфельдер отказалась. Название организации она не раскрыла, но упомянула, что похожие предложения получали и другие блогеры, при этом не только от этой конкретной компании.
Среди частых заказчиков подобного контента – Center for AI Safety и Future of Life Institute, у которых, кстати, есть общий крупный донор Open Philanthropy. В последние годы Open Philanthropy активно занимается продвижением безопасности ИИ.
Хоссенфельдер также рассказала, что деньги за лоббирование текут в научпоп и техжурналистику и с других сторон. Например, WIRED недавно писали о том, что маркетинговая фирма, связанная с организацией Build American AI предлагала тиктокерам до 5000 долларов за ролик, продвигающий антикитайские ИИ-тезисы. При этом – с инструкцией не отмечать и не раскрывать, кто платит.
Choose your fighter: реклама в ChatGPT / реклама того, что ИИ нас всех убьет
Нейрослоп достиг своего прайма
Официальный аккаунт Белого Дома в X опубликовал ЭТО
Краткое содержание новости выше из нашего чата
Читать полностью…
⚡️ Только что вышел DeepSeek-V4.1-Flash
Многие бенчмарки на уровне Opus 5 и Sol (обратите внимание на DeepSWE). Учитывая, что это модель Flash, самая маленькая из семейства, очень даже круто.
По поводу внутренностей:
– 552В MoE
– Новая асимметричная архитектура Causal Encoder–Decoder: 8В активных параметров на вход, 16В активных на выход
– Новые метода претрейна + более масштабный RL
Оптимизировали KV-кэш. Теперь он занимает еще меньше памяти в пересчете на токен (3 график).
Цены: $0.15/М input, $0.6/M output в непиковые часы. В пик – в два раза выше.
Веса
Статья
Исследовательница с помощью RL научила мозг мухи играть в beat saber
https://x.com/_lyraaaa_/status/2097527368919470162?s=46&t=pKf_FxsPGBd_YMIWTA8xgg
Использовалась полная цифровая модель мозга плодовой мухи, построенная по реальной карте нейронных связей насекомого: там около около 165 122 нейронов и более 50.4 млн синапсов. Эта модель управляет виртуальным телом мухи в физической симуляции. Про саму эту симуляцию мы рассказывали здесь: /channel/data_secrets/8834.
Так вот этот мозг мухи вооружили двумя световыми мечами и поставили покорять Beat Saber с помощью RL. Пока муха играет плохо и почти случайно (на видео, если что, воспроизводится просто оверфит под конкретную последовательность), но обучение продолжается.
Уровень пет-проектов, к которому стоит стремиться
КосмоХакатон 11–13 сентября.
Кейс на спутниковых данных 🚀
Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.
🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн
Детали и расписание: космохакатон.рф/blagoveshchensk
Реклама. АО Инновационные Интеграторы, ИНН 9704244539
Meta* запустила Muse – облачного персонального агента
Его презентовали как инструмент, который помогает достигать ежедневные цели. Агент может выстроить персональный план, скоординировать время и ресурсы, а затем самостоятельно продвигает работу дальше, открывая браузер, заполняя формы и тд. Может также вести переговоры от имени пользователя.
Агент работает на базе Muse Spark 1.3 в своей изолированной среде внутри инфраструктуры компании. Утверждается, что он никогда не видит настоящие пароли или платежные данные пользователя. Интересно, что кроме основного агента к процессу также постоянно подключен агент Sentinel, единственная функция которого – следить за безопасностью.
Александр Ван назвал Muse «магическим продуктом». В компании также заявляют, что агент «фактически не ограничен в том, что может делать» – единственный лимит это то, к скольким сервисам пользователь готов дать доступ.
Работает через отдельное приложение Muse или внутри WhatsApp.
https://introducing.muse.ai/
AI VK снова собрала лидов AI, ML и RecSys индустрии на встрече AI VK & Pro.
Здесь снова ушли от формата рабочей встречи и дали больше времени для неформального общения людям, которые развивают крупные ML-системы.
Команда подсветила главные итоги развития их Discovery-платформы и нейросетевых рекомендаций. А после короткой деловой части — мастер-класс и турнир по гольфу.
Немного фотографий с мероприятия.
Что известно про внутреннюю модель, которая решила миллениум:
– На данный момент ее обучение продолжается, то есть качество еще будет расти.
– Сказано, что она значительно превосходит Astra.
– Единственный график, относящийся к модели, из статьи: по оси X test-time compute в логарифмической шкале, ось Y – доля решенных открытых задач. Получается, что при том же бюджете модель решает примерно в 3 раза больше задач, чем Astra.
🗿 🗿 🗿
Кстати, OpenAI заявили, что не претендуют на тот самый миллион долларов за решение задачи от Clay Institute
Им хватит и того, что они заработают после этой новости на IPO 🗿
Если у Anthropic где-нибудь не припрятано доказательство гипотезы Римана, то press F
Этот день войдет в историю
https://openai.com/index/navier-stokes-solution/
https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
Яндекс запустил Алису AI для бизнеса — теперь ей можно поручать полноценные рабочие задачи
Например, ИИ-ассистент может разобрать переписку сотрудника в почте и собрать главное: какие вопросы требуют ответа, что уже решили и какие задачи остались. Или проанализировать таблицу, найти заметные изменения и объяснить, что происходит с показателями. Если информации для работы не хватает, ассистент может сам найти её в доступных рабочих данных.
Причём для этого не нужно разбираться в промптах или заранее описывать каждый шаг. Достаточно обычным языком объяснить, какой результат нужен, а дальше Алиса AI для бизнеса сама разбирается с задачей.
Получается довольно заметный сдвиг: ИИ в компании становится не ещё одним окном для генерации текста, а ассистентом, которому можно передавать часть реальной работы. И чем больше таких задач можно отдать ассистенту, тем важнее становится вопрос не «какую нейросеть выбрать», а какую работу ей вообще можно доверить.
Алиса AI для бизнеса уже доступна клиентам Яндекс 360. Для остальных компаний после регистрации в экосистеме виртуального офиса также будет доступен трёхмесячный пробный период.
Кажется, скоро в резюме появится новый пункт: «умею делегировать нейросети».
️️️️️️️️LLM может уверенно ответить по смыслу — и одновременно сломать интеграцию одним неверным полем в JSON. Для прикладной системы почти правильный ответ уже считается ошибкой.
🗓 23 сентября в 18:00 МСК на открытом уроке «Structured Outputs: как заставить LLM всегда возвращать то, что вам нужно» разберём, как задавать модели строгую структуру ответа и проверять результат.
Вы узнаете, как получать JSON, параметры функций и объекты в ожидаемом формате, снижать число ошибок и надёжнее связывать LLM с другими сервисами. Урок будет полезен разработчикам, аналитикам и инженерам, которые создают прикладные системы с LLM.
➡ Открытый урок проходит в преддверии старта курса «LLM-инженер». Зарегистрируйтесь, получите специальные условия на обучение и разберите подход, который помогает превратить ответ модели в данные, готовые для автоматической обработки: https://otus.pw/idUm/
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
OpenAI выложили блогпост о том, как агенты ускоряют рисерч в компании
Они заявляют, что достигли цели, которую ставили прошлой осенью, а именно: иметь к сентябрю 2026 года «автоматизированного исследователя-стажера», то есть систему, способную выполнять четко поставленные исследовательские задачи, включая те, что заняли бы у квалифицированного спеца несколько дней.
Кроме того, на момент середины августа в OpenAI:
– Медианный исследователь ежедневно тратит на агентов более $600 в день по API-ценам. У 90-го перцентиля уже больше $7000 токенов в день.
– На каждый рабочий день человека приходится примерно 3.1 «агенто-рабочих дня» (еще в июне суммарное время работы агентов было меньше, чем суммарные человеко-часы).
– Активно растет число экспериментов на одного активного экспериментатора и success rate агентов по нескольким разрядам сложности (сложность оценивается как время, которое задача заняла бы у человека, типа <1ч, 1-4ч, 4-8ч и т.д.)
Пока что больше половины задач на 4–8 часов требуют для успешного выполнения хотя бы одного вмешательства человека. Но следующая цель компании – уже уже полноценный автоматизированный AI-исследователь к марту 2028 года.
В посте OpenAI также потребовали, чтобы такая практика шеринга прогресса стала обязательной для всех компаний отрасли. По их словам, дело идет к полноценому рекурсивному самоулучшению (RSI), и общественность должна иметь возможность это отслеживать и обсуждать.
https://openai.com/index/research-acceleration-view-inside-openai/
GLM-5.3 появилась в российском облаке
MWS Cloud первой в России развернула GLM-5.3 в отечественном облаке. Модель доступна в MWS GPT Model Hub через OpenAI-совместимый API. Цена при этом останется на уровне GLM-5.2.
Всё работает внутри российского ИТ-контура: запросы и данные пользователей не покидают страну. Саму модель можно использовать для разработки ПО и агентских задач, например, для генерации и анализа кода, работы с репозиториями и многошаговой автоматизации.
GLM-5.3 успела показать себя в новых рейтингах. В задачах программирования она стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol.
Попробовать можно здесь