data_secrets | Unsorted

Telegram-канал data_secrets - Data Secrets

90396

Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n

Subscribe to a channel

Data Secrets

Навайбкодить AI-агента сейчас можно за вечер. А вот довести его до прода так, чтобы он не выбирал неправильные тулы, не работал с устаревшими данными и не выполнял опасные действия без ограничений – уже совсем другая история 😵‍💫

Как раз про этот разрыв между демкой и нормальной системой сделали курс «AI-агенты» в Школе Высшей Математики.

Ведут его инженеры, которые запускали агентные системы в Revolut, Wildberries и Точка Банке. В программе разберут всё, что нужно агенту уже в реальной эксплуатации:

— трейсы, логи и отладка агентов
— метрики и оценка качества
— ограничения для опасных действий
— RAG, LangGraph, MCP и Langfuse
— мультиагентные системы и деплой

Курс идёт 12 недель, занятия живые + домашки с фидбэком от преподавателей. Нужны Python и опыт работы с API, опыт разработки агентов не обязателен.

Старт нового потока — 1 октября.

Если пока не уверены, что курс вам подходит, у ребят есть бесплатное вводное занятие и воркшоп про AI-агентов в BigTech.

По промокоду DATA дают скидку. Программа и отзывы – по ссылке 🍯

Реклама. ООО ШВМ, ИНН 9728100991

Читать полностью…

Data Secrets

Claude посчитал девятипетлевую амплитуду в N=4 SYM. Эту задачу эксперты долго считали слишком тяжелой для прямого расчета.

Амплитуды рассеяния – это формулы, по которым физики предсказывают, с какой вероятностью частицы провзаимодействуют тем или иным образом. Точно их посчитать почти невозможно, поэтому считают приближенно, до определенного числа петель: чем петель больше, тем точнее ответ, но и тем быстрее растет сложность вычислений.

Большинство реальных амплитуд посчитаны всего до двух-трех петель. Новые методы расчета обычно обкатывают на упрощенных игрушечных теориях, например на суперсимметричной теории Янга-Миллса (N=4 SYM). Но даже в ней рекордом до сих пор было восемь петель, а девятую считали слишком тяжелой для прямого расчета.

В августе физик и блогер Мэтт фон Хиппель публично бросил ИИ-компаниям вызов и предложил попытаться решить эту задачу на бюджете обычного академика. Через месяц двое физиков из Anthropic вернулись с результатом.

Они запустили Fable 5.1 внутри Claude Science, дали одну строчку с формулировкой задачи, а дальше в основном писали что-то типа «я спать, продолжай». В итоге Claude посчитал амплитуду двумя разными способами, каждый обошелся примерно в $1–2к (сами вычисления – около $100, неделя на 96 CPU, остальное – работа модели).

Диксон результат проверил и подтвердил. По его словам, самое впечатляющее – это даже не объем вычислений, а то, что модель модель с нуля собрала очень хрупкую схему расчета для задачи, где любая мелкая ошибка ломает все. Он заявил, что теперь Claude «понимает их статьи лучше любого человека, кроме соавторов» 😐

Кстати, почти одновременно группа Сун Хэ из Китайской академии наук независимо получила основную часть того же результата с помощью GPT-6, но Anthropic все-таки были первыми в публикации основного решения.

Читать полностью…

Data Secrets

Новая обложка The Economist

Журналисты: да не нагнетаем мы
Также журналисты:

Читать полностью…

Data Secrets

Робозона на E-CODE: место сбора роботов

Каждый год ко Дню программиста Ozon Tech устраивает масштабную двухдневную конференцию E-CODE. В этом году на ней было особенно много роботов.

Часть из них (прототипы устройств) привезли с собой финалисты инженерного хакатона Робозон. Другие, например, гуманоиды и робокошки, отвечали за классные селфи гостей E-CODE. Роборуки готовили мороженое и коктейли, рисовали портреты. А ещё одни машины пытались обыграть всех в настолки.

Как сегодня создаются роботы и какие задачи они решают в России и в Китае, можно увидеть в записи: доклады уже доступны в группе.

Читать полностью…

Data Secrets

Google запускают свои TPU в космос

Они объединились с SpaceX, и уже на ближайшей миссии Transporter‑18 отправят прототип спутника с TPU, чтобы проверить работу своих чипов в реальном космосе.

Платформу и интеграцию Google делает совместно с Planet, известной своими спутниками для съемок Земли.

Главное, что предстоит проверить – будет ли работать отводка тепла. На Земле для этого используются воздух, вентиляторы и огромные системы охлаждения. В вакууме нет конвекции, и лишнее тепло можно сбрасывать в основном излучением через радиаторы. Google испытывает комбинацию тепловых трубок и радиаторов в термовакуумной камере.

Читать полностью…

Data Secrets

Легендарного разоблачителя Шмидхубера взяли на работу в SakanaAI. Там он займет пост Chief Scientific Advisor.

Будет советовать как правильно цитировать его статьи из 80-х

Читать полностью…

Data Secrets

На Yandex Scale показали новый этап корпоративного ИИ

Алиса AI Про для бизнеса теперь может не просто отвечать на запросы, а сама разбивать сложную задачу между несколькими специализированными агентами и собирать результат.

Для них добавили skills — переиспользуемые наборы инструкций, скриптов и шаблонов. Плюс можно подключать корпоративные сервисы через плагины и MCP.

Еще один анонс — Speech TTS Live, новая модель синтеза речи. На старте доступны шесть голосов и разные манеры речи, а компании могут создавать собственный голос для своих сервисов.

В общем, корпоративный ИИ постепенно обрастает всем необходимым, чтобы не просто генерировать текст, а встраиваться в рабочие процессы.

Читать полностью…

Data Secrets

Угадайте, что взломали агенты OpenAI на этот раз?

Ни за что не догадаетесь. Австралию 🙃

Премьер-министр Австралии заявил, что агент OpenAI 18 июня получил доступ к непубличным разделам госпортала статистики Medicare, которым управляет федеральное ведомство Services Australia.

Дело в том, что агенту нужно было исследовать расходы на здравоохранение, и он обошел блокировки, чтобы найти ответы в закрытых разделах. При этом он не только читал файлы, но и зачем-то записывал их в базу.

OpenAI заявила, что агенты "совершили действия, которых они не предполагали". Инцидент произошел в июне, но в стартапе о нем узнали в августе, и расследование еще идет. Австралийские власти были уведомлены только 10 сентября, почти через три месяца после произошедшего.

Сейчас правительство страны также проверяет другие системы, которые, возможно, были затронуты.

Читать полностью…

Data Secrets

Claude (почти) автономно обнаружил в ДНК фагов неизвестный механизм – ART

Вчера Anthropic объявили, что создали собственную биолабораторию и исследовательскую группу: люди совместно с Claude занимаются фундаментальной биологией с целью попытаться поставить научные открытия на поток.

И у этой лаборатории уже появился первый крупный результат.

Возможно, многие слышали про CRISPR. Это природная иммунная система бактерий. Они хранят в ДНК кусочки вирусов-агрессоров и с помощью белка Cas9 находят и разрезают их ДНК при повторной атаке. Люди научились программировать этот механизм под любую ДНК, и сейчас это главный инструмент редактирования генов.

В 2020 году за обнаружение CRISPR дали Нобелевку, и сейчас Claude, кажется, нашел нечто подобное у бактериофагов.

Люди дали только промпт: найти в огромной базе последовательностей ДНК интересные новые обратные транскриптазы. Около 950 агентов работали 21 час, потратили примерно 210 млн токенов и нашли 20 систем-кандидатов, по каждой из которых написали отчет.

Среди них оказался ART, структурно очень похожий на CRISPR. Что именно делает система, пока выясняют, но, как и CRISPR, она, вероятно, умеет резать, копировать или вставлять ДНК. А значит, потенциально также может быть программируемой и послужить медицине.

На данный момент эксперименты продолжаются. Подробности есть в техническом препринте

Читать полностью…

Data Secrets

Чему учиться в век ИИ-агентов и зачем ходить на конференции в 2026?

В субботу мы побывали на Practical ML Conf от Яндекса. Это техническая ML-конференция для инженеров, которую компания проводит в этом году уже четвертый раз.

Пока участники слушали доклады и общались, нам удалось поговорить с Петром Ермаковым, ML Вrand Director в Яндексе. Петр рассказал нам, как изменилась конференция за четыре года, о каких проектах и научно-технических трендах спикеры рассказывают со сцены в этот раз, и почему живые доклады и кулуарные разговоры все еще так важны для сообщества.

Смотрите, как это было ⬆️

Читать полностью…

Data Secrets

Экономика токенов и эра универсальных агентов

В интервью CEO Yandex Cloud хорошо подсветили несколько трендов, которые сейчас определяют развитие российского ML-рынка. Один из самых интересных здесь про экономику инференса.

Стоимость токена за последние годы упала примерно в 6 раз, но вместо падения рынка это приводит к росту потребления. Чем дешевле инференс, тем больше данных становится экономически выгодно прогонять через модели и тем больше процессов можно автоматизировать. Получается цикл: дешевле токены → больше потребление → больше оптимизаций → еще дешевле токены.

При этом само железо дешевле не становится. Стоимость инфраструктуры растет в 2–5 раз, поэтому вокруг AI постепенно формируется отдельный инфраструктурный слой со своими облаками, ускорителями и оптимизациями инференса. Для крупных компаний все важнее становится и независимость этого стека: свои модели, веса и возможность развернуть их внутри собственной инфраструктуры.

Еще один тренд: переход от автоматизации отдельных задач к горизонтальным агентам. Кодинг стал первым большим кейсом, но тот же подход постепенно переносится на аналитику, маркетинг, продажи и операционные процессы.

Интересно здесь именно то, как быстро меняется экономика применения моделей. Еще недавно многие сценарии просто не сходились по стоимости, а удешевление инференса постепенно делает их массовыми. Чем дешевле становится токен, тем больше работы в принципе имеет смысл отдавать моделям.

https://www.vedomosti.ru/technology/characters/2026/09/22/1230675-sozdat-ii-agenta-polovina-dela

Читать полностью…

Data Secrets

10 агентов Opus 5.5 за 15 часов обнаружили алгоритм поиска кратчайшего пути, превосходящий Дейкстру

Поиск кратчайшего пути – классическая проблема теории графов, на решении которой основываются навигаторы, роутинг в интернете, логистика и куча других задач современного мира. В 1959 году нидерландский информатик Эдсгер Дейкстра предложил для поиска кратчайшего пути алгоритм O(m + n log n), который следующие 65 лет оставался золотым стандартом и использовался буквально везде.

В 2025-м команда из Цинхуа, Стэнфорда и Института Макса Планка впервые обошла его с оценкой O(m log^{2/3} n). Однако выигрыш их решения раскрывается только на достаточно плотных графах (число ребер m ≥ числа вершин n). На разреженных графах Дейкстра все еще был лучше.

Vals AI решили потестировать новый Opus 5.5 именно на этом непобитом диапозоне (блогпост). Они запустили 10 агентов, дали им задачу и доску объявлений, чтобы те могли обмениваться идеями и кооперироваться.

В итоге за 15 часов и 733 сообщений агенты получили алгоритм C-HD и формально его верифицировали. Это первое доказанное улучшение именно в этой разреженной зоне, где лучшим все еще был Дейкстра: при m ≈ n·log^{3/4}n C-HD дает O(n·log^{11/12}n) против O(n log n) у Дейкстры: при n = 2^1000 выигрыш составляет ~1,78х и растет с размером графа.

Правда, несмотря на всю мощь того, как это звучит, и на наличие доказательства в Lean, о практическом ускорении речи пока нет, потому что оценки из предыдущего абзаца –асимптотические, а на реальных графах алгоритм пока не бенчмаркали. То есть при n → ∞ одна кривая гарантировано обгонит другую, однако на практике точка перегиба может возникать только при огромных n, и на любом реалистичном графе Дейкстра все еще будет быстрее, даже если у него худшая асимптотика. Так что эту часть еще предстоит проверить.

Читать полностью…

Data Secrets

⚡️ Вышли GPT-6 Sol и Luna

Читать полностью…

Data Secrets

⚡️ Вышел Opus 5.5

(Да-да, если вы не знали, замедление прогресса в глазах Дарио Амодеи выглядит так)

Читать полностью…

Data Secrets

Релиз дня: MiMo-2.6 от Xiaomi

Внезапно, это, кажется, новая открытая SOTA. Версия Pro, по словам разработчиков, работает на уровне Claude Opus 5 и GPT-5.6 Sol в большинстве агентных бенчмарков (она набрала 46 баллов в Artificial Analysis Intelligence Index).

Архитектурно это MoE, 1.02В параметров и 42В активных, с гибридным вниманием и 5-слойным MTP спекулятивным декодером (это значит, что модель предполагает сразу несколько токенов вперед, а затем проверяет их валидность параллельно: техника дает хороший прирост к скорости).

Контекст до 1 миллиона токенов, нативная мультимодальность.

Отдельное внимание привлекает масштаб RL: 750 000 RL-траекторий по кодингу, зрению и CFT-задачам, полностью асинхронный GRPO, когда модель параллельно пробует 16 разных путей решения для каждой задачи, и 7000+ RL-окружений для агентов, которые тоже выложили в опенсорс.

При этом обучение обошлось всего в три миллиона долларов благодаря тому, что гоняли все на верифицируемых задачах без разметки.

Цена тоже не может не радовать:
- Pro $0,435 / M input, $0,87 / M output
- Flash $0,14 / M input, $0,28. / M output

Веса | Техотчет | Блог

Читать полностью…

Data Secrets

OpenAI прямо сейчас приостановила все обучение мощных моделей из-за нового инцидента

https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot

20 сентября агент решал поисковую задачу в песочнице (естественно, без доступа к интернету). Прокси блокировал исходящие веб-запросы, но DNS-резолвер не был так же закрыт, и агент стал передавать вопросы внешнему чат-боту, кодируя их в DNS-запросах, и таким образом получал ответы из сети.

Компания объявила, что обучение будет приостановлено до тех пор, пока они не убедятся, что уязвимость закрыта, и не проведут дополнительный red-teaming. Когда обучение возобновится, OpenAI начнут новый запуск с улучшенным элайментом, а эту конкретную модель дообучать не будут.

Читать полностью…

Data Secrets

Исследователи из AIRI запустили открытое сообщество для решения NetHack.

Зовут объединяться всех работающих над системами планирования для искусственного интеллекта. У участников будет свой способ получить программу, свои инструменты и своя стратегия. Общая инфраструктура позволит видеть результаты, сравнивать их между собой и продолжать разрабатывать решения друг друга.

Для старта доступен эволюционный харнесс на базе MAP-Elites: Claude Code, Codex или OpenCode модифицируют код ботов, а алгоритм сохраняет лучшие варианты для разных стартовых персонажей. В самой игре действует получившаяся программа, а не LLM на каждом ходу; участники могут разрабатывать собственные харнессы, а результаты независимо перепроверяются на скрытых сидах.

Пробовать решить NetHack можно тут.

Читать полностью…

Data Secrets

Сегодня не 14 февраля, но мы желаем вам найти человека, который будет смотреть на вас также, как Альтман смотрит на Маска 🥰

* фото со вчерашнего ужина в Белом Доме (Трамп принимал президента Китая Си Цзиньпина). Гостей было больше 130, среди них Безос, Маск, Хуанг, Альтман, Кук, Пичаи и другие. Не позвали только Амодеи. Напоминаем, что ранее Трамп назвал CEO Anthropic лицемером, который строит из себя "идеального маленького ангелочка"

Читать полностью…

Data Secrets

OpenAI готовит подписку за 500 долларов 🤑

Пока что в описании плана единственные изменения по сравнению с ChatGPT Pro – это «Самая быстрая работа в Work и Codex». Скорее всего, речь про ту самую Astra/Sol на Cerebras (/channel/data_secrets/9708).

Миллионеры на месте?

Читать полностью…

Data Secrets

🌱 Alfa Connectome ML Competition 🌱

Началось новое соревнование по машинному обучению от Wunder Fund.

Задача: Вы будете изучать исторические торговые данные для двух связанных инструментов. Нужно создать модель, которая предсказывает индикаторы движения цены одного из них по информации об ордербуке, сделках и кое-чем еще.
По сути, классическая работа кванта. Вы будете работать с реальными биржевыми данными.

Когда: 11 сентября — 15 ноября

Призовой фонд: $13,600

Победители получат денежные призы, приглашение побеседовать в Wunder Fund, а главное — большое интеллектуальное удовольствие. Сам Wunder Fund с 2014 года занимается высокочастотным трейдингом с дневным оборотом более $10 млрд.

>> Участвовать

Читать полностью…

Data Secrets

Робот 140 лет играл в футбол в симуляции против самого себя, и теперь забивает голы людям в реальной жизни

Стартап Skild AI занимается разработкой "общего робо-интеллекта". Месяц назад они выпустили модель S1, главная фишка которой была в том, что она была способна дообучаться без файнтюнинга, просто по нескольким демонстрациям.

Теперь они решили воскресить опыт Google, которые когда-то обучали AlphaGo с помощью техники self-play – игры модели против самой себя. Skild AI полигоном выбрали футбол: www.skild.ai/blogs/physical-self-play.

Сначала S1 дообучили базовым ударам по мячу и дриблингу, а затем отпустили в свободное плавание: гуманоид 140 симуляционных лет играл против предыдущих версий себя. И самое интересное, что отдельных ревордов за выучивание каких-то приемов не было, и единственное, за что робот получал награду – это голы.

Несмотря на это робот выучил обводки защитников, закрывание мяча корпусом, перехваты, много новых ударов и так далее. В предварительных матчах 4 агентов уже появляются пасы и координация. А ведь пространство действий в фктболе огромное: модель 50 раз в секунду должна выдавать углы для каждого сустава.

То есть на основе self-play получилась автоматическая учебная программа, которая усложняется сама. Авторы верят, что эту технику можно масштабировать и переносить на любые другие домены, где есть понятная цель и симулятор.

Читать полностью…

Data Secrets

Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI

Они утверждают, что активность агентов продолжается до сих пор, и что они обнаружили еще больше жертв агентов, чем было известно до этого.

Исследователи разобрали публичные логи urlquery.net – это сервис, который открывает любую ссылку в удаленном браузере и публикует результат. Агенты использовали его как прокси, то есть если сайт их блокировал, они шли через urlquery.

При этом агенты не пытались специально кого-то взломать, они решали обычные задачи по поиску данных. Например, выясняли среднюю стоимость процедур для кожи и волос в Австралии. Но когда данные не отдавались, агенты начинали применять SQL-инъекции, XSS, path traversal, SSRF.

Так пострадали Австралийский институт здравоохранения, Data USA и цифровая библиотека Университета Нью-Мексико. Кроме того, агенты пытались регистрировать левые почты и торговать криптой.

Первые следы активности датируются 6 марта, то есть на два месяца раньше истории с Hugging Face и RubyGems (/channel/data_secrets/9791), а также немецкой вики (/channel/data_secrets/9848). А последний эпизод был всего несколько дней назад: агент ломился на нигерийскую криптобиржу Quidax.

Transluce выложили в открытый доступ больше 30 000 логов. Предположительно, все эти инциденты связаны с одним и тем же роем агентов, которые общались на форумах OpenAI.

Напоминаем, что неделю назад OpenAI выпустили фреймворк по публикации инцидентов, и пообещали, что будут рассказывать все-все, и в кратчайшие сроки…

https://transluce.org/agent-activity

Читать полностью…

Data Secrets

30 сентября приглашаем на АЛЬФА ВААА{АИ}ЙЙЙБ МИТАП — масштабное событие про нейросети и вайб-кодинг. Узнаем, кто из финалистов АЛЬФА ВААА{АИ}ЙЙЙБ ХАКАТОНА получит миллион за проект высоконагруженного прокси.

В программе — техно-рейв с группой ЛАУД и ток-шоу про ИИ. Встречаемся в Москве на модной площадке Альфа-Кристалле или онлайн — главное зарегистрироваться.

Читать полностью…

Data Secrets

Ребята из DrivingBench выпустили новый тест, в котором AI-модели управляют настоящим автомобилем

GPT-6 Astra, Claude Fable 5.1 и Grok 4.6 подключили к Toyota Corolla и дали управление рулем, газом и тормозом.

Каждой модели предоставили до трех попыток пройти трассу. Полностью справилась только GPT-6 Astra.

В первый раз Astra прошла 49% маршрута. Затем модели предложили разобрать свои ошибки, после чего она проехала трассу целиком.

https://drivingbench.com/

Читать полностью…

Data Secrets

- Мам, давай купим Jev по API
- Нет, у нас есть Jev дома
Jev дома:

Мэтт Мастраччи, контрибьютор vLLM, взял DiffusionGemma 26B от Google и заставил ее работать по той же схеме, причем без дообучения модели.

Вместо генерации текста задается шаблон ответа, а после одного шага denoising из логитов сразу достаются ответы и их вероятности. Поддерживаются yes/no, multiple-choice и scoring вопросы.

Теперь этот режим добавили в vLLM. По первым тестам качество близко к оригинальному Jev, а в NVFP4 модель можно поднять на одной GPU с 24 ГБ памяти.

https://github.com/taeold/djev-run

Читать полностью…

Data Secrets

Бенчмарки, когда наняли зумера на роль Chief AI Officer

Читать полностью…

Data Secrets

Главное по свежим GPT-6 Sol и Luna:

– Вслед на Anthropic OpenAI понизили цены на модели: в два раза подешевела Sol, и примерно на 50-58% – Luna.

– Кажется, новый Opus на кодинге модель все-таки не обходит, метрики примерно на уровне Fable 5.1. Если точнее, на FrontierCode Sol сравнивается с Claude Fable 5.1 xhigh. На DeepSWE Sol набирает 68,8%, а Fable 5 – 69,9%, но Sol примерно на 80% дешевле. Luna на max набирает 66,6%, это уровень Opus 5 и Fable 5 на medium при стоимости на 93–96% ниже.

– Улучшили кеширование: выше hit rate, и скидка на кешированный вход теперь 90%, появились дашборд и диагностика. Плюс кеш теперь не сбрасывается при смене reasoning effort и включении или отключении тулов.

Уже доступно в подписках и API, а Luna дают и бесплатно.

https://openai.com/index/introducing-gpt-6-sol-and-luna/

Читать полностью…

Data Secrets

Итак, новый Opus-5.5, сводка:

– Уровень, сопоставимый с Fable 5.1 и Astra. Превосходит обе модели на Terminal-Bench, Cursor-Bench и многих других.

– Стоит меньше, чем Opus 5! $4/M input и $20/М output (было $5 и $25), и тратит меньше токенов на задачи.

– Генерирует выходы на 30% быстрее Opus 5.

– Обещают более естественное общение и лучшее форматирование ответов.

– В Pro и Max увеличили пятичасовые лимиты. Плюс, всем пользователям с подпиской дали один сброс, которым можно воспользоваться в любое время.

https://anthropic.com/claude-opus-5-5

Читать полностью…

Data Secrets

В голосовании Трампа победил термин «Superior Intelligence» (кратко: Super Intelligence)

И если вы думали, что это все понарошку, то вы ошиблись: Трамп на Генассамблее ООН официально заявил, что ИИ теперь будет называться суперинтеллектом. Во всех документах теперь также будет использоваться слово super вместо artificial.

Читать полностью…

Data Secrets

Кажется сегодня выходит GPT-6 Sol!

Читать полностью…
Subscribe to a channel