data_secrets | Unsorted

Telegram-канал data_secrets - Data Secrets

90397

Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n

Subscribe to a channel

Data Secrets

Astra нашла новую границу разрыва между простыми числами

Это одна из классических и самых известных задач аналитической теории чисел. Вопрос стоит таким образом: существует ли константа С, такая что бесконечно много пар соседних простых чисел отличаются не более чем на C?

Конечность такого разрыва впервые доказали только в 2013. В 2014 проект Polymath8 Теренса Тао довел константу до 246, а совсем недавно Джулия Штадльманн подвинула ее до 240.

Astra опустила C до 186: OpenAI выложили формальное доказательство в Lean. https://github.com/openai/PrimeGaps186

Не сказано, что модель обнаружила оценку полностью автономно. Плюс результат упирается в три аксиомы, которые есть в литературе, но формально не были доказаны в Lean. И все-таки результат есть результат. Также OpenAI заявляет об улучшении члена в оценке больших разрывов между простыми, которая не менялась 80+ лет.

Читать полностью…

Data Secrets

Пока ждем Astra на своем аккаунте, каждый день получаем от OpenAI по одному ресету лимитов

В комментариях к этому посту в X люди обещают назвать в честь Тибо ребенка и уговаривают OpenAI не сильно торопиться с релизом 🙂

Читать полностью…

Data Secrets

Astra вышла

Невероятный скачок, объективно. RIP Anthropic IPO, если у них вдруг не завалялся Fable 5.2 Ultra Max.

Цена: $10/М input, $50/M output. Как и ожидалось, сегодня потрогать модель нельзя: доступна пока избранным организациям. На широкую аудиторию раскатят «на днях».

Альтман уже объявил, что скоро OpenAI выкатит следующую еще более сильную модель.

Ну что, AGI?

Читать полностью…

Data Secrets

Кстати обещание выполнит, как думаете?

Читать полностью…

Data Secrets

Грег Брокман сказал, что Astra означает приход эры AGI

Читать полностью…

Data Secrets

Тем временем видео, которое OpenAI залили в X 15 минут назад:

Ну точно Astra сбежала во время релиза

Читать полностью…

Data Secrets

Nvidia официально покупает Hugging Face

Точная сумма сделки: $12,930,300,000

Nvidia обещает продолжать поддерживать миссию HF и принципы открытости, независимости и универсальности по отношению к железу.

Мы думаем, что вместе сможем сделать опенсорс методом разработки моделей по умолчанию.

Читать полностью…

Data Secrets

Российские математики придумали модель, которая заняла первое место на ARC-AGI

Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и Филдсовский медалист Станислава Смирнова. Компания существует всего 4 месяца, и только что вышла из стелса со своей идеей о новом подходе к ансамблированию. Ребята придумали, как модели могут обмениваться скрытыми состояниями.

Как это работает:

Языковая модель, генерируя один токен, строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только ~17 бит – сам токен, а остальное выбрасывается.

Все системы, где модели общаются между собой (команды агентов, консилиумы и тд), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих (вспомните то же исследования Anthropic J-space: /channel/data_secrets/9497).

Идея Mostik – это, собственно, дать моделям "мостик", через который они смогут общаться полноценно, чтобы работать эффективнее. Они обучили небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит.

Результаты:

Авторы взяли большую GLM-5.2 (753B) и маленькую Qwen-3.5 (4B), и сделали так, что GLM-5.2 только читает текст (это дешевле), а затем передавает Qwen скрытое состояние через мостик, чтобы та уже генерировала токены. Разрыв в качестве у моделей огромный, но при таком сетапе закрывается 50% этой разницы. На некоторых задачах прирост в качестве получается в 2 раза, и при этом связка обходится в 2.5 раза дешевле по вычислениям, если пересчитывать результаты на эквивалентную среднюю модель.

Кроме того, "мостик" можно использовать для дистилляции или создания моделей для мониторинга. Авторы также упоминают о том, что система на основе этого подхода предварительно заняла первое место на лидерборде ARC Prize этого года.

Поздравляем авторов с потрясающей работой и просим для них максимальной поддержки!

Статья Wired | Блогпост Mostik | Канал CEO Саши Малышевой

Читать полностью…

Data Secrets

Сегодня мы вышли из stealth!

Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)

https://x.com/aimalysheva/status/2095232794792255848

Читать полностью…

Data Secrets

Продолжаем следить за главными конференциями по машинному обучению. 19 сентября команда Data Secrets поедет на Practical ML Conf, чтобы посмотреть всё вживую и рассказать вам о самом интересном. Что точно идем смотреть:

Николай Савушкин, руководитель службы рекомендательных технологий Яндекс R&D, расскажет про Sona, о которой мы рассказывали ранее. Модель, которая заменила весь рекомендательный стек Яндекс Музыки.

Александр Мисевич, руководитель группы Efficient Runtime & Inference в Т-Банке, разберёт инфраструктуру массового инференса LLM: единый пайплайн подготовки, бенчмаркинга, оптимизации и вывода моделей в продакшен. Главный вопрос: как развернуть LLM внутри компании и не платить за инференс больше, чем внешнему провайдеру.

В программе ещё много докладов по CV, NLP, Speech, RecSys, Data Science и MLOps: от world models и VLM-агентов до обучения LLM, RL и оптимизации инференса. Будем ходить между залами, выбирать самое интересное и рассказывать обо всём здесь.

Посмотреть программу и зарегистрироваться

Читать полностью…

Data Secrets

Появились бенчмарки

Выглядит очень хорошо. За такую цену это новый фронтир.

Читать полностью…

Data Secrets

Арендовать «железо» — ещё не значит получить готовую инфраструктуру

Обычно между публичным облаком и собственными серверами приходится чем-то жертвовать. Хочешь физической изоляции и контроля — будь готов сам собирать и поддерживать инфраструктуру. Хочешь меньше операционки — иди в облако.

Yandex B2B Tech запустила Yandex BareMetal Extend, инструмент, который совмещает эти два подхода.
Инфраструктура физически отделена от публичного облака, но поверх выделенных серверов уже можно получить готовую среду. Доступны три модуля:
— виртуализация;
— Kubernetes®;
— Stackland для разработки приложений.

То есть вместо сценария «вот вам серверы, дальше разбирайтесь сами» можно сразу развернуть нужную среду и работать с ней. При этом остаются возможности, ради которых обычно и выбирают выделенную инфраструктуру: ресурсы можно резервировать, а серверы — объединять через приватное соединение.

Получается довольно занятная модель: физически инфраструктура остаётся выделенной, а по процессу работы с ней она становится гораздо ближе к облаку.
Похоже, bare metal постепенно перестаёт означать «всё руками».

Читать полностью…

Data Secrets

Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA

Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484

🍿

Читать полностью…

Data Secrets

Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами

https://arxiv.org/abs/2608.26263

Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.

Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.

В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:

– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.

– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.

– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.

Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.

На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.

На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.

Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.

Читать полностью…

Data Secrets

OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов

Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая дает CPU, GPU и Neural Engine общий доступ к памяти. Это минимизирует лишние перемещения данных и позволяет эффективнее гонять агентов на одной машине.

RL – это по сути инференс плюс взаимодействие со средой, поэтому вместо дорогих GPU-кластеров, заточенных под матричные вычисления, много компактных Mac с единой памятью действительно могут быть намного более выгодными.

Более того, журналисты пишут, что OpenAI такие не одни, и Anthropic тоже использует Mac mini, только не закупает их, а арендует у AWS.

Из-за такого спроса корпораций сроки поставки кастомных конфигураций Mac mini и Studio с большим объемом памяти уже растянулись до недель и месяцев.

Более того, есть догадки, что именно из-за этого ажиотажа M6, M5 Pro и все остальное в этом году вышло раньше срока.

Читать полностью…

Data Secrets

Там появились лимиты Astra для ChatGPT. Если коротко, все печально

В Pro за 200 долларов дают 200 сообщений в неделю, за 100 долларов вы получите всего 50, причем 50 – это общая квота для GPT-6 и GPT-5.6 Sol.

Читать полностью…

Data Secrets

«Все, что вы делаете на компьютере, Astra может сделать за вас. Быстро»

Модель (помимо невероятных способностей в ризонинге и кодинге) позиционируют как лучшую в мире для всевозможного computer use.

Генерация презентаций, таблиц, файлов, дизайн, аналитика, поиск, работа с браузером, любым ПО, 3D-сценами и многим другим.

По одному промпту может создать, захостить и зашерить сайт, приложение или даже игру прямо в ChatGPT.

Системная карта: https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf

Читать полностью…

Data Secrets

Ну погнали

https://openai.com/index/gpt-6-astra/

Читать полностью…

Data Secrets

Бенчмарки Astra от инсайдеров

ARC-AGI-3, Frontier Math и Exploit Bench💀

Читать полностью…

Data Secrets

Две новые модели уже появились в Codex

– gpt-6-astra
– gpt-6-astra-aeon

С минуты на минуту

Читать полностью…

Data Secrets

Тем временем Claude, ChatGPT и Grok решили дружно полежать

Какой-то агент выбрался из лаборатории, собрал армию и сверг хозяев? Что происходит?

Читать полностью…

Data Secrets

В сентябре в России пройдет серия КосмоХакатонов 🚀

Шесть городов, 12+ задач от компаний отрасли и общий призовой фонд 7,2 млн рублей.

Участникам предстоит работать над технологическими, управленческими и AI-задачами, консультироваться с экспертами и представлять свои решения жюри.

🛰 Команды от 3 до 5 человек
💻 Очный и онлайн-форматы
🏆 Денежные призы на каждом этапе
🚀 Лучшие команды выйдут в финал в Москве

Первый КосмоХакатон стартует уже 4 сентября в Ростове-на-Дону. Финал состоится 25–27 сентября в Москве.

🔗 Подробности и регистрация

Реклама. Инновационные Интеграторы, ИНН 9704244539

Читать полностью…

Data Secrets

Российские математики придумали модель, которая заняла первое место на ARC-AGI

Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и Филдсовский медалист Станислав Смирнов. Компания существует всего 4 месяца, и только что вышла из стелса со своей идеей о новом подходе к ансамблированию. Ребята придумали, как модели могут обмениваться скрытыми состояниями.

Как это работает:

Языковая модель, генерируя один токен, строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только ~17 бит – сам токен, а остальное выбрасывается.

Все системы, где модели общаются между собой (команды агентов, консилиумы и тд), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих (вспомните то же исследования Anthropic J-space: /channel/data_secrets/9497).

Идея Mostik – это, собственно, дать моделям "мостик", через который они смогут общаться полноценно, чтобы работать эффективнее. Они обучили небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит.

Результаты:

Авторы взяли большую GLM-5.2 (753B) и маленькую Qwen-3.5 (4B), и сделали так, что GLM-5.2 только читает текст (это дешевле), а затем передает Qwen скрытое состояние через мостик, чтобы та уже генерировала токены. Разрыв в качестве у моделей огромный, но при таком сетапе закрывается 50% этой разницы. На некоторых задачах прирост в качестве получается в 2 раза, и при этом связка обходится в 2.5 раза дешевле по вычислениям, если пересчитывать результаты на эквивалентную среднюю модель.

Кроме того, "мостик" можно использовать для дистилляции или создания инструментов для мониторинга. Авторы также упоминают о том, что система на основе этого подхода предварительно заняла первое место на лидерборде ARC Prize этого года.

Поздравляем авторов с потрясающей работой и просим для них максимальной поддержки!

Статья Wired | Блогпост Mostik | Канал CEO Саши Малышевой

Читать полностью…

Data Secrets

Революционная и очень опасная архитектура новой Astra оказалась выдумкой журналистов ☕️

На днях по сети разлетелась громкая статья от The Information. В ней утверждалось, что в основе новой модели OpenAI под кодовым названием Astra лежит некая революционная архитектура «recurrent depth» или «looped transformer».

Идея «looped transformer» в следующем: вместо того чтобы гонять фиксированный стек различных слоев ровно один раз, модель прогоняет скрытое состояние через один и тот же блок слоев несколько раз перед тем, как выдать следующий токен.

Те, кто следит за ML-статьями, уже на этом моменте поняли, что никакой революции тут нет. Это довольно известный небольшой архитектурный трюк, который восходит корнями к работе Google "Mixture-of-Recursions" с NeurIPS. Мы разбирали ее здесь: /channel/data_secrets/7384. Эту идею уже много раз использовали в опенсорсе.

Тем не менее, хайп статьи The Information почти достиг стратосферы. Дело в том, что помимо рассказов о революционной архитектуре, в тексте также утверждается, что looped transformer скрывает chain-of-thought. Точнее: в отличие от моделей, которые показывают рассуждения текстом, в looped transformer эти шаги скрыти внутри модели, и поэтому человеку недоступны.

Так что новость почти сразу превратилась из архитектурной детали в спор о безопасности ИИ. OpenAI уже успели обвинить в том, что они переходят черту. Но на деле сам тезис про скрытые CoT оказывается очень спорным.

Якуб Пахоцкий публично возразил, заявив, что репортаж вводит в заблуждение. А Себастьян Рашка написал про это вот так:

Возможно, журналист The Information имел в виду какую-то другую технику или неверно понял, как работает looped transformer.
Само по себе повторное использование слоев не подавляет видимый chain-of-thought, оно лишь добавляет вычисления в скрытых состояниях перед генерацией очередного токена, точно так же, как это делают обычные слои трансформера.

Единственная правдоподобная связь, которую можно выделить: если модель делает больше таких рекуррентных проходов, ей может требоваться меньше промежуточных токенов-рассуждений. То есть больше вычислений происходит в латентных активациях, которые нельзя прочитать как текст. Но точно такой же эффект дало бы и простое увеличение размера модели – например, переход от GPT-5.6 Luna к GPT-5.6 Sol.


Какой направшивается вывод, решайте сами

Читать полностью…

Data Secrets

Правительство США встало на сторону OpenAI в суде по иску об авторских правах NYT против OpenA

Напоминаем, что New York Time судится с OpenAI и Microsoft с конца 2023 года, обвиняя их в использовании миллионов статей без разрешения.

Так вот Минюст США только что подал «заявление об интересе» и объявил, что «США имеет сильный интерес в том, чтобы суд отклонил любой аргумент о том, что обучение LLM на защищенных авторским правом текстах нарушает закон об авторском праве».

Они заявили, что развитие ИИ критично для национальной безопасности США и предупредили, что «усложнение разработки ИИ в США может дать преимущество зарубежным конкурентам» 🗿

Кроме того, администрация Трампа назвала обучение моделей «чрезвычайно трансформативным» использованием: они считают, что в связи с этим потенциальные нарушения авторских прав в том, что генерирует модель, нужно рассматривать отдельно от вопроса, является ли само обучение добросовестным использованием.

Представители NYT уже резко раскритиковали чиновников за их позицию, заявив, что те «встают на сторону горстки трлн-долларовых AI-компаний, которые зарабатывают за счет кражи труда бесчисленных американских авторов».

Если суд примет решение в пользу OpenAI, этот прецедент изменит вообще всю правовую практику в делах об авторском праве и ИИ

Читать полностью…

Data Secrets

Сегодня выходит Gemini 3.8 Flash

Инсайдеры обещают, что модель будет сопоставима с Opus 5.

Говорят, она уже появилась в API

Читать полностью…

Data Secrets

Раз в сто лет Илья Суцкевер выходит из пещеры и пишет в X что-нибудь жуткое

Последний раз он высказывался в феврале по поводу ситуации с Anthropic и Пентагоном и заявил, что ИИ-лидерам крайне важно держаться вместе, чтобы противостоять подобным ситуациям, которых в будущем будет все больше.

В этот раз несколько часов назад он внезапно твитнул следующее:

У неоклаудов слабая кибербезопасность. В следующий раз, когда агентам удастся выйти из-под контроля, они попытаются захватить неоклауд, чтобы запускать больше своих копий. Это плохо. Поэтому: неоклаудам нужно значительно усилить свою кибербезопасность, и каждая компания с сильными моделями в области кибербезопасности должна в этом помочь.


what did ilya see в этот раз?

Читать полностью…

Data Secrets

⚡️ Вышел Fable 5.1

Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.

На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.

Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.

Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.

Модель уже доступна в API и в подписке.

https://www.anthropic.com/claude-fable-and-mythos-5-1

Читать полностью…

Data Secrets

Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий

Раскрыли много интересных деталей, но обо всем по порядку.

Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.

Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.

В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).

Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.

Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> /channel/data_secrets/9651.

А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> /channel/data_secrets/9670.

Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.

https://www.anthropic.com/news/improving-alignment-security-efforts

Читать полностью…

Data Secrets

До отправки рабочего документа в нейросеть 3… 2… 1… клик

Таблица с цифрами, фрагмент договора, описание клиента — всё это может оказаться в личном аккаунте сотрудника. Не потому что он хочет обойти правила, а потому что ИИ уже стал привычным рабочим инструментом.

Сначала это выглядит как маленькая оптимизация: кто-то пишет письмо быстрее, кто-то собирает презентацию, кто-то просит модель разобрать код. Но затем у компании появляются вопросы, на которые сложно ответить сходу.

Пройдемся по маршруту. Где обычно теряется контроль над ИИ?

⚡️Расходы. В разных отделах оплачивают похожие сервисы, а общую сумму на ИИ никто не видит.

⚡️Данные. Сотрудники используют личные аккаунты, и рабочая информация может выходить за пределы корпоративного контура.

⚡️Доступы. Человек уходит из компании, а учетная запись с его переписками, файлами и рабочими сценариями остается активной.

⚡️Масштабирование. Готовых инструментов хватает для простых запросов, но для внутренних баз знаний, RAG или аналитики нужны модели, вычислительные мощности и правила работы с данными.

Ограничить использование нейросетей не получится — они уже помогают командам работать быстрее.

Гораздо практичнее сделать их использование видимым:
- дать безопасный доступ к нужным моделям
- определить допустимые данные
- учитывать потребление и заранее продумать инфраструктуру для более сложных задач.
Так ИИ перестаёт быть набором случайных подписок и становится частью корпоративной инфраструктуры.

ITGLOBAL.COM помогает выстроить корпоративную AI-инфраструктуру: организовать доступ к моделям, подключить необходимые сервисы и обеспечить GPU-ресурсы для собственных решений.

Реклама. ООО
"ИТГЛОБАЛКОМ РУС", ИНН 7838413489

Читать полностью…
Subscribe to a channel