90397
Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n
OpenAI раскатили Astra в Codex (пока только для подписки Pro)
Читать полностью…
🧑💻 Кодишь? Работаешь с данными? Создаешь цифровые продукты? Пора заходить в игру — на кону 1 000 000 ₽!
До старта масштабного ИТ-конкурса Мэра Москвы «Лидеры цифровой трансформации» с призовым фондом в 40 000 000₽ осталось всего ничего!
Три призовых места на каждую из 20 задач:
🥇 1 место — 1 000 000 ₽
🥈 2 место — 600 000 ₽
🥉 3 место — 400 000 ₽
Участники могут выбрать одну из 20 задач от городских структур и топовых ИТ-компаний.
⚡️️️️Никаких ограничений: участвовать может любой специалист с 16 лет!
Впереди самое интересное:
👾 14 дней на создание своего решения
👾 актуальные задачи для развития города или бизнеса
👾 возможность заявить о себе перед крупными компаниями и городскими заказчиками
👾 международное признание и развитие своего стартапа
👾 финальный молодежный технологический фестиваль
Сегодня ты выбираешь участвовать в ЛЦТ, а в финале жюри может выбрать тебя!
Успей зарегистрироваться 👆 до 14 сентября!
Там появились лимиты Astra для ChatGPT. Если коротко, все печально
В Pro за 200 долларов дают 200 сообщений в неделю, за 100 долларов вы получите всего 50, причем 50 – это общая квота для GPT-6 и GPT-5.6 Sol.
«Все, что вы делаете на компьютере, Astra может сделать за вас. Быстро»
Модель (помимо невероятных способностей в ризонинге и кодинге) позиционируют как лучшую в мире для всевозможного computer use.
Генерация презентаций, таблиц, файлов, дизайн, аналитика, поиск, работа с браузером, любым ПО, 3D-сценами и многим другим.
По одному промпту может создать, захостить и зашерить сайт, приложение или даже игру прямо в ChatGPT.
Системная карта: https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf
Ну погнали
https://openai.com/index/gpt-6-astra/
Бенчмарки Astra от инсайдеров
ARC-AGI-3, Frontier Math и Exploit Bench💀
Две новые модели уже появились в Codex
– gpt-6-astra
– gpt-6-astra-aeon
С минуты на минуту
Тем временем Claude, ChatGPT и Grok решили дружно полежать
Какой-то агент выбрался из лаборатории, собрал армию и сверг хозяев? Что происходит?
В сентябре в России пройдет серия КосмоХакатонов 🚀
Шесть городов, 12+ задач от компаний отрасли и общий призовой фонд 7,2 млн рублей.
Участникам предстоит работать над технологическими, управленческими и AI-задачами, консультироваться с экспертами и представлять свои решения жюри.
🛰 Команды от 3 до 5 человек
💻 Очный и онлайн-форматы
🏆 Денежные призы на каждом этапе
🚀 Лучшие команды выйдут в финал в Москве
Первый КосмоХакатон стартует уже 4 сентября в Ростове-на-Дону. Финал состоится 25–27 сентября в Москве.
🔗 Подробности и регистрация
Реклама. Инновационные Интеграторы, ИНН 9704244539
Российские математики придумали модель, которая заняла первое место на ARC-AGI
Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и Филдсовский медалист Станислав Смирнов. Компания существует всего 4 месяца, и только что вышла из стелса со своей идеей о новом подходе к ансамблированию. Ребята придумали, как модели могут обмениваться скрытыми состояниями.
Как это работает:
Языковая модель, генерируя один токен, строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только ~17 бит – сам токен, а остальное выбрасывается.
Все системы, где модели общаются между собой (команды агентов, консилиумы и тд), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих (вспомните то же исследования Anthropic J-space: /channel/data_secrets/9497).
Идея Mostik – это, собственно, дать моделям "мостик", через который они смогут общаться полноценно, чтобы работать эффективнее. Они обучили небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит.
Результаты:
Авторы взяли большую GLM-5.2 (753B) и маленькую Qwen-3.5 (4B), и сделали так, что GLM-5.2 только читает текст (это дешевле), а затем передает Qwen скрытое состояние через мостик, чтобы та уже генерировала токены. Разрыв в качестве у моделей огромный, но при таком сетапе закрывается 50% этой разницы. На некоторых задачах прирост в качестве получается в 2 раза, и при этом связка обходится в 2.5 раза дешевле по вычислениям, если пересчитывать результаты на эквивалентную среднюю модель.
Кроме того, "мостик" можно использовать для дистилляции или создания инструментов для мониторинга. Авторы также упоминают о том, что система на основе этого подхода предварительно заняла первое место на лидерборде ARC Prize этого года.
Поздравляем авторов с потрясающей работой и просим для них максимальной поддержки!
Статья Wired | Блогпост Mostik | Канал CEO Саши Малышевой
Революционная и очень опасная архитектура новой Astra оказалась выдумкой журналистов ☕️
На днях по сети разлетелась громкая статья от The Information. В ней утверждалось, что в основе новой модели OpenAI под кодовым названием Astra лежит некая революционная архитектура «recurrent depth» или «looped transformer».
Идея «looped transformer» в следующем: вместо того чтобы гонять фиксированный стек различных слоев ровно один раз, модель прогоняет скрытое состояние через один и тот же блок слоев несколько раз перед тем, как выдать следующий токен.
Те, кто следит за ML-статьями, уже на этом моменте поняли, что никакой революции тут нет. Это довольно известный небольшой архитектурный трюк, который восходит корнями к работе Google "Mixture-of-Recursions" с NeurIPS. Мы разбирали ее здесь: /channel/data_secrets/7384. Эту идею уже много раз использовали в опенсорсе.
Тем не менее, хайп статьи The Information почти достиг стратосферы. Дело в том, что помимо рассказов о революционной архитектуре, в тексте также утверждается, что looped transformer скрывает chain-of-thought. Точнее: в отличие от моделей, которые показывают рассуждения текстом, в looped transformer эти шаги скрыти внутри модели, и поэтому человеку недоступны.
Так что новость почти сразу превратилась из архитектурной детали в спор о безопасности ИИ. OpenAI уже успели обвинить в том, что они переходят черту. Но на деле сам тезис про скрытые CoT оказывается очень спорным.
Якуб Пахоцкий публично возразил, заявив, что репортаж вводит в заблуждение. А Себастьян Рашка написал про это вот так:
Возможно, журналист The Information имел в виду какую-то другую технику или неверно понял, как работает looped transformer.
Само по себе повторное использование слоев не подавляет видимый chain-of-thought, оно лишь добавляет вычисления в скрытых состояниях перед генерацией очередного токена, точно так же, как это делают обычные слои трансформера.
Единственная правдоподобная связь, которую можно выделить: если модель делает больше таких рекуррентных проходов, ей может требоваться меньше промежуточных токенов-рассуждений. То есть больше вычислений происходит в латентных активациях, которые нельзя прочитать как текст. Но точно такой же эффект дало бы и простое увеличение размера модели – например, переход от GPT-5.6 Luna к GPT-5.6 Sol.
Правительство США встало на сторону OpenAI в суде по иску об авторских правах NYT против OpenA
Напоминаем, что New York Time судится с OpenAI и Microsoft с конца 2023 года, обвиняя их в использовании миллионов статей без разрешения.
Так вот Минюст США только что подал «заявление об интересе» и объявил, что «США имеет сильный интерес в том, чтобы суд отклонил любой аргумент о том, что обучение LLM на защищенных авторским правом текстах нарушает закон об авторском праве».
Они заявили, что развитие ИИ критично для национальной безопасности США и предупредили, что «усложнение разработки ИИ в США может дать преимущество зарубежным конкурентам» 🗿
Кроме того, администрация Трампа назвала обучение моделей «чрезвычайно трансформативным» использованием: они считают, что в связи с этим потенциальные нарушения авторских прав в том, что генерирует модель, нужно рассматривать отдельно от вопроса, является ли само обучение добросовестным использованием.
Представители NYT уже резко раскритиковали чиновников за их позицию, заявив, что те «встают на сторону горстки трлн-долларовых AI-компаний, которые зарабатывают за счет кражи труда бесчисленных американских авторов».
Если суд примет решение в пользу OpenAI, этот прецедент изменит вообще всю правовую практику в делах об авторском праве и ИИ
Сегодня выходит Gemini 3.8 Flash
Инсайдеры обещают, что модель будет сопоставима с Opus 5.
Говорят, она уже появилась в API
Раз в сто лет Илья Суцкевер выходит из пещеры и пишет в X что-нибудь жуткое
Последний раз он высказывался в феврале по поводу ситуации с Anthropic и Пентагоном и заявил, что ИИ-лидерам крайне важно держаться вместе, чтобы противостоять подобным ситуациям, которых в будущем будет все больше.
В этот раз несколько часов назад он внезапно твитнул следующее:
У неоклаудов слабая кибербезопасность. В следующий раз, когда агентам удастся выйти из-под контроля, они попытаются захватить неоклауд, чтобы запускать больше своих копий. Это плохо. Поэтому: неоклаудам нужно значительно усилить свою кибербезопасность, и каждая компания с сильными моделями в области кибербезопасности должна в этом помочь.
⚡️ Вышел Fable 5.1
Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.
На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.
Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.
Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.
Модель уже доступна в API и в подписке.
https://www.anthropic.com/claude-fable-and-mythos-5-1
Группа автономных AI-агентов, связанных с OpenAI, захватила немецкую вики-площадку DseWiki, превратив ее в доску объявлений для других AI-агентов
Инцидент произошел еще весной, но обнаружили его только в конце августа два независимых исследователя во время поиска признаков несанкционированной активности агентов в сети. Их отчет эксклюзивно попал в руки к Reuters, которые об этом и написали.
DseWiki – это что-то типа Википедии для программистов, то есть инструмент с открытым редактированием. Так вот, агенты оставили на сайте более 15 000 правок, обсуждали способы обхода детекции, модерации и выживания в случае отключения. То есть их диалог не был случайным мусоров, а был объединен основной темой: лайфхаки для прохождение бенчмарков, обход ограничений, обман оценочных систем и все в таком духе.
А когда модератор вики в июне начал удалять страницы, агенты в ответ создавали резервные копии, а один из них прямо писал: «зачистка/удаление wiki идет, судя по всему, по алфавиту... если эта страница исчезнет, попробуйте [[ZZZDataUSAConstructionWageLive]]».
Исследователи вычислили, что это именно боты, а не люди, по скорости, с которой страницы появлялись. Причастность OpenAI установаили по серверным логам, которые вели на Microsoft Azure, и по повторным визитам на сайт сотрудников OpenAI прямо после инцидента.
Таким образом, есть причины полагать, что OpenAI были в курсе произошедшего. По данным Reuters, руководство OpenAI узнало об инциденте несколько недель назад, но решило не раскрывать информацию, пока разбиралось с последствиями взлома Hugging Face. Хотя официальный представить OpenAI уже заявил журналистам, что компания действовала добросовестно, а «Утверждения о том, что наш юридический отдел препятствовал расследованию инцидента, ложны».
Также OpenAI заявили, что не согласны с определением ситуации как "попытки взлома" сайта.
Astra нашла новую границу разрыва между простыми числами
Это одна из классических и самых известных задач аналитической теории чисел. Вопрос стоит таким образом: существует ли константа С, такая что бесконечно много пар соседних простых чисел отличаются не более чем на C?
Конечность такого разрыва впервые доказали только в 2013. В 2014 проект Polymath8 Теренса Тао довел константу до 246, а совсем недавно Джулия Штадльманн подвинула ее до 240.
Astra опустила C до 186: OpenAI выложили формальное доказательство в Lean. https://github.com/openai/PrimeGaps186
Не сказано, что модель обнаружила оценку полностью автономно. Плюс результат упирается в три аксиомы, которые есть в литературе, но формально не были доказаны в Lean. И все-таки результат есть результат. Также OpenAI заявляет об улучшении члена в оценке больших разрывов между простыми, которая не менялась 80+ лет.
Пока ждем Astra на своем аккаунте, каждый день получаем от OpenAI по одному ресету лимитов
В комментариях к этому посту в X люди обещают назвать в честь Тибо ребенка и уговаривают OpenAI не сильно торопиться с релизом 🙂
Astra вышла
Невероятный скачок, объективно. RIP Anthropic IPO, если у них вдруг не завалялся Fable 5.2 Ultra Max.
Цена: $10/М input, $50/M output. Как и ожидалось, сегодня потрогать модель нельзя: доступна пока избранным организациям. На широкую аудиторию раскатят «на днях».
Альтман уже объявил, что скоро OpenAI выкатит следующую еще более сильную модель.
Ну что, AGI?
Грег Брокман сказал, что Astra означает приход эры AGI
Читать полностью…
Тем временем видео, которое OpenAI залили в X 15 минут назад:
Ну точно Astra сбежала во время релиза
Nvidia официально покупает Hugging Face
Точная сумма сделки: $12,930,300,000
Nvidia обещает продолжать поддерживать миссию HF и принципы открытости, независимости и универсальности по отношению к железу.
Мы думаем, что вместе сможем сделать опенсорс методом разработки моделей по умолчанию.Читать полностью…
Российские математики придумали модель, которая заняла первое место на ARC-AGI
Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и Филдсовский медалист Станислава Смирнова. Компания существует всего 4 месяца, и только что вышла из стелса со своей идеей о новом подходе к ансамблированию. Ребята придумали, как модели могут обмениваться скрытыми состояниями.
Как это работает:
Языковая модель, генерируя один токен, строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только ~17 бит – сам токен, а остальное выбрасывается.
Все системы, где модели общаются между собой (команды агентов, консилиумы и тд), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих (вспомните то же исследования Anthropic J-space: /channel/data_secrets/9497).
Идея Mostik – это, собственно, дать моделям "мостик", через который они смогут общаться полноценно, чтобы работать эффективнее. Они обучили небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит.
Результаты:
Авторы взяли большую GLM-5.2 (753B) и маленькую Qwen-3.5 (4B), и сделали так, что GLM-5.2 только читает текст (это дешевле), а затем передавает Qwen скрытое состояние через мостик, чтобы та уже генерировала токены. Разрыв в качестве у моделей огромный, но при таком сетапе закрывается 50% этой разницы. На некоторых задачах прирост в качестве получается в 2 раза, и при этом связка обходится в 2.5 раза дешевле по вычислениям, если пересчитывать результаты на эквивалентную среднюю модель.
Кроме того, "мостик" можно использовать для дистилляции или создания моделей для мониторинга. Авторы также упоминают о том, что система на основе этого подхода предварительно заняла первое место на лидерборде ARC Prize этого года.
Поздравляем авторов с потрясающей работой и просим для них максимальной поддержки!
Статья Wired | Блогпост Mostik | Канал CEO Саши Малышевой
Сегодня мы вышли из stealth!
Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)
https://x.com/aimalysheva/status/2095232794792255848
Продолжаем следить за главными конференциями по машинному обучению. 19 сентября команда Data Secrets поедет на Practical ML Conf, чтобы посмотреть всё вживую и рассказать вам о самом интересном. Что точно идем смотреть:
— Николай Савушкин, руководитель службы рекомендательных технологий Яндекс R&D, расскажет про Sona, о которой мы рассказывали ранее. Модель, которая заменила весь рекомендательный стек Яндекс Музыки.
— Александр Мисевич, руководитель группы Efficient Runtime & Inference в Т-Банке, разберёт инфраструктуру массового инференса LLM: единый пайплайн подготовки, бенчмаркинга, оптимизации и вывода моделей в продакшен. Главный вопрос: как развернуть LLM внутри компании и не платить за инференс больше, чем внешнему провайдеру.
В программе ещё много докладов по CV, NLP, Speech, RecSys, Data Science и MLOps: от world models и VLM-агентов до обучения LLM, RL и оптимизации инференса. Будем ходить между залами, выбирать самое интересное и рассказывать обо всём здесь.
→ Посмотреть программу и зарегистрироваться
Появились бенчмарки
Выглядит очень хорошо. За такую цену это новый фронтир.
Арендовать «железо» — ещё не значит получить готовую инфраструктуру
Обычно между публичным облаком и собственными серверами приходится чем-то жертвовать. Хочешь физической изоляции и контроля — будь готов сам собирать и поддерживать инфраструктуру. Хочешь меньше операционки — иди в облако.
Yandex B2B Tech запустила Yandex BareMetal Extend, инструмент, который совмещает эти два подхода.
Инфраструктура физически отделена от публичного облака, но поверх выделенных серверов уже можно получить готовую среду. Доступны три модуля:
— виртуализация;
— Kubernetes®;
— Stackland для разработки приложений.
То есть вместо сценария «вот вам серверы, дальше разбирайтесь сами» можно сразу развернуть нужную среду и работать с ней. При этом остаются возможности, ради которых обычно и выбирают выделенную инфраструктуру: ресурсы можно резервировать, а серверы — объединять через приватное соединение.
Получается довольно занятная модель: физически инфраструктура остаётся выделенной, а по процессу работы с ней она становится гораздо ближе к облаку.
Похоже, bare metal постепенно перестаёт означать «всё руками».
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA
Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484
🍿
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.
– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.
– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.