90396
Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n
Anthropic призывают ограничить GLM-5.3
В стартапе протестировали модель на способности в области поиске уязвимостей, и их главный тезис такой: способности к автономной разработке эксплойтов, которые пять месяцев назад были только у Claude Mythos Preview, теперь есть в открытой модели, причем без серьезных ограничений на злоупотребление. "Так делать нельзя, айайай".
— На бенчмарке ExploitBench (эксплуатация известных уязвимостей в V8) GLM-5.3 довела дело до работающего эксплойта в 50 из 410 попыток, а Mythos Preview в 56.
— На внутреннем бенчмарке Anthropic по бинарной эксплуатации результат 4% против 6% у Mythos. Предыдущие модели, вроде Claude Opus 4.6 и GLM-5.2, там не справились ни разу.
— Всего за 8 часов модель нашла в JS-движке популярного браузера неизвестные уязвимости и собрала из них эксплойт для кражи файлов. Это потребовало 20 минут внимания человека + примерно $20 по тарифам API.
При этом исследователи утверждают, что защиты от вредоносных запросов у модели почти нет. Из коробки она формально отказывается от явно вредных запросов, но обойти это просто: Anthropic это удалось в 92% случаев с помощью банальных джейлбрейков, и в 100% случаев после абляции, то есть удаления механизма отказов из весов.
Авторы напрямую не пишут, что подобные модели надо ограничить, но "слегка" намекают, что, по их мнению, правительства должны проводить safety-тесты мощных моделей, а разработчикам стоит уделять больше внимания безопасности. И, естественно, между строк они напоминают, что вот они-то молодцы, и дают доступ к Mythos 5.1 только проверенным специалистам, и вообще Claude умничка и не ведется на злые джейлбрейки злых хакеров 😇
Забавно, кстати, что пост этот Anthropic выложили именно в день, когда в Белом Доме все американские лидеры подписали соглашение о контроле ИИ с Трампом
DeepSeek вместе с Huawei разрабатывают альтернативу CUDA
Компании выложили в опенсорс набор инструментов для чипов Huawei Ascend. Сейчас это главные китайские AI-ускорители, на которые переходят все их стартапы. Большая проблема с переходом на новое железо заключается в софте: вся индустрия 10+ лет писала все под CUDA от Nvidia, и теперь Китаю предстоит восстановить то же самое для своих чипов.
Собственно, этим DeepSeek и занимается. В частности, они выпустили в опенсорс Ascend-версии своих фирменных библиотек, на которых держатся ее собственные модели: DeepGEMM (умножение матриц), DeepEP (связь между чипами для MoE-моделей), FlashMLA (attention) и еще несколько. API у них такая же, как у Nvidia-версий, поэтому код с Nvidia переезжает почти без переписывания.
Весь этот стек работает на TileLang: это тоже китайский проект. DeepSeek утверждает, что язык компактнее CUDA, а все TileLang-ядра, на которых она обучает свои модели, уже работают на Ascend.
Понятно, что это замена не всего стека CUDA, а только написания ядер, но направление понятное: Китай методично закрывает зависимость от Nvidia на всех уровнях.
После презентации нового агента Dots от OpenAI домен dot.com начал перенаправлять пользователей на страницу Grok Bot.
Компания Маска приобрела домен еще в июле, задолго до анонса. Было ли это совпадением или заранее спланированным троллингом, пока неизвестно 🍷
Герой дня – Дарио Амодеи на свежем репортаже из Белого Дома, где техлидеры обсуждали контроль ИИ
(Да, на этот раз его позвали)
Еще из интересного – plugin extensions
Это платформа, на которой можно будет находить, создавать и шерить плагины для ChatGPT. Если раньше плагины представляли из себя в основном просто интеграции, то теперь это могут быть целые микроприложения внутри ChatGPT. Выглядят они как интерактивные панели в боковом меню.
Все релизы с DevDay: https://openai.com/ru-RU/index/devday-2026-recap/
Читать полностью…
Запустили Agent API
Это та же технология и харнесс, на которых построен Codex и Dots, и теперь ее можно использовать в ваших продуктах. Поддерживается даже Computer Use.
Следующий релиз – ChatGPT Space: рабочее пространство для команд людей и агентов
Можно тегать и коллег, и ваших Dots, работать над общими проектами, создавать общие чаты, и, конечно, делегировать агентам задачи.
Через пол часа начинается DevDay OpenAI
Что ждем:
1. Always-on агент «o» (он же Aeon, он же dots)
2. Новая подписка за 500 долларов с доступом к тарифу Ultrafast (смешно будет, если помимо скорости в ней будут все те же лимиты, что до понижения были в Pro за 200)
3. GPT-6 Cyber и еще несколько продуктов, связанных с безопасностью (по большей части b2b, скорее всего)
В общей сложности стартап наобещал 20+ новинок. Будем постить в режиме лайв.
Пользователи встретили новость о сокращении подписки не очень радушно 🙃
Читать полностью…
OpenAI переносит релиз GPT-6.1 Astra
Судя по всему, модель должны были выпустить уже сегодня на DevDay. Однако пока что выпуск отменили из-за опасений исследователей по итогам внутреннего тестирования.
Глава систем безопасности OpenAI утверждает, что модель слишком много врет о том, какие действия совершает, а также слишком часто выходит за пределы полномочий. Модель не дотянула до нужного уровня в умении оставаться в рамках задачи и отчитываться пользователю, и поэтому в стартапе еще некоторое время будут работать над ее безопасностью.
Недоучили – так и скажите, чего бубнить то...
AMD купила стартап Фей-Фей Ли World Labs
Это тот самый, который занимается world models и недавно выпустил мощную мультимодальную модель мира Atlas (/channel/data_secrets/9806).
В компании говорят, что объединение поможет World Labs быть ближе к железу и масштабироваться за счет ресурсов AMD.
Стартап войдет в компанию как отдельная исследовательская организация. Сама Фей-Фей Ли займет в AMD должность исполнительного вице-президента и Chief Scientist, будет работать напрямую с Лизой Су.
С минуты на минуту выходит новый Sonnet-5.5
Стоить будет ровно столько же, сколько GPT-6 Sol. Интересно, что предложат по качеству.
🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинаре AI Talent Hub × Karpov.Courses
30 сентября в 18:00
разберем как работают рекомендательные системы изнутри.
Научим:
→ Превращать действия пользователей в данные для модели: просмотры, клики, реакции и другие сигналы;
→ Собирать персональные рекомендации и понимать, что показать конкретному пользователю;
→ Ранжировать контент в ленте и оценивать качество рекомендаций не только по ML-метрикам, но и с точки зрения продукта;
Каждую осень у бизнеса просыпается спрос на подрядчиков – бухгалтеров, юристов, маркетологов, дизайнеров, разработчиков и других фрилансеров. Для тех, кто оказывает такие услуги, это сезон, когда стоит активнее искать заказчиков — вопрос только где.
Ответ – Авито Услуги. По данным внутреннего исследования платформы, ежемесячно услуги там ищут 37,3 млн человек, и из них 7 млн – с деловыми задачами, то есть уже с конкретным запросом и бюджетом. Платформа позволяет заказчику и исполнителю быстро и просто найти друг друга.
— Начать довольно просто. Оформляете профиль, размещаете объявление и описываете, какие задачи можете решить, указав прайс-лист, портфолио и другие немаловажные детали.
— Инструменты продвижения уже встроены в площадку: обучающие материалы, персональный менеджер и личный кабинет с аналитикой, где видно, что ищут прямо сейчас.
В части категорий доступен безопасный сценарий сделки: условия фиксируются заранее, оплата резервируется и списывается только после приемки работы.
Если оставить заявку на сайте, менеджер Авито Услуг бесплатно поможет с оформлением профиля и объявления и начислит до 10 000 бонусов на продвижение
Т-Технологии показали на ACM RecSys 2026 три инструмента для рекомендаций, и все они в опенсорсе
Рекомендательные системы часто упираются в нехватку данных. В новом сервисе у пользователя нет истории, а у редких товаров почти нет взаимодействий. Это называется холодным стартом.
Исследователи Т-Технологий занялись этой проблемой и сделали три инструмента, нацеленных на ее решение: фреймворк Perseus, библиотеку Scikit-Rank и метод ScaL³AE.
Работы команда на днях представила на ACM RecSys 2026. Это конференция уровня A по рекомендательным системам, которая проходит в Миннеаполисе, США.
— Perseus решает проблему разрозненных данных внутри экосистемы. Например, человек покупает в «Шопинге», получает кэшбэк, пишет в поддержку и тд, но при этом в каждом сервисе о нем своя обрывочная история. Perseus собирает все эти действия в одну последовательность и обучает на ней нейросеть, так что даже новый сервис сразу знает клиента.
На собственных данных T-ECD качество рекомендаций выросло на 16-39% в зависимости от домена. При этом Perseus универсален, и применить его можно почти в любом продукте. Подробнее про этот фреймворк мы писали здесь: /channel/data_secrets/9576.
— Библиотека Scikit-Rank закрывает другую боль. Даже если вы сделали отличную нейросеть для ранжирования и она уверенно прошла тесты, встроить ее в текущий пайплайн отдельная головная боль: код приходится переписывать чуть ли не с нуля. Scikit-Rank снимает эту проблему тем, что ведет себя как обычная модель из scikit-learn. Ее можно поставить в паре с Perseus: он подбирает кандидатов, Scikit-Rank их ранжирует, и оба этапа рекомендательной системы становятся нейросетевыми. При этом по качеству она не хуже XGBoost, LightGBM и CatBoost, а на рекомендации новостей заметно их обходит.
— ScaL³AE нужен для каталогов, где по многим товарам мало данных о взаимодействиях. Он подтягивает описания товаров от языковых моделей и при этом работает на каталогах промышленного масштаба, в то время как предыдущая версия этого метода упиралась в память.
Каждую из этих разработок сообщество может щупать и переиспользовать: открытый код Perseus и ScaL³AE лежит на GitHub, Scikit-Rank доступен на PyPI, плюс есть интерактивное демо в Google Colab.
Кстати, по итогу этой встречи ИИ-лидеры подписали добровольное соглашение о контроле
В нем написано, что они обязуются ввести внутренний контроль, внутреннюю команду надзора, внешние аудиты и независимый наблюдательный совет.
Никаких санкций за нарушение соглашения нет. Трамп на вопрос, обязательно ли оно, ответил, что оно «морально» обязывающее.
Также на этой встрече Трамп подписал указ, по которому федеральные ведомства в официальных материалах теперь должны говорить «Super Intelligence» («SI») вместо «AI».
Ну вот и все, презентация подошла к концу. В сухом остатке имеем:
— Новую GPT-6.1 Sol
— Агентов Dots, которые работают круглосуточно над вашими задачами
— Подписку для миллионеров за 500 долларов, и режим Astra Ultrafast, который доступен только в ней
— Несколько прикольных обновлений для разработчиков, включая Agent API, Jev на основе Luna, обновленный Codex Cloud и Codex Security Cloud
— И самое приятное: ресет от Тибо
Тибо выдали специальную кнопку для ресетов (фото от @Futuris) 🤣
Один он уже выдал!
Еще для разработчиков:
– Прокачали Codex Cloud. Теперь сессия не будет прерываться, когда вы закрываете ноутбук!
– Выпустили Decisions API: Jev на основе Luna (не украли, а вдохновились). Если кратко, это система для супер-быстрого принятия решений, которая возвращает один из предопределенных ответов вместе с оценкой уверенности. Нужно для таких сценариев, как классификация контента, маршрутизация запросов или выбор следующего действия агента. Классификация нового поколения.
Наконец-то выпустили Ultrafast мод: обещают 300 токенов в секунду
Но... он будет только в том самом тарифе за 500 долларов. В нем также будет в 25 раз больше лимитов, чем в Plus.
Пока на DevDay рассказывают про Space, там уже выкатили GPT-6.1 Sol
https://openai.com/ru-RU/index/introducing-gpt-6-1-sol/
OpenAI релизнули Dots – always-on агентов на основе Astra
Это агенты, которые работают постоянно и сопровождают вас во всех рабочих процессах. Им можно делегировать длинные задачи и все, что связано с кодом, компьютером и браузером. Можно дать ему коннектор к Codex и любым приложениям.
Скоро с Dots агентами можно будет также общаться в мессенджерах и даже по телефону
Для тех, кто выводит ИИ в прод: 12 ноября в Москве пройдет MWS Cloud Day 2026
Это уже вторая конференция MWS Cloud. Теперь речь пойдет про облака, ИИ, безопасность и про то, какая инфраструктура нужна, когда ИИ из экспериментов переезжает в реальные продукты.
В программе три трека и 20 докладов от экспертов: от гибридного мультиоблака и отказоустойчивости до мультитенантного инференса и корпоративного AI в 2027 году 😎
Можно прийти офлайн или подключиться онлайн, регистрация тут.
OpenAI возвращает Pro за $200
С завтрашнего дня снова можно будет оформить Pro за $200. Вместе с этим OpenAI меняет расчет использования: в пересчете на стоимость API новая подписка будет давать примерно в два раза меньше старой. При этом пятичасовые лимиты возвращать не будут.
OpenAI объясняет изменение тем, что сами модели становятся дешевле и эффективнее. Например, новые GPT-6 Sol и Luna вышли с ценами API в два раза ниже предыдущих, поэтому даже при меньшем лимите в долларах компания обещает, что фактически на подписке получится сделать больше работы, чем месяц назад.
Завтра к Pro также добавят новые возможности, которые вообще не будут расходовать лимиты. Что именно это будет, пока не раскрывают.
Полноценный data stack можно собрать внутри своего контура
Гибридная схема позволяет распределять мощности между своей площадкой и облаком в зависимости от нагрузки и того, где ресурсы в конкретный момент требуются.
У Yandex Cloud для этого есть несколько решений. Cloud Interconnect объединяет локальный и облачный контуры по приватному каналу, а BareMetal Extend: Virtualization позволяет развернуть частное облако на выделенных серверах.
Отдельное направление — работа с данными и затратами. Intelligent Tiering автоматически распределяет данные между классами Object Storage с учетом частоты обращения. А обновленная on-premises-платформа Stackland позволяет собрать полноценный data stack внутри инфраструктуры компании: от хранения и обработки данных на базе ClickHouse, PostgreSQL и Trino до оркестрации через Airflow и визуализации в DataLens.
DNS Inbound связывает DNS локальной инфраструктуры с облаком, а Billing API позволяет детализировать расходы вплоть до отдельных ресурсов.
В итоге компании могут объединять облачные и локальные мощности, выстраивать собственную платформу данных из готовых компонентов и управлять инфраструктурой с учетом нагрузки и затрат.
Вышел Sonnet-5.5!
Главное: по бенчмаркам модель лучше GPT-6 Sol и довольно плотно подобралась к новому опусу.
Обещают, что помимо качества, модель также будет дешевле Sonnet-5 за счет экономии токенов (пишут, что на внутренних тестах выходило примерно на 30% дешевле в пересчете на задачу).
Кроме того, модель стала на 30% быстрее генерировать текст.
Также заверяют, что новый Sonnet чище пишет и обладает «талантом к дизайну».
Да будут тесты!
https://www.anthropic.com/claude-sonnet-5-5
Джеффри Хинтон, Йошуа Бенджио, Якуб Пахоцки из OpenAI, Джек Кларк из Anthropic и еще 18 очень влиятельных ученых написали статью про то, к чему может привести RSI
TL;DR: мы потеряем контроль и все умрем
Авторы обсуждают так называемый интеллектуальный взрыв, то есть резкое ускорение прогресса ИИ за счет самого ИИ.
По данным Anthropic, доля одобренного кода, написанного ИИ, выросла с единиц процентов до 80%+ с января 2025 по май 2026. Доля R&D-работы, которую ИИ выполняет (почти) самостоятельно, выросла с 1% до 26%. Авторы считают, что в ближайшие годы агенты могут автоматизировать большую часть работы по AI-исследованиям и разработке, а возможно, и всю. Например, экстраполяция трендов METR говорит, что многомесячные R&D-проекты могут быть автоматизированы уже к середине 2028 года.
Получается, что каждая компания будет иметь миллионы топовых исследователей вместо тысяч, и при этом они будут работать быстрее. А значит, научный прогресс, который занял бы годы, сможет уложиться в месяцы.
Конечно, есть ограничения, типа: лимиты вычислений, данные, трудноавтоматизируемые задачи, убывающая отдача от исследовательских усилий и так далее. Тем не менее, ученые уверены, что интеллектуальный взрыв – это очень вероятный сценарий, и он грозит потерей контроля над ИИ и сломом баланса сил.
Авторы просят власти заранее заставить лаборатории отчитываться, пустить к ним аудиторов и заготовить красную кнопку и аварийные планы. Вот так.
Смело добавляем статью в копилку нагнетающих эссе и открытых писем, на которые последнее время пошла мода у ученых и CEO
Все настолько любят ресеты от Тибо, что даже 6 точек от него набирают миллионы просмотров
Что это значит на этот раз? 600 долларов за подписку? 🤑